无需校准模型!新方法让文本作者验证更高效透明

arXiv·8 天前

在法医文本分析领域,作者验证(AV)旨在判断两份文本是否出自同一作者之手。传统方法通常基于评分系统,需要额外的校准模型来获得准确的似然比,这不仅耗时耗力,还需要大量相关数据支持。

近日,一项发表于arXiv的研究提出了两种创新归一化技术——平方根校正和单次词校正。这些方法可直接从LambdaG算法中推导似然比,完全省去了校准模型的需求。研究特别针对长文本或高重复性文本可能导致证据强度高估的问题进行了优化。

通过在15个不同语料库和多种文本长度(100-9500词)上的测试,使用对数似然比成本进行评估,新方法表现与逻辑回归校准相当。其中单次词校正在约45%的测试中表现更优,即使在其表现稍逊的情况下,差距也基本控制在5%以内。

这项突破性技术不仅减少了数据准备时间,还提高了法医文本比较的透明度和可及性,为实际应用场景提供了更高效的解决方案。

自然语言处理法医语言学作者验证文本分析机器学习

原文来源:https://arxiv.org/abs/2607.09501

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回