语义结构能解释多少人工标注差异?NLI任务中的群体效应与个体上限

arXiv·1 天前

人类在自然语言推理任务中的标注差异正逐渐被视为有效信号而非噪声,但形式语义结构能在多大程度上解释这种差异尚未被直接量化。本研究基于ChaosNLI中的3,113个SNLI和MNLI样本,采用经过验证的基于规则的算子与单调性标注工具,结合三项预注册分析模块,对这一问题展开系统评估。研究得出三重边界结论:首先,在群体层面,非纯粹向上单调的假设句展现出显著更高的标注熵,但长度等因素的回归分析效力有限;其次,在个体层面,形式语义特征仅能解释3.3%至3.6%的熵变异,区分高争议样本的能力较弱;最后,组合不变性分析显示,语义结构虽轻微影响标注分歧程度,但未改变分歧的实质内容。所有分析均基于原始标注一致性较低的样本集,结论受此范围限制。完整研究过程已通过版本控制的研究日志预注册,审计轨迹与修正记录均在论文中公开。

自然语言推理标注差异语义分析ChaosNLI可解释性

原文来源:https://arxiv.org/abs/2607.15870

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回