语言模型自我判断干扰正确性探针诊断

arXiv·10 小时前

最新研究揭示语言模型隐藏状态读取器在预测输出正确性时面临语义模糊问题。虽然这些读取器能够预测语言模型输出是否正确,但客观正确性通常与模型自我判断一致,使得解码信号难以区分。研究团队通过构建冲突案例,让客观正确性和自我判断预测相反的读取顺序,发现传统正确性标记对比往往将错误但自我认可的回答排在正确但自我否定的回答之上。

研究估计了自我判断和客观正确性关联方向,并在数学推理和事实回忆任务中评估其极性。在四个参数达140亿的指令调优模型上,自我判断关联方向在所有模型中跨域迁移能力均高于随机水平,而客观正确性关联方向在相应条件下的预期排序点估计值低于随机水平。这种迁移不对称性在中后期层发展形成,在答案可能性、序列长度和零方向控制下持续存在,并延伸至MMLU和二元TruthfulQA任务而无需目标域方向拟合。

研究表明,在所研究的模型和诊断子集中,最可靠可迁移的组件保留了自我判断关联极性。这一发现意味着可迁移性本身并不能确立客观正确性的语义,为语言模型内部表示的解释提供了重要警示。

语言模型模型诊断可解释性自我判断正确性探针

原文来源:https://arxiv.org/abs/2607.16799

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回