小模型也能自我监测?新方法让1B参数模型学会“内省”

arXiv·4 天前

传统观点认为,只有大型语言模型才具备自我监测能力,但最新研究打破了这一认知。来自arXiv的研究团队提出“内省微调”方法,成功让参数仅1B的小型模型学会检测自身内部激活的扰动。

研究团队发现,此前采用的二元检测范式(让模型回答“是”或“否”来判断是否检测到注入思想)在小模型中存在混淆问题,因为激活引导会使模型倾向于肯定回答。为此,他们设计了两种无混淆评估范式:句子定位(从N个句子中识别哪个被扰动,随机准确率1/N)和强度比较(判断两个句子哪个接受了更强的注入,随机准确率50%)。

实验涵盖Llama-3.2和Gemma-4两个系列的六个模型,结果显示:参数小至2B的模型已能可靠地进行内省,准确率显著高于随机水平,且内省能力通常随规模增大而增强。但Llama-1B模型表现不佳,准确率仅9.6%。

通过“内省微调”方法——在模型自身扰动前向传递构建的句子定位示例上进行监督微调,Llama-1B的句子定位准确率从9.6%大幅提升至60.6%(提升6倍),在未训练过的强度比较任务上也实现零样本泛化(30.2%→52.2%)。该方法对3B和8B模型同样有效,且对标准能力基准影响甚微。

这项研究表明,内省能力并非仅由模型规模决定,而是可以通过训练直接获得。该方法为提升AI透明度和对齐性提供了新思路,让小型模型也能具备自我监测能力。

语言模型模型训练AI透明度模型对齐自我监测

原文来源:https://arxiv.org/abs/2607.14111

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回