小模型也能自我监测?新方法让1B参数模型学会“内省”
传统观点认为,只有大型语言模型才具备自我监测能力,但最新研究打破了这一认知。来自arXiv的研究团队提出“内省微调”方法,成功让参数仅1B的小型模型学会检测自身内部激活的扰动。
研究团队发现,此前采用的二元检测范式(让模型回答“是”或“否”来判断是否检测到注入思想)在小模型中存在混淆问题,因为激活引导会使模型倾向于肯定回答。为此,他们设计了两种无混淆评估范式:句子定位(从N个句子中识别哪个被扰动,随机准确率1/N)和强度比较(判断两个句子哪个接受了更强的注入,随机准确率50%)。
实验涵盖Llama-3.2和Gemma-4两个系列的六个模型,结果显示:参数小至2B的模型已能可靠地进行内省,准确率显著高于随机水平,且内省能力通常随规模增大而增强。但Llama-1B模型表现不佳,准确率仅9.6%。
通过“内省微调”方法——在模型自身扰动前向传递构建的句子定位示例上进行监督微调,Llama-1B的句子定位准确率从9.6%大幅提升至60.6%(提升6倍),在未训练过的强度比较任务上也实现零样本泛化(30.2%→52.2%)。该方法对3B和8B模型同样有效,且对标准能力基准影响甚微。
这项研究表明,内省能力并非仅由模型规模决定,而是可以通过训练直接获得。该方法为提升AI透明度和对齐性提供了新思路,让小型模型也能具备自我监测能力。