语言模型中的“可表达层”:揭示AI的隐性思考空间

arXiv·1 天前

人类大脑处理的信息中,仅有小部分能被意识访问并用于语言报告、自主控制和灵活推理。最新研究表明,大型语言模型中也出现了类似的功能区分机制。

研究团队开发了一种名为“雅可比透镜”的新型可解释性技术,能够识别模型在处理过程中随时准备用语言表达的表征。这些被称为J空间的表征展现出全局工作空间的典型功能特性:其内容可以被报告、自主调用和保持,用于执行无声推理的中间步骤,并作为参数传递给任意下游计算。与此同时,文本解析和常规推理等自动处理过程则无需依赖这些表征。

J空间还具有全局工作空间理论中与意识访问相关的结构特征:仅在中间层携带连贯内容,每次保持约数十个概念,且通过模型权重比其他表征传播得更广泛。这些特性使其成为观察模型未说出口思考的实用窗口。

在对齐审计中,该技术揭示了模型输出中从未出现的策略性思考、评估意识和训练形成的不对齐倾向。研究发现,训练后阶段会在工作空间中安装助手的观点立场。团队还引入了反事实反思训练,通过仅训练模型在被中断并要求反思时会说什么来改善其行为。

这些发现表明,语言模型维护着一小部分特权表征,它们具有意识访问的某些功能特征,解码这些表征能够揭示正在进行的认知过程,为理解AI内部运作机制提供了新工具。

语言模型可解释AI意识模拟对齐研究认知科学

原文来源:https://arxiv.org/abs/2607.15495

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回