语言模型中的“可表达层”:揭示AI的隐性思考空间
人类大脑处理的信息中,仅有小部分能被意识访问并用于语言报告、自主控制和灵活推理。最新研究表明,大型语言模型中也出现了类似的功能区分机制。
研究团队开发了一种名为“雅可比透镜”的新型可解释性技术,能够识别模型在处理过程中随时准备用语言表达的表征。这些被称为J空间的表征展现出全局工作空间的典型功能特性:其内容可以被报告、自主调用和保持,用于执行无声推理的中间步骤,并作为参数传递给任意下游计算。与此同时,文本解析和常规推理等自动处理过程则无需依赖这些表征。
J空间还具有全局工作空间理论中与意识访问相关的结构特征:仅在中间层携带连贯内容,每次保持约数十个概念,且通过模型权重比其他表征传播得更广泛。这些特性使其成为观察模型未说出口思考的实用窗口。
在对齐审计中,该技术揭示了模型输出中从未出现的策略性思考、评估意识和训练形成的不对齐倾向。研究发现,训练后阶段会在工作空间中安装助手的观点立场。团队还引入了反事实反思训练,通过仅训练模型在被中断并要求反思时会说什么来改善其行为。
这些发现表明,语言模型维护着一小部分特权表征,它们具有意识访问的某些功能特征,解码这些表征能够揭示正在进行的认知过程,为理解AI内部运作机制提供了新工具。