语言模型能否成为神经网络电路的“自动解释员”?
机制可解释性研究在自动定位神经网络电路方面已取得显著进展,但解释已定位组件的功能仍依赖人工且难以标准化。近日,一项发表于arXiv的研究探讨了语言模型代理在电路解释任务中的辅助能力。
研究团队构建了AgenticInterpBench基准测试,包含84个半合成Transformer电路和163个组件级标注。在此基础上提出了HyVE(假设-验证-解释)代理解释框架,该框架通过观察、假设生成和因果验证的迭代循环分析每个组件,最终输出组件级解释和电路级任务描述。
在四个语言模型骨干上的实验表明,HyVE能够恢复有效的组件级和任务级解释,但没有一个骨干模型在所有任务上表现最优。分析显示,强大的骨干模型通常能形成基于观察的假设,而失败更多出现在验证环节,包括不完整的验证计划、代码执行错误或未解决的假设。
研究还以Llama-3-8B中的算术电路为例,展示了该框架可扩展到自然训练模型。总体而言,语言模型代理在电路解释方面展现潜力,但可靠的验证机制仍是关键挑战。这项工作为自动化神经网络可解释性工具的开发提供了新思路。