语言模型能否成为神经网络电路的“自动解释员”?

arXiv·27 天前

机制可解释性研究在自动定位神经网络电路方面已取得显著进展,但解释已定位组件的功能仍依赖人工且难以标准化。近日,一项发表于arXiv的研究探讨了语言模型代理在电路解释任务中的辅助能力。

研究团队构建了AgenticInterpBench基准测试,包含84个半合成Transformer电路和163个组件级标注。在此基础上提出了HyVE(假设-验证-解释)代理解释框架,该框架通过观察、假设生成和因果验证的迭代循环分析每个组件,最终输出组件级解释和电路级任务描述。

在四个语言模型骨干上的实验表明,HyVE能够恢复有效的组件级和任务级解释,但没有一个骨干模型在所有任务上表现最优。分析显示,强大的骨干模型通常能形成基于观察的假设,而失败更多出现在验证环节,包括不完整的验证计划、代码执行错误或未解决的假设。

研究还以Llama-3-8B中的算术电路为例,展示了该框架可扩展到自然训练模型。总体而言,语言模型代理在电路解释方面展现潜力,但可靠的验证机制仍是关键挑战。这项工作为自动化神经网络可解释性工具的开发提供了新思路。

机制可解释性语言模型代理神经网络电路TransformerAI可解释性

原文来源:https://arxiv.org/abs/2606.24026

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回