无需训练!IDEEA实现输入依赖的激活匹配引导

arXiv·8 小时前

近日,一项名为IDEEA(Input-Dependent stEEring via Activation cluster matching)的新方法在arXiv平台发布。该方法为大语言模型(LLM)提供了一种无需训练的输入依赖引导方案。

传统引导方法通常采用输入无关的方式,即对所有输入使用同一引导方向。然而,不同输入在激活空间中占据不同区域,需要针对性的引导才能达到最佳效果。IDEEA通过聚类分析,为每个注意力头构建正负激活支持集,并通过最优匹配问题生成一组与聚类相关的引导方向。

在推理阶段,IDEEA根据输入自身的激活模式,从预设方向池中选择最匹配的引导方向。这种方法不仅有效引导模型朝向目标概念,还能保持输入原有的表示特征。实验表明,激活编码的概念在表示空间中占据多个独立子区域,而非单一区域。

在TruthfulQA基准测试中,IDEEA将真实性与信息率的乘积平均提升了9.9%(最高达23.5%),显著优于现有的输入无关基线方法。这一进展为大语言模型的高效对齐提供了新思路。

大语言模型模型对齐推理优化激活分析arXiv

原文来源:https://arxiv.org/abs/2609.02089

相关阅读

AI智能体如何重塑人类群体的共识形成机制
text2ql框架革新数据库自然语言查询:支持多目标、零LLM模式实现100%执行准确率
无需预设长度!PILL方法显著提升扩散语言模型填充效率
新方法实现大模型知识编辑的精准逆转:只删恶意不改良性
HyGRAIL:融合图神经网络与LLM的智能科学假设发现框架

← 返回