无需训练!IDEEA实现输入依赖的激活匹配引导
近日,一项名为IDEEA(Input-Dependent stEEring via Activation cluster matching)的新方法在arXiv平台发布。该方法为大语言模型(LLM)提供了一种无需训练的输入依赖引导方案。
传统引导方法通常采用输入无关的方式,即对所有输入使用同一引导方向。然而,不同输入在激活空间中占据不同区域,需要针对性的引导才能达到最佳效果。IDEEA通过聚类分析,为每个注意力头构建正负激活支持集,并通过最优匹配问题生成一组与聚类相关的引导方向。
在推理阶段,IDEEA根据输入自身的激活模式,从预设方向池中选择最匹配的引导方向。这种方法不仅有效引导模型朝向目标概念,还能保持输入原有的表示特征。实验表明,激活编码的概念在表示空间中占据多个独立子区域,而非单一区域。
在TruthfulQA基准测试中,IDEEA将真实性与信息率的乘积平均提升了9.9%(最高达23.5%),显著优于现有的输入无关基线方法。这一进展为大语言模型的高效对齐提供了新思路。