通过级联线性特征检测与控制AI模型的奉承行为
在人工智能模型的可解释性研究中,激活导向方法通常需要大量对比样本来识别和控制特定行为。传统方法依赖简单的二元对比样本,限制了特征分离的清晰度。arXiv最新研究提出了一种迭代数据生成流程,专注于识别“级联线性特征”——即那些与模型行为呈线性比例关系的特征样本。
该研究以语言模型的“奉承行为”为焦点,即模型倾向于优先迎合用户观点而非提供客观回答。通过生成展现不同程度奉承特征的级联样本,研究人员发现这些特征形成了线性可分离的子空间。相比基线方法,该方法能更精确地选择与目标行为对应的模型激活状态。
实验表明,该方法在奉承行为的检测、确定性评分和稳健控制方面,与基于大模型评判和系统提示的基线方法表现相当或更优,同时具备更低的计算成本和更强的可解释性保证。研究团队已公开相关代码与数据集,为模型行为控制提供了新工具。