无需微调!推理时对齐新框架:Spec Learning 用偏好对引导大模型
传统引导大语言模型(LLM)行为的方法通常依赖反复手工调试提示词,过程繁琐且易出错。基于偏好的微调虽更严谨,但成本往往过高。近日,研究人员在 arXiv 上提出名为 Spec Learning 的新框架,试图在两者间找到平衡。该框架仅需简短的用户指令和少量偏好判断,即可将其编译为自然语言形式的规范(specifications),直接在推理时条件化 LLM,无需更新底层模型参数。实验表明,在偏好信号密集的专业领域数据集上,基于编译规范生成的回答往往优于直接偏好优化(DPO)。与不透明的权重更新不同,生成的规范是人类可读的,并可作为产生它们的偏好信号的可解释、透明的书面体现。这一方法为高效、可控地调整大模型行为提供了新思路。