无需微调!推理时对齐新框架:Spec Learning 用偏好对引导大模型

arXiv·27 天前

传统引导大语言模型(LLM)行为的方法通常依赖反复手工调试提示词,过程繁琐且易出错。基于偏好的微调虽更严谨,但成本往往过高。近日,研究人员在 arXiv 上提出名为 Spec Learning 的新框架,试图在两者间找到平衡。该框架仅需简短的用户指令和少量偏好判断,即可将其编译为自然语言形式的规范(specifications),直接在推理时条件化 LLM,无需更新底层模型参数。实验表明,在偏好信号密集的专业领域数据集上,基于编译规范生成的回答往往优于直接偏好优化(DPO)。与不透明的权重更新不同,生成的规范是人类可读的,并可作为产生它们的偏好信号的可解释、透明的书面体现。这一方法为高效、可控地调整大模型行为提供了新思路。

大语言模型推理对齐偏好学习arXiv模型控制

原文来源:https://arxiv.org/abs/2606.24004

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回