贝叶斯提示优化新框架:BayesPO通过并行调温梯度引导提升LLM性能

arXiv·1 天前

近日,arXiv平台发布了一项关于大语言模型提示优化的创新研究。传统提示优化方法多依赖启发式搜索,而该研究团队提出的BayesPO框架将提示优化重新定义为离散提示词上的贝叶斯后验采样问题。

该框架通过结合任务似然项(奖励能解释输入输出示例的提示)和语言模型先验(偏好流畅指令),构建后验分布,将提示优化转化为基于能量的后验采样问题。研究采用Metropolis-Hastings校正的Gibbs-with-Langevin提案机制,并集成并行调温技术,以在大语言模型诱导的复杂能量景观中进行全局探索。

实验使用Qwen2.5模型验证了方法的有效性:在诊断任务中发现语义有意义的提示;在诗歌补全任务中,并行调温帮助跳出局部最优解;在24个指令归纳子任务上优化APE提示后,平均准确率从60.04%提升至63.23%。

研究同时指出当前方法的局限性:能量最小化可能在小优化集上过拟合,且现有采样器计算成本较高。这些发现为概率性提示优化提供了新的研究方向,将贝叶斯提示采样定位为一种有原则的后优化工具。

提示优化贝叶斯方法大语言模型MCMC采样Qwen2.5

原文来源:https://arxiv.org/abs/2607.16001

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回