对比反思:让AI提示优化像调试代码一样精准
随着大语言模型代理在信息检索中扮演越来越重要的角色——从生成检索查询到合成答案,再到评估检索质量——如何优化控制这些代理的提示词成为关键问题。传统优化方法往往像盲目搜索,但在实际应用中,工程师更需要像调试代码一样精准:需要知道哪些行为失败、哪些相近行为成功、两者区别何在,以及修改后是否在提升效果的同时避免性能倒退。
arXiv最新研究提出“对比反思”框架,为智能检索工作流提供迭代式提示优化方案。该框架以任务为中心定义质量评估标准:问答代理需展示检索或推理轨迹,评分代理需提供维度级分数和依据。利用这些结构化轨迹,系统能识别错误锚定的行为片段,从同一区域添加相近的成功案例,然后请“教师大模型”提出针对性提示修改建议。候选修改只有在验证性能提升时才会被采纳,并可选择进行回归检查。
在公开的HotpotQA检索增强问答测试中,一次基于树形选择器的对比修复就将准确率从51.4%提升至60.4%。仅关注失败案例或随机证据的变体改进较小,且会破坏先前正确的案例。与当前主流提示优化方法对比显示,该框架性能接近最优水平。这项研究为信息检索代理提供了可解释的优化循环,使提示修复过程更可检查、更依赖验证驱动。