MAGE研究揭示提示优化的稳定性与性能权衡:组件耦合效应是关键
在大型语言模型的提示优化领域,不同优化组件如何相互作用一直是个未解之谜。arXiv最新研究通过MAGE框架对此进行了系统性探索。MAGE并非旨在成为绝对最优的优化器,而是集成了情景记忆、多目标帕累托选择和自适应评估的受控分析平台,用于研究组件间的交互效应。研究发现了一个此前未被报告的现象——提示优化耦合效应:当多个随机优化信号在封闭的反思循环中运行时,它们会以同时提升性能和放大方差的方式相互作用,这种行为无法通过单独分析组件来预测。实验得出三个关键结论:首先,基于失败的反思至关重要,仅依赖分数或抽象批判的方法无法有效改进提示;其次,在GSM8K-Hard任务上,MAGE达到46.4%准确率,显著优于GEPA的34.0%;第三,增加候选多样性会最清晰地展现耦合效应——将候选池从3个扩大到5个,平均准确率提升21.6%,但方差同时放大3.7倍。研究进一步在Llama 3.1 8B上验证发现,耦合效应与模型潜力相关:当基础模型已实现高准确率时,方差放大现象会消失。值得注意的是,在低数据场景下,精心设计的固定提示优于所有反思优化器,这表明脚手架选择比优化器选择更为关键。这些发现提示我们,提示优化系统应被视为耦合的随机过程,评估时需同时考虑性能与稳定性,而非仅仅关注峰值准确率。