提示工程“简单”反而更强?研究揭示LLM评估中的“简洁性悖论”

arXiv·4 天前

在大型语言模型(LLM)评估领域,提示工程的复杂度常被默认为与性能正相关。然而,arXiv最新研究《简洁性悖论:破除关于LLM评估中提示与数据集的迷思》通过对8种提示技术、10个MCQA数据集、27种模型配置进行超过43万次评估,得出了颠覆性结论。

研究发现,简单的基线提示法在多数情况下持续优于复杂的推理技术(如思维链)。仅“专家角色”和“归纳角色”的思维链提示能带来约3个百分点的微小提升,而其他复杂方法表现持平或更差,其中“自我类比”提示甚至落后基线达31个百分点。

研究还揭示了三个关键现象:Qwen3-30B-A3B-Thinking-2507模型在Elo评分中意外领先;不同“思考预算”的模型变体存在性能-效率权衡;数据集难度差异极大(最易与最难相差47.5个百分点),60%的基准测试准确率低于70%。

这些结果表明,LLM评估社区可能过度复杂化了提示工程,真正的性能提升空间仍在于模型本身的改进,而非提示优化。该研究呼吁回归更简洁、可复现的评估方法。

大语言模型提示工程模型评估多项选择题问答基准测试

原文来源:https://arxiv.org/abs/2607.14109

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回