提示词格式敏感度:大模型评测中格式包装对准确率的影响

arXiv·7 天前

在大型语言模型的评测中,提示词的格式包装(wrapper)往往只涉及标点、换行等微小调整,却可能显著影响模型输出的准确率,甚至翻转排行榜的排名结论。近日一项研究通过 token 控制协议,系统分析了这一现象。

研究团队提出了两个互补的指标:格式敏感度指数(FSI),衡量不同格式包装导致的准确率波动范围;解析敏感度指数(PSI),则对应答案可解析性的变化范围。实验覆盖了 7 个问答任务、5 类提示词包装家族,以及 4 款参数量从 70 亿到 720 亿的指令微调模型,共计 14 万次生成结果。

结果显示,不同模型的平均 FSI 差异可达 30 倍以上,且主要源于模型未能严格遵守输出格式要求。固定效应回归分析表明,即使在控制任务、模型和包装变量后,答案的可解析性仍是准确率的强预测因子。

研究指出,当前许多评测仅报告单一包装下的准确率,在统计上是脆弱的,容易因格式选择而产生误导性结论。为此,作者为基准测试和结构化输出部署提出了实用建议,包括应报告包装引起的方差及格式合规率,以提高评测的稳健性与可比性。

大模型评测提示工程格式敏感度基准测试结构化输出

原文来源:https://arxiv.org/abs/2607.09665

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回