提示词格式敏感度:大模型评测中格式包装对准确率的影响
在大型语言模型的评测中,提示词的格式包装(wrapper)往往只涉及标点、换行等微小调整,却可能显著影响模型输出的准确率,甚至翻转排行榜的排名结论。近日一项研究通过 token 控制协议,系统分析了这一现象。
研究团队提出了两个互补的指标:格式敏感度指数(FSI),衡量不同格式包装导致的准确率波动范围;解析敏感度指数(PSI),则对应答案可解析性的变化范围。实验覆盖了 7 个问答任务、5 类提示词包装家族,以及 4 款参数量从 70 亿到 720 亿的指令微调模型,共计 14 万次生成结果。
结果显示,不同模型的平均 FSI 差异可达 30 倍以上,且主要源于模型未能严格遵守输出格式要求。固定效应回归分析表明,即使在控制任务、模型和包装变量后,答案的可解析性仍是准确率的强预测因子。
研究指出,当前许多评测仅报告单一包装下的准确率,在统计上是脆弱的,容易因格式选择而产生误导性结论。为此,作者为基准测试和结构化输出部署提出了实用建议,包括应报告包装引起的方差及格式合规率,以提高评测的稳健性与可比性。