压缩提示与输出:大语言模型的成本与性能博弈
近期一项名为“CAVEWOMAN”的研究揭示了大语言模型在语言输入与输出压缩下的行为差异。研究团队开发了双通道评估协议,从任务准确性、实际成本和参考文本一致性三个维度对模型生成内容进行评分。
实验覆盖了8个模型在5个数据集上的表现,设置了5个压缩级别。结果显示:输出压缩在大多数API模型上能降低实际成本(平均1.4-2.4倍,最佳情况达3倍),在公开定价的四个开源模型上也同样有效。
然而,输入压缩却产生了相反效果——不仅未降低成本,反而使净成本增加(五个基准平均约1.15倍,最差数据集达1.8倍,强压缩下甚至达2.7倍)。这是因为模型会通过生成更长的响应来补偿压缩带来的信息损失,同时准确性显著下降。
研究还发现,在相同设置下,压缩后的表面文本与未压缩的参考生成出现显著分歧。在非推理模型中,约一半的生成内容虽然正确,但其表面文本已无法推导出模型自身的未压缩基线生成。这种分歧在长度控制重评分、多重比较校正和补充语义度量下依然存在。
该研究为优化大语言模型推理成本提供了重要参考,提示开发者应谨慎选择压缩策略。相关代码和数据已在GitHub开源。