压缩提示与输出:大语言模型的成本与性能博弈

arXiv·27 天前

近期一项名为“CAVEWOMAN”的研究揭示了大语言模型在语言输入与输出压缩下的行为差异。研究团队开发了双通道评估协议,从任务准确性、实际成本和参考文本一致性三个维度对模型生成内容进行评分。

实验覆盖了8个模型在5个数据集上的表现,设置了5个压缩级别。结果显示:输出压缩在大多数API模型上能降低实际成本(平均1.4-2.4倍,最佳情况达3倍),在公开定价的四个开源模型上也同样有效。

然而,输入压缩却产生了相反效果——不仅未降低成本,反而使净成本增加(五个基准平均约1.15倍,最差数据集达1.8倍,强压缩下甚至达2.7倍)。这是因为模型会通过生成更长的响应来补偿压缩带来的信息损失,同时准确性显著下降。

研究还发现,在相同设置下,压缩后的表面文本与未压缩的参考生成出现显著分歧。在非推理模型中,约一半的生成内容虽然正确,但其表面文本已无法推导出模型自身的未压缩基线生成。这种分歧在长度控制重评分、多重比较校正和补充语义度量下依然存在。

该研究为优化大语言模型推理成本提供了重要参考,提示开发者应谨慎选择压缩策略。相关代码和数据已在GitHub开源。

大语言模型推理优化成本控制文本压缩模型评估

原文来源:https://arxiv.org/abs/2606.24083

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回