大模型协调内容挤占任务预算?新测试方法RCWT揭示上下文分配难题

arXiv·6 天前

在多智能体和大语言模型系统中,协调内容、共享状态、先前讨论、工具输出和角色指令等常被置于同一有限提示词中。这带来了一个实际分配问题:在固定上下文预算下,每个用于协调的token都会挤占任务指令或证据的空间。

来自arXiv的研究团队提出了圆桌上下文窗口测试(RCWT),这是一个用于测量任务预算挤占效应的受控协议。RCWT通过改变协调内容,同时控制总预算、位置顺序、任务类型和评分标准,系统评估协调内容对任务执行的影响。

在W=4096的主要上下文依赖召回任务中,三个商业模型在中等协调开销下仍能保持接近基线性能,但当剩余参考证据降至数百token时,性能会急剧下降。窗口缩放总结与任务特定剩余预算解释一致,而非固定百分比阈值。

为验证当任务证据保持完整时固定预算悬崖是否持续存在,研究增加了完整任务消融实验:保持完整任务/参考块,同时通过扩展总提示长度增加协调token。在该设置下,所有测试调用在GPT-4.1-mini、Claude Haiku 4.5和Gemini 2.5 Flash上均能正确返回每个评分字段,协调比例高达95%。

这项消融实验缩小了结论范围:主要RCWT悬崖最好被解读为任务预算挤占,而非证明协调量本身会在原始开放式任务中引起语义干扰。因此,RCWT是上下文分配预算的测量基础,而非多智能体效益或会话级协调的完整理论。

大语言模型多智能体系统上下文管理提示工程性能评估

原文来源:https://arxiv.org/abs/2607.12216

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回