大模型协调内容挤占任务预算?新测试方法RCWT揭示上下文分配难题
在多智能体和大语言模型系统中,协调内容、共享状态、先前讨论、工具输出和角色指令等常被置于同一有限提示词中。这带来了一个实际分配问题:在固定上下文预算下,每个用于协调的token都会挤占任务指令或证据的空间。
来自arXiv的研究团队提出了圆桌上下文窗口测试(RCWT),这是一个用于测量任务预算挤占效应的受控协议。RCWT通过改变协调内容,同时控制总预算、位置顺序、任务类型和评分标准,系统评估协调内容对任务执行的影响。
在W=4096的主要上下文依赖召回任务中,三个商业模型在中等协调开销下仍能保持接近基线性能,但当剩余参考证据降至数百token时,性能会急剧下降。窗口缩放总结与任务特定剩余预算解释一致,而非固定百分比阈值。
为验证当任务证据保持完整时固定预算悬崖是否持续存在,研究增加了完整任务消融实验:保持完整任务/参考块,同时通过扩展总提示长度增加协调token。在该设置下,所有测试调用在GPT-4.1-mini、Claude Haiku 4.5和Gemini 2.5 Flash上均能正确返回每个评分字段,协调比例高达95%。
这项消融实验缩小了结论范围:主要RCWT悬崖最好被解读为任务预算挤占,而非证明协调量本身会在原始开放式任务中引起语义干扰。因此,RCWT是上下文分配预算的测量基础,而非多智能体效益或会话级协调的完整理论。