LemonHarness:为长期任务AI代理打造可控执行边界框架

arXiv·27 天前

随着大语言模型代理被应用于更长期的任务,其在多轮迭代中修改工作空间状态的操作日益频繁。然而,传统代理通常只能观察到工具输出和日志片段,而实际的状态变更发生在文件系统中。缺乏明确的工作空间边界导致文件写入、临时产物生成等操作可能分散在不同路径,随时间推移,这些弱约束的变更使得修改文件等状态难以追踪。

近日,研究人员在arXiv上发布LemonHarness技术报告,提出了一种面向长期视野代理的集成执行框架。该框架通过在明确定义的工作空间内约束状态变更操作,将模型调用、工具执行和规则知识统一纳入单一可控边界。状态变更操作(包括文件写入、依赖安装和临时产物创建)均通过结构化工具接口执行,执行反馈被记录为可供后续模型决策使用的观察结果。

系统还引入了可复用的规则知识库,将重复执行规则和验收标准转化为运行时知识。此外,LemonHarness增加了时间感知执行机制,向模型暴露已用时间和剩余预算,使其能够根据时间压力重新平衡探索、实施和验证工作,避免因长时间等待或过度验证导致的超时。

在Terminal-Bench 2.0基准测试中,LemonHarness_GPT-5.3-CodeX在445次试验中达到84.49%的准确率;同一框架搭配更强的GPT-5.5骨干网络后,在五项任务中平均准确率提升至86.52%。结果表明,统一的运行时边界、可调用规则知识和时间感知执行能够有效提升长期视野代理执行的稳定性。

AI代理大语言模型任务执行框架工作空间管理arXiv

原文来源:https://arxiv.org/abs/2606.24311

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回