任务状态表征:让移动端GUI智能体告别“健忘症”

arXiv·19 天前

在移动端图形用户界面自动化任务中,智能体通常依赖“思考-行动-观察”的循环来执行操作。然而,随着任务步骤的增加,智能体往往难以区分持久的任务状态与瞬变的屏幕信息,导致上下文负担过重,出现遗忘初始要求、错误判断进度或重复操作过时界面等问题。

为此,研究团队提出了一种名为“任务状态表征”的轻量级框架。该框架无需额外训练,可作为外部封装层与现有智能体配合使用。它通过三个结构化组件来明确解耦任务状态:全局指令摘要、动态子目标进度跟踪器以及具备状态转移感知的动作验证器。

TSR的核心机制在于利用动作执行前后的视觉对比进行持续更新,从而在不修改智能体底层架构的情况下,有效引导其推理过程。在四项移动GUI基准测试上的实验表明,该框架能显著提升智能体在复杂跨应用及高内存需求任务中的表现,成功率最高提升达12个百分点。这一进展为长程GUI自动化任务的稳定执行提供了新的思路。

GUI智能体任务规划人机交互移动自动化强化学习

原文来源:https://arxiv.org/abs/2607.00502

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回