AnovaX:本地化多智能体语音助手,实现LLM规划与自适应恢复

arXiv·1 天前

当前桌面语音助手大多依赖云端处理,将原始音频数据发送至远程服务器,且功能较为固定。近日,一项发布于arXiv的研究提出了AnovaX系统,这是一款完全在用户本地计算机上运行的小型语音助手,其核心理念是将桌面本身作为操作界面。

AnovaX采用单一Python进程整合了唤醒词检测、语音处理流水线、基于大语言模型(使用Gemini)的规划器、安全过滤层、多智能体协调器以及自适应恢复循环。规划器会生成JSON格式的工具调用计划,随后由协调器在有限线程池中创建类型化的子智能体来执行。系统设计了九类专用智能体(如应用控制、输入、浏览器操作等),每类都有独立的超时、重试策略和资源共享锁机制。

值得注意的是,系统包含一个递归元智能体,允许规划器将子目标委托回自身,最多支持两层嵌套。自适应恢复循环采用紧凑的ReAct风格提示,并通过推测执行只读工具来隐藏大模型的响应延迟。此外,配套的Flask服务器在本地WiFi网络中提供手机友好的远程接口,实时镜像所有智能体生命周期事件至手机,并通过MJPEG流传输笔记本电脑屏幕画面,让用户能在另一房间通过手机观看远程命令的执行过程。

该项目的主要目的并非与Siri或Alexa竞争,而是旨在证明一个清晰、仅数千行代码的助手系统,足以实现打开应用、输入内容、执行搜索、协调并发操作、从单步故障中恢复,并完全由另一房间的手机驱动——整个过程无需大语言模型直接接触键盘。

语音助手本地AI多智能体系统LLM规划人机交互

原文来源:https://arxiv.org/abs/2607.15367

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回