AnovaX:本地化多智能体语音助手,实现LLM规划与自适应恢复
当前桌面语音助手大多依赖云端处理,将原始音频数据发送至远程服务器,且功能较为固定。近日,一项发布于arXiv的研究提出了AnovaX系统,这是一款完全在用户本地计算机上运行的小型语音助手,其核心理念是将桌面本身作为操作界面。
AnovaX采用单一Python进程整合了唤醒词检测、语音处理流水线、基于大语言模型(使用Gemini)的规划器、安全过滤层、多智能体协调器以及自适应恢复循环。规划器会生成JSON格式的工具调用计划,随后由协调器在有限线程池中创建类型化的子智能体来执行。系统设计了九类专用智能体(如应用控制、输入、浏览器操作等),每类都有独立的超时、重试策略和资源共享锁机制。
值得注意的是,系统包含一个递归元智能体,允许规划器将子目标委托回自身,最多支持两层嵌套。自适应恢复循环采用紧凑的ReAct风格提示,并通过推测执行只读工具来隐藏大模型的响应延迟。此外,配套的Flask服务器在本地WiFi网络中提供手机友好的远程接口,实时镜像所有智能体生命周期事件至手机,并通过MJPEG流传输笔记本电脑屏幕画面,让用户能在另一房间通过手机观看远程命令的执行过程。
该项目的主要目的并非与Siri或Alexa竞争,而是旨在证明一个清晰、仅数千行代码的助手系统,足以实现打开应用、输入内容、执行搜索、协调并发操作、从单步故障中恢复,并完全由另一房间的手机驱动——整个过程无需大语言模型直接接触键盘。