多头部潜在控制:为LLM智能体决策提供统一接口
随着大语言模型越来越多地被部署为智能体,可靠的智能体行为需要超越简单的下一个词预测。在推理时,理想的智能体应该能够决定是否继续当前推理、转交给更强模型、请求额外信息、调用外部工具或在给定设置下弃权。现有方法主要通过提示级路由、外部编排或任务特定微调来解决这些决策,这些方法主要依赖输入侧信号,且随着模型主干演进往往成本高昂、难以维护。
来自arXiv的最新研究提出“多头部潜在控制”,这是一种轻量级层,能够从冻结的LLM或VLM中读取隐藏状态轨迹,生成部署时的控制信号。该系统包含两个头部:能力头部预测当前模型是否能解决实例或应转交给更强协作模型;解析头部预测适当的解析决策(澄清、工具使用、弃权或直接回答)。两个头部仅使用同一冻结LLM主干的潜在轨迹进行训练,无需修改模型即可实现事后适应。
在语言和视觉-语言设置中,多头部潜在控制始终改善多模型系统的质量-成本平衡,实现了基于部分生成的早期交接和更准确的干预决策。在路由执行(小模型+大模型)中,该方法在AndroidWorld上将大模型使用率降低高达90.7%,在基准测试中平均降低27-53%,同时保留大部分大模型性能。此外,学习到的控制信号提高了工具使用决策质量,相对得分增益最高达+158%,错失必需工具调用减少65.5%。该方法为LLM智能体决策提供了统一的接口,有望降低部署成本并提升系统可靠性。