AI智能体何时该规划?新研究让AI学会在反应式控制与深思熟虑间切换
人类具备在快速反应决策与缓慢深思熟虑间灵活切换的能力,这种被称为“元推理”的认知机制如何赋予人工智能?最新研究提出了一种基于强化学习的训练框架,让AI智能体学会自主分配计算资源。
该研究将反应式决策建模为从状态观测直接映射到动作的策略,这类策略可通过强化学习或模仿学习训练,但在训练分布之外可能泛化能力较差。相比之下,基于模型的决策时规划能在更广泛状态下产生优质动作,但需要额外计算时间导致行动延迟。
研究团队创新性地引入元推理策略训练方法,该策略通过条件化反应策略的不确定性分数来分配计算资源。当反应策略可能表现不佳时,系统会自动触发规划机制;当反应策略足够可靠时,则采用快速响应模式。在运动规划和导航环境中的实验表明,该方法能有效学习反应策略何时提供“足够好”的动作、何时需要启动规划。
值得注意的是,随着反应策略的改进,元智能体会逐渐转向完全反应式控制,这种动态调整机制使系统能平衡效率与准确性。该研究为开发更接近人类决策模式的AI系统提供了新思路。