多智能体强化学习新突破:约束流形控制兼顾安全与泛化
多智能体系统在自动驾驶、机器人协作等安全关键领域应用广泛,但现有方法面临根本性困境:基于学习的方法虽能获得优异性能却缺乏理论安全保证,而基于控制理论的方法虽能确保安全却往往导致过于保守和低效的行为。
近日,研究人员在arXiv上发布论文《Safe and Generalizable Hierarchical Multi-Agent RL via Constraint Manifold Control》,提出了一种创新的分层多智能体强化学习框架。该框架通过在底层采用约束流形控制,在温和假设条件下强制执行硬安全约束,同时通过高层策略学习实现有效协调。
这一方法在多智能体环境中提供了理论安全保证,并产生稳定的学习动态,从而实现高效稳定的训练。实验结果表明,该方法在保持近乎完美安全率的同时获得了具有竞争力的性能表现,并且能够有效泛化到不同数量的智能体和障碍物场景中。
该研究为解决多智能体系统中安全与效率的平衡问题提供了新思路,对推动安全关键领域的多智能体应用具有重要意义。技术实现上,约束流形控制为底层安全提供了数学保证,而分层架构则保留了高层策略的灵活性和学习能力。