通义千问团队提出GSPO算法,旨在解决大语言模型强化学习训练不稳定性难题
在推动大语言模型向深度推理与复杂问题解决能力迈进的过程中,强化学习已成为关键范式。然而,实现规模化强化学习面临核心挑战:现有算法在长周期训练中普遍存在严重的不稳定性,甚至可能导致模型性能发生不可逆的退化,制约了算力投入带来的持续性能提升。
为破解这一瓶颈,通义千问研究团队在最新论文中提出了“组序列策略优化”(GSPO)算法。该研究指出,以GRPO为代表的现有方法在训练动态稳定性方面存在不足,而GSPO算法通过创新性的优化机制,致力于构建更稳健的训练过程,为语言模型通过强化学习实现规模化能力突破提供了新的技术路径。这项工作标志着在提升大模型训练可控性与可扩展性方向上的重要探索。