通义千问团队提出GSPO算法,旨在解决大语言模型强化学习训练不稳定性难题

在推动大语言模型向深度推理与复杂问题解决能力迈进的过程中,强化学习已成为关键范式。然而,实现规模化强化学习面临核心挑战:现有算法在长周期训练中普遍存在严重的不稳定性,甚至可能导致模型性能发生不可逆的退化,制约了算力投入带来的持续性能提升。

为破解这一瓶颈,通义千问研究团队在最新论文中提出了“组序列策略优化”(GSPO)算法。该研究指出,以GRPO为代表的现有方法在训练动态稳定性方面存在不足,而GSPO算法通过创新性的优化机制,致力于构建更稳健的训练过程,为语言模型通过强化学习实现规模化能力突破提供了新的技术路径。这项工作标志着在提升大模型训练可控性与可扩展性方向上的重要探索。

强化学习大语言模型通义千问算法优化模型训练

原文来源:https://qwenlm.github.io/blog/gspo/

相关阅读

通义千问Qwen2.5正式发布,开源阵容再创新高
通义千问开源Qwen2.5-Coder系列:32B版本媲美GPT-4o,覆盖多尺寸与编程语言
通义千问Qwen2.5-Turbo发布:上下文长度突破100万tokens
通义千问发布QwQ模型:以哲学思辨探索认知边界
通义千问发布视觉增强大模型QVQ,探索语言与视觉融合新路径

← 返回