AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
泛化能力
3 篇相关内容
相关话题
自蒸馏
代码生成
游戏生成
模型训练
大语言模型
推理优化
知识蒸馏
策略学习
多智能体强化学习
安全约束
约束流形控制
分层学习
验证器即课程:基于执行门控的自蒸馏技术实现跨家族游戏生成突破
研究者提出一种基于严格启动验证的自蒸馏方法,通过执行成功率筛选训练样本,使14B参数模型在陌生游戏家族的生成成功率从8.8%提升至42.2%,验证了‘验证器即课程’的核心观点。
a
arXiv
·
7 天前
自蒸馏
代码生成
游戏生成
模型训练
a
超越轨迹模仿:策略引导优化提升大模型推理能力
研究者提出策略引导策略优化方法,通过提炼可复用的推理策略而非单纯模仿解题步骤,显著提升语言模型的泛化推理能力。
a
arXiv
·
27 天前
大语言模型
推理优化
知识蒸馏
策略学习
a
多智能体强化学习新突破:约束流形控制兼顾安全与泛化
研究人员提出一种分层多智能体强化学习框架,通过约束流形控制实现理论安全保证与高效协调的统一,在保持近乎完美安全率的同时获得优异性能表现。
a
arXiv
·
27 天前
多智能体强化学习
安全约束
约束流形控制
分层学习
a