AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
自蒸馏
4 篇相关内容
相关话题
模型训练
模型压缩
推理优化
Qwen
思维链
代码生成
游戏生成
泛化能力
语言模型
强化学习
过程记忆
大语言模型
推理模型瘦身新法:BIRD让大模型学会“少说多思”
研究者提出BIRD自推理蒸馏方法,通过两阶段训练让大模型在保持准确率的同时大幅压缩推理步骤,在数学基准测试中实现效率与精度的双提升。
a
arXiv
·
1 天前
模型压缩
推理优化
自蒸馏
Qwen
a
验证器即课程:基于执行门控的自蒸馏技术实现跨家族游戏生成突破
研究者提出一种基于严格启动验证的自蒸馏方法,通过执行成功率筛选训练样本,使14B参数模型在陌生游戏家族的生成成功率从8.8%提升至42.2%,验证了‘验证器即课程’的核心观点。
a
arXiv
·
7 天前
自蒸馏
代码生成
游戏生成
模型训练
a
语言模型新训练法:过程记忆蒸馏让AI学会自我反思与进化
研究人员提出过程记忆蒸馏方法,让语言模型在训练过程中自动提取并内化跨任务的行为模式,实现参数层面的自我改进。实验显示该方法在多个基准测试中显著优于现有自蒸馏技术。
a
arXiv
·
18 天前
语言模型
模型训练
自蒸馏
强化学习
a
PolicyAlign:无需标注数据,直接让大模型理解并遵守安全政策
研究者提出PolicyAlign框架,允许大语言模型直接根据自然语言描述的安全政策进行对齐,无需依赖传统的标注数据,在提升安全性的同时保持模型通用能力。
a
arXiv
·
26 天前
大语言模型
安全对齐
政策合规
自蒸馏
a