AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
模型训练
19 篇相关内容
相关话题
强化学习
语言模型
推理优化
机器学习
自蒸馏
通义千问
大语言模型
开源工具
教育研究
PyTorch
国产GPU
AI算力
OpenLanguageModel:让小型语言模型训练代码像教科书一样清晰可读
arXiv发布开源PyTorch库OpenLanguageModel,通过模块化设计让小型语言模型的架构代码直观如教科书,支持从教学到完整预训练的无缝迁移。
a
arXiv
·
5 小时前
开源工具
语言模型
模型训练
教育研究
a
摩尔线程WAIC 2026首秀:公开多项AI训练推理实践成果,三大“AI工厂”释放算力价值
在WAIC 2026上,摩尔线程首次公开多项大模型训练与推理实践成果,并展示其三大“AI工厂”如何持续释放国产算力价值。
摩
摩尔线程
·
2 天前
国产GPU
AI算力
模型训练
推理优化
摩
小模型也能自我监测?新方法让1B参数模型学会“内省”
研究者提出“内省微调”方法,让小型语言模型学会检测自身内部激活的扰动,Llama-1B模型准确率从9.6%提升至60.6%。
a
arXiv
·
4 天前
语言模型
模型训练
AI透明度
模型对齐
a
生成模型新发现:示例比参数调节更有效
研究发现生成模型的可调控范围存在“预算”,其中大部分只能通过展示示例而非调节参数来实现,这一发现为AI模型控制提供了新思路。
a
arXiv
·
4 天前
生成模型
AI控制
机器学习
模型训练
a
OriginBlame:AI训练数据集溯源新工具,精准定位数据来源
研究者提出OriginBlame系统,实现记录级和令牌级数据溯源,帮助模型训练者精准识别数据贡献者,大幅减少数据删除范围,提升模型遗忘效率。
a
arXiv
·
5 天前
数据溯源
模型训练
AI伦理
数据管理
a
突破时间限制:大规模点时间语言模型显著缩小性能差距
研究团队通过扩大模型规模至40亿参数,成功构建了消除未来信息泄露的点时间语言模型,在多项基准测试中接近主流开放权重模型的性能水平。
a
arXiv
·
6 天前
语言模型
时间序列
模型训练
开源模型
a
验证器即课程:基于执行门控的自蒸馏技术实现跨家族游戏生成突破
研究者提出一种基于严格启动验证的自蒸馏方法,通过执行成功率筛选训练样本,使14B参数模型在陌生游戏家族的生成成功率从8.8%提升至42.2%,验证了‘验证器即课程’的核心观点。
a
arXiv
·
7 天前
自蒸馏
代码生成
游戏生成
模型训练
a
StickyMoE:让专家模型“记住”路由路径,推理更省内存
研究人员提出StickyMoE训练方法,通过引入路由一致性损失函数,减少相邻token间专家切换频率,从而降低边缘设备推理时的内存交换开销,在保持模型性能的同时显著提升推理效率。
a
arXiv
·
8 天前
MoE模型
模型训练
推理优化
边缘计算
a
合成数据如何更有效?揭秘固定源合成与源扩展的差异
研究区分了合成数据扩展的两种路径:固定源合成与源扩展,发现大预算下增加种子问题优于重复生成回答,为合成协议比较提供了可控框架。
a
arXiv
·
18 天前
合成数据
数据扩展
机器学习
模型训练
a
语言模型新训练法:过程记忆蒸馏让AI学会自我反思与进化
研究人员提出过程记忆蒸馏方法,让语言模型在训练过程中自动提取并内化跨任务的行为模式,实现参数层面的自我改进。实验显示该方法在多个基准测试中显著优于现有自蒸馏技术。
a
arXiv
·
18 天前
语言模型
模型训练
自蒸馏
强化学习
a
医疗AI代理的临床反馈困境:RL在FHIR环境中的诊断与突破
研究发现,在临床FHIR环境中应用强化学习面临两大结构障碍:能力天花板与格式知识壁垒,导致纯RL效果显著落后于规则微调。
a
arXiv
·
18 天前
医疗AI
强化学习
FHIR标准
临床决策
a
LLM智能体遭遇“记忆更新鸿沟”:长期对话中事实更迭成难题
研究发现大型语言模型智能体在多轮对话中难以更新已变更的事实,导致依赖过时信息。研究者创建训练环境Supersede,通过强化学习成功提升模型的事实更新能力。
a
arXiv
·
22 天前
LLM智能体
记忆更新
强化学习
对话系统
a
ATOD:多轮自主智能体训练新方法,融合蒸馏与强化学习优势
研究者提出ATOD混合训练算法,通过退火调度机制结合策略蒸馏与强化学习,显著提升小模型智能体在长程交互任务中的性能表现。
a
arXiv
·
22 天前
模型训练
强化学习
知识蒸馏
自主智能体
a
DeepSeek开源MoE通信库DeepEP,专为高效训练与推理设计
DeepSeek在开源周期间发布首个开源EP通信库DeepEP,专为MoE模型训练与推理优化,支持高性能通信与灵活资源控制。
D
DeepSeek 深度求索
·
27 天前
MoE
开源
通信库
模型训练
D
DeepSeek开源周第四弹:发布V3/R1训练优化并行策略
DeepSeek在开源周第四天发布两项关键并行优化技术:双向流水线并行算法DualPipe和专家并行负载均衡器EPLB,专门针对V3/R1模型训练的计算-通信重叠优化。
D
DeepSeek 深度求索
·
27 天前
快讯
DeepSeek
模型训练
并行计算
开源项目
D
用Hub桶同步万亿参数:TRL引入Delta权重同步新机制
Hugging Face团队在TRL库中推出Delta权重同步功能,通过仅上传模型权重变化而非全部参数,大幅降低大规模模型训练时的存储与同步开销。
H
Hugging Face
·
27 天前
模型训练
分布式计算
Hugging Face
TRL
H
QwQ-32B模型发布:强化学习如何推动大语言模型性能突破
通义千问团队发布QwQ-32B模型,重点探索强化学习在大语言模型训练中的扩展潜力,旨在通过RL技术提升模型的推理与复杂任务处理能力。
通
通义千问 Qwen
·
28 天前
通义千问
QwQ-32B
强化学习
大语言模型
通
通义千问团队提出GSPO算法,旨在解决大语言模型强化学习训练不稳定性难题
针对现有强化学习算法在长周期训练中易出现模型崩溃的问题,通义千问研究团队提出新型GSPO算法,旨在为大语言模型的规模化强化学习训练提供稳定基础。
通
通义千问 Qwen
·
28 天前
强化学习
大语言模型
通义千问
算法优化
通
LLM偏好对齐新思路:如何从海量生成结果中筛选最有价值的比较对?
研究团队提出一种优化LLM偏好对齐训练效率的新方法,通过智能筛选最有信息量的比较对,在相同标注预算下显著提升模型性能。
a
arXiv
·
31 天前
LLM对齐
偏好学习
DPO
采样优化
a