AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
模型微调
8 篇相关内容
相关话题
大语言模型
强化学习
NVIDIA
PPO
探索算法
生成式AI
Hugging Face
开源工具
推理优化
内存效率
结构化思维
合成数据
PPO-HSC:突破大模型微调“模式坍塌”的新探索式强化学习框架
研究者提出PPO-HSC框架,通过高阶采样覆盖奖励机制,解决大语言模型微调中的模式坍塌问题,在保持性能的同时显著提升解决方案多样性。
a
arXiv
·
5 小时前
强化学习
大语言模型
模型微调
PPO
a
NVIDIA NeMo Automodel 与 🤗 Diffusers 强强联合,规模化微调视频与图像模型
Hugging Face 宣布其 Diffusers 库与 NVIDIA NeMo Automodel 实现集成,旨在简化并规模化视频与图像生成模型的微调流程。
H
Hugging Face
·
3 天前
模型微调
生成式AI
Hugging Face
NVIDIA
H
结构化思维框架:提升大模型推理效率与内存优化新突破
研究者提出结构化思维框架,将推理过程分为探索性草稿与精炼结论交替模块,通过微调使模型掌握结构化推理能力,在数学推理任务中性能提升达8.08%,同时实现85%的上下文内存节省。
a
arXiv
·
7 天前
大语言模型
推理优化
内存效率
结构化思维
a
Omniverse 赋能视觉AI:合成数据与微调提升智能体精准度
NVIDIA 介绍三种基于 Omniverse 平台的合成数据生成与模型微调工作流,旨在提升视觉AI智能体在工业场景中的识别准确性与适应性。
N
NVIDIA AI
·
20 天前
合成数据
计算机视觉
NVIDIA Omniverse
AI智能体
N
NVIDIA NeMo AutoModel:加速Transformer模型微调,简化大模型部署流程
NVIDIA推出NeMo AutoModel工具,旨在通过自动化配置与优化,大幅加速Transformer架构模型的微调过程,降低大模型应用门槛。
H
Hugging Face
·
26 天前
Transformer
NVIDIA
模型微调
自动化工具
H
HIL-ResRL:一小时真机强化学习微调,成功率超95%的视觉语言模型外挂方案
研究人员提出HIL-ResRL框架,通过人类交互式学习与残差强化学习结合,仅需一小时真机微调即可让视觉语言模型在复杂任务中成功率突破95%。
a
arXiv
·
26 天前
强化学习
视觉语言模型
机器人操作
模型微调
a
Together AI与Adaption达成合作:原生集成微调工具至数据平台
Together AI宣布与Adaption建立合作伙伴关系,将Together Fine-Tuning原生集成至Adaptive Data平台,助力团队优化数据集、运行微调、评估结果并部署更强大的开源模型。
T
Together AI
·
27 天前
快讯
模型微调
Together AI
AI工具链
开源模型
T
超越LoRA:探寻更优的大模型微调技术
研究者提出对主流参数高效微调技术LoRA的深入探讨,探索是否存在性能更优的替代方案。
H
Hugging Face
·
27 天前
大语言模型
模型微调
LoRA
参数高效
H