AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
推理优化
26 篇相关内容
相关话题
大语言模型
强化学习
内存效率
模型训练
计算效率
arXiv
KV缓存压缩
边缘计算
AI效率
语言模型
成本控制
测试时扩展
推理模型瘦身新法:BIRD让大模型学会“少说多思”
研究者提出BIRD自推理蒸馏方法,通过两阶段训练让大模型在保持准确率的同时大幅压缩推理步骤,在数学基准测试中实现效率与精度的双提升。
a
arXiv
·
20 小时前
模型压缩
推理优化
自蒸馏
Qwen
a
VarRate:无需训练即可实现KV缓存变速率压缩,提升长上下文LLM推理效率
研究人员提出VarRate,一种无需训练的KV缓存压缩方法,通过为每个token分配可变低秩预算,在保持所有token信息的同时显著减少内存占用。
a
arXiv
·
20 小时前
大语言模型
KV缓存压缩
长上下文处理
推理优化
a
摩尔线程WAIC 2026首秀:公开多项AI训练推理实践成果,三大“AI工厂”释放算力价值
在WAIC 2026上,摩尔线程首次公开多项大模型训练与推理实践成果,并展示其三大“AI工厂”如何持续释放国产算力价值。
摩
摩尔线程
·
1 天前
国产GPU
AI算力
模型训练
推理优化
摩
Polestar:解决扩散大模型推理效率瓶颈,无需训练实现性能突破
研究者提出Polestar框架,通过监测表征漂移现象,同时优化KV缓存与解码并行化,在数学与代码任务上实现最高3.7倍吞吐量提升。
a
arXiv
·
3 天前
扩散模型
推理优化
KV缓存
并行解码
a
结构化思维框架:提升大模型推理效率与内存优化新突破
研究者提出结构化思维框架,将推理过程分为探索性草稿与精炼结论交替模块,通过微调使模型掌握结构化推理能力,在数学推理任务中性能提升达8.08%,同时实现85%的上下文内存节省。
a
arXiv
·
6 天前
大语言模型
推理优化
内存效率
结构化思维
a
StickyMoE:让专家模型“记住”路由路径,推理更省内存
研究人员提出StickyMoE训练方法,通过引入路由一致性损失函数,减少相邻token间专家切换频率,从而降低边缘设备推理时的内存交换开销,在保持模型性能的同时显著提升推理效率。
a
arXiv
·
7 天前
MoE模型
模型训练
推理优化
边缘计算
a
HALO:让大语言模型学会“精打细算”的推理新方法
研究者提出HALO方法,通过自适应选择部分关键token进行二次推理,让冻结的预训练大模型以更少的计算成本获得更强的推理能力。
a
arXiv
·
7 天前
大语言模型
推理优化
计算效率
自适应计算
a
GATS:分层世界模型+图增强树搜索,实现高效智能体规划
研究人员提出GATS规划框架,通过分层世界模型与系统化树搜索相结合,在推理阶段完全无需调用大语言模型,显著降低计算成本并实现确定性规划。
a
arXiv
·
7 天前
智能体规划
世界模型
树搜索
大语言模型
a
Kara:滑动窗口KV缓存压缩技术,大幅提升推理大模型服务效率
研究者提出Kara滑动窗口KV缓存压缩方法,通过动态选择重要KV对并扩展为语义块,显著降低大模型推理时的内存占用,提升吞吐量。
a
arXiv
·
17 天前
KV缓存压缩
推理优化
大模型服务
vLLM
a
新算法C3RL:让大语言模型学会“诚实”表达自信度
研究者提出C3RL强化学习算法,解决大模型在强化学习训练后自信度与准确性脱钩的问题,并基于校准后的自信度开发动态推理策略CAS,最高可减少12倍计算开销。
a
arXiv
·
17 天前
大语言模型
强化学习
置信度校准
推理优化
a
BaseRT:苹果芯片原生推理引擎,大模型性能提升超50%
研究人员推出专为苹果芯片设计的原生Metal推理运行时BaseRT,在Qwen3、Llama 3.2等模型上实现比现有方案最高1.56倍的解码吞吐量提升,为边缘设备AI推理提供新方案。
a
arXiv
·
18 天前
推理优化
苹果芯片
边缘计算
大语言模型
a
大模型“想太多”怎么办?新方法DASH让AI学会适时停止思考
研究团队发现语言模型在推理时经常“过度思考”,产生无益的自我反思。他们提出DASH方法,通过评估推理片段的价值来减少无效思考,在数学竞赛基准测试中显著提升准确率。
a
arXiv
·
18 天前
语言模型
推理优化
DASH方法
过度思考
a
GradeSQL框架:用结果奖励模型提升文本转SQL推理可靠性
研究者提出GradeSQL框架,通过训练结果奖励模型对文本转SQL任务进行测试时验证,在BIRD和Spider基准测试中显著优于传统启发式方法。
a
arXiv
·
19 天前
文本转SQL
大语言模型
推理优化
GradeSQL
a
推理模型何时需要“学会停止”?成本感知下的早退机制研究
研究团队提出LearnStop早退机制,在18个任务场景测试中发现:学习型停止规则在自由格式数学任务中表现优异,但在选择题等场景下,传统置信度阈值仍具竞争力。
a
arXiv
·
19 天前
推理优化
早退机制
计算效率
模型部署
a
情感识别新突破:快慢思维协同推理框架MER-R1,让AI更懂情绪
研究发现,显式推理未必提升多模态情感识别准确率,快思维直接作答常优于慢思维深思熟虑。MER-R1框架通过强化学习融合二者优势,实现精准率与召回率的协同优化。
a
arXiv
·
21 天前
多模态情感识别
推理优化
强化学习
大语言模型
a
新框架LBR:通过局部分支路由实现高效可训练的语言模型测试时扩展
研究者提出局部分支路由(LBR)框架,通过轻量级路由机制在推理时扩展局部前瞻树,在数学推理任务中超越了传统思维链方法。
a
arXiv
·
25 天前
语言模型
推理优化
测试时扩展
强化学习
a
压缩提示与输出:大语言模型的成本与性能博弈
研究发现,压缩模型输出可有效降低推理成本,而压缩用户输入反而会增加总成本并损害准确性。
a
arXiv
·
26 天前
大语言模型
推理优化
成本控制
文本压缩
a
超越轨迹模仿:策略引导优化提升大模型推理能力
研究者提出策略引导策略优化方法,通过提炼可复用的推理策略而非单纯模仿解题步骤,显著提升语言模型的泛化推理能力。
a
arXiv
·
26 天前
大语言模型
推理优化
知识蒸馏
策略学习
a
DeepSeek开源MoE通信库DeepEP,专为高效训练与推理设计
DeepSeek在开源周期间发布首个开源EP通信库DeepEP,专为MoE模型训练与推理优化,支持高性能通信与灵活资源控制。
D
DeepSeek 深度求索
·
27 天前
MoE
开源
通信库
模型训练
D
DeepSeek-V3.1发布:迈向智能体时代的第一步,引入混合推理模式
深度求索发布DeepSeek-V3.1模型,首次引入Think与Non-Think混合推理模式,标志着向智能体时代迈出重要一步。新模型在推理速度和智能体任务能力上均有显著提升。
D
DeepSeek 深度求索
·
27 天前
快讯
DeepSeek
大语言模型
智能体
推理优化
D
DeepSeek-V3.2-Exp推理演示版发现RoPE实现不匹配问题
DeepSeek官方提醒用户,早期版本的DeepSeek-V3.2-Exp推理演示存在RoPE实现不匹配问题,可能影响模型性能,目前已修复。
D
DeepSeek 深度求索
·
27 天前
快讯
DeepSeek
大语言模型
技术修复
推理优化
D
Aurora 开源框架发布:让推测解码从静态优化变为持续自进化
Together AI 推出开源强化学习框架 Aurora,可将推测解码从一次性离线配置转变为持续自我改进的系统,实现推理性能动态优化。
T
Together AI
·
27 天前
推理优化
开源框架
推测解码
强化学习
T
Together AI发布推理基准测试:编码代理性能大幅领先
Together AI公布最新推理基准测试,其编码代理在吞吐量、首字延迟和成本方面均显著优于TensorRT-LLM与Claude Opus 4.6。
T
Together AI
·
27 天前
推理优化
编码代理
性能基准
Together AI
T
多语言大模型存在语言锚定现象:代码切换揭示隐藏规律
研究发现多语言大模型处理混合语言输入时性能下降,源于隐藏状态存在语言锚定效应;团队提出CANVAS干预方法,可有效恢复问答准确率。
a
arXiv
·
31 天前
多语言大模型
代码切换
语言锚定
推理优化
a
CacheWeaver:让RAG推理更高效的新方法,可降低首词延迟20-33%
研究人员提出CacheWeaver方法,通过智能排序检索证据来提升RAG推理效率,在保持答案质量的同时将首词生成时间降低约20-33%。
a
arXiv
·
31 天前
RAG
推理优化
缓存技术
大语言模型
a
验证粒度自适应:GRACE框架为测试时扩展找到最优计算效率
研究者提出GRACE理论框架,揭示了验证粒度与计算预算的动态关系,证明在困难问题或充足算力下细粒度验证更优,反之粗粒度更佳。自适应策略在数学推理基准上提升准确率3.1%。
a
arXiv
·
31 天前
大语言模型
推理优化
计算效率
测试时扩展
a