AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
模型压缩
6 篇相关内容
相关话题
机器学习
大语言模型
推理优化
自蒸馏
Qwen
思维链
数据集蒸馏
自然语言处理
开源工具
知识蒸馏
大型语言模型
交互分析
推理模型瘦身新法:BIRD让大模型学会“少说多思”
研究者提出BIRD自推理蒸馏方法,通过两阶段训练让大模型在保持准确率的同时大幅压缩推理步骤,在数学基准测试中实现效率与精度的双提升。
a
arXiv
·
1 天前
模型压缩
推理优化
自蒸馏
Qwen
a
文本数据集蒸馏新方法TAKE:仅需0.1%数据保持任务性能
研究者提出轨迹感知知识估计方法TAKE,可将文本数据集压缩至原规模的0.1%同时保持下游任务性能,为数据密集型NLP研究提供高效解决方案。
a
arXiv
·
6 天前
数据集蒸馏
自然语言处理
模型压缩
机器学习
a
新研究揭示大模型知识蒸馏通用机制:稀疏化交互是关键
研究团队通过交互分解方法,统一解释了知识蒸馏在大型语言模型中的有效机制,并提出一种新的损失函数以提升蒸馏性能。
a
arXiv
·
8 天前
知识蒸馏
大型语言模型
模型压缩
交互分析
a
SeKV:自适应分辨率KV缓存,为长上下文LLM推理提供分层语义记忆
研究人员提出SeKV,一种分辨率自适应的语义KV缓存系统,通过分层存储和按需重建机制,在减少53.3%GPU内存的同时保持模型性能,解决长上下文推理中的内存瓶颈问题。
a
arXiv
·
20 天前
大语言模型
KV缓存
内存优化
长上下文推理
a
TurboQuant:以极致压缩技术重塑AI效率,DeepMind算法新突破
Google DeepMind发布TurboQuant算法,通过极端压缩技术大幅提升AI模型运行效率,为边缘计算与低功耗场景带来突破性解决方案。
G
Google DeepMind
·
26 天前
模型压缩
算法优化
Google DeepMind
边缘计算
G
因果归因剪枝法:精准保留大语言模型推理能力的新策略
研究者提出基于因果归因的剪枝方法CAP,通过评估注意力头对推理任务的实际贡献进行精细权重剪枝,在保持模型性能的同时显著降低计算成本。
a
arXiv
·
31 天前
模型压缩
因果推理
注意力机制
大语言模型
a