AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
推理加速
5 篇相关内容
相关话题
推测解码
线性注意力
状态化模型
GDN模型
参数高效微调
语言模型
计算效率
OpenAI
AI芯片
大语言模型
硬件优化
Kimi
SpecLA:线性注意力模型的高效推测解码方案
研究者提出SpecLA,一种针对状态化线性注意力模型的推测解码运行时系统,通过拓扑感知核验证链与树结构,配合目标对齐的EAGLE风格草稿器,在GDN-1.3B模型上实现最高1.7倍端到端加速。
a
arXiv
·
5 小时前
推测解码
线性注意力
推理加速
状态化模型
a
参数高效微调草案生成遭遇瓶颈:并行推理加速新思路受挫
研究者提出基于PEFT的块扩散草案生成方法,试图通过轻量适配器加速语言模型推理,但实验表明该方法未能实现实际加速效果。
a
arXiv
·
6 天前
推测解码
参数高效微调
推理加速
语言模型
a
OpenAI与博通联手推出专为LLM优化的AI推理芯片Jalapeño
OpenAI与芯片制造商博通合作发布定制AI芯片Jalapeño,该芯片专为大语言模型推理设计,旨在提升AI系统的性能、能效与扩展性。
O
OpenAI
·
26 天前
OpenAI
AI芯片
大语言模型
硬件优化
O
Kimi K2.7 Code 推出高速模式,推理速度提升高达6倍
月之暗面为其开源多模态编程模型 Kimi K2.7 Code 推出高速模式,在编程任务中可实现最高6倍的速度提升,现已面向测试计划成员、API开发者及商业用户逐步开放。
月
月之暗面 Kimi
·
27 天前
快讯
Kimi
代码生成模型
开源模型
推理加速
月
Together AI 推出分布感知推测解码,RL训练后推理速度提升50%
Together AI发布分布感知推测解码技术,针对强化学习训练后的推理瓶颈,可实现高达50%的加速且保持奖励质量无损。
T
Together AI
·
27 天前
推理加速
推测解码
强化学习
Together AI
T