Polestar:解决扩散大模型推理效率瓶颈,无需训练实现性能突破

arXiv·3 天前

扩散大语言模型(dLLM)的推理效率长期受两大瓶颈制约:双向注意力机制阻碍KV缓存的高效复用,而静态置信度阈值下的解码并行化又可能损害生成质量。最新研究发现,这两个问题均源于同一核心现象——在解码过程中,令牌表征会随着双向注意力的上下文整合而发生“漂移”。基于此洞察,研究团队提出了无需额外训练的推理框架Polestar。该框架创新性地利用令牌表征漂移作为统一信号,通过两个协同组件解决问题:Polestar-Cache通过检测漂移识别过时的KV缓存位置,执行稀疏刷新以实现高效复用;Polestar-Commit则通过捕捉剧烈漂移事件,可靠识别可提交的令牌。在多个dLLM家族的数学与代码基准测试中,Polestar在精度-吞吐量帕累托前沿上刷新了最优记录,实现了最高10.73%的精度提升、3.7倍的吞吐量增长,且每前向传递可并行解码3.67个令牌,显著优于现有基线方法。这一训练后优化方案为扩散模型的落地部署提供了新的效率优化路径。

扩散模型推理优化KV缓存并行解码大语言模型

原文来源:https://arxiv.org/abs/2607.14107

相关阅读

AI评分系统防作弊新突破:自动检测并抑制语言评估中的“捷径依赖”
前沿大模型竟不会“抄作业”?研究者提出2D文本表示新思路
AI在商业案例分析中表现如何?新基准揭示前沿模型已接近专家水平
Loopie:迄今最强循环Transformer模型,IMO/IPhO金牌表现无需工具
对话状态追踪新突破:BERT助力零样本跨领域适应

← 返回