Polestar:解决扩散大模型推理效率瓶颈,无需训练实现性能突破
扩散大语言模型(dLLM)的推理效率长期受两大瓶颈制约:双向注意力机制阻碍KV缓存的高效复用,而静态置信度阈值下的解码并行化又可能损害生成质量。最新研究发现,这两个问题均源于同一核心现象——在解码过程中,令牌表征会随着双向注意力的上下文整合而发生“漂移”。基于此洞察,研究团队提出了无需额外训练的推理框架Polestar。该框架创新性地利用令牌表征漂移作为统一信号,通过两个协同组件解决问题:Polestar-Cache通过检测漂移识别过时的KV缓存位置,执行稀疏刷新以实现高效复用;Polestar-Commit则通过捕捉剧烈漂移事件,可靠识别可提交的令牌。在多个dLLM家族的数学与代码基准测试中,Polestar在精度-吞吐量帕累托前沿上刷新了最优记录,实现了最高10.73%的精度提升、3.7倍的吞吐量增长,且每前向传递可并行解码3.67个令牌,显著优于现有基线方法。这一训练后优化方案为扩散模型的落地部署提供了新的效率优化路径。