SpecLA:线性注意力模型的高效推测解码方案

arXiv·10 小时前

线性注意力模型通过循环状态替代传统Transformer中不断增长的KV缓存,但在自回归解码过程中仍需逐词元读写状态,计算开销依然显著。推测解码技术可通过单次目标前向传递验证多个草稿词元来降低开销,但现有系统主要针对Transformer架构设计,难以适配状态化线性注意力模型特有的循环依赖与状态轨迹管理需求。

arXiv最新研究提出SpecLA推测解码运行时系统,专门优化状态化线性注意力模型的加速解码。该系统核心创新包括:采用拓扑感知核高效验证链式与树状草稿结构;存储验证过程中产生的紧凑因子以恢复被接受的状态轨迹;结合置信度剪枝与目标对齐的EAGLE风格草稿器,确保提交给验证器的候选词元能有效利用状态化验证资源。

实验在NVIDIA H100平台上以公开GDN-1.3B模型为目标进行测试,SpecLA相比传统自回归解码实现最高1.70倍端到端加速。该工作为线性注意力架构的实际部署提供了重要的推理优化方案,特别适用于需要长序列处理的生成场景。

推测解码线性注意力推理加速状态化模型GDN模型

原文来源:https://arxiv.org/abs/2607.16673

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回