SpecLA:线性注意力模型的高效推测解码方案
线性注意力模型通过循环状态替代传统Transformer中不断增长的KV缓存,但在自回归解码过程中仍需逐词元读写状态,计算开销依然显著。推测解码技术可通过单次目标前向传递验证多个草稿词元来降低开销,但现有系统主要针对Transformer架构设计,难以适配状态化线性注意力模型特有的循环依赖与状态轨迹管理需求。
arXiv最新研究提出SpecLA推测解码运行时系统,专门优化状态化线性注意力模型的加速解码。该系统核心创新包括:采用拓扑感知核高效验证链式与树状草稿结构;存储验证过程中产生的紧凑因子以恢复被接受的状态轨迹;结合置信度剪枝与目标对齐的EAGLE风格草稿器,确保提交给验证器的候选词元能有效利用状态化验证资源。
实验在NVIDIA H100平台上以公开GDN-1.3B模型为目标进行测试,SpecLA相比传统自回归解码实现最高1.70倍端到端加速。该工作为线性注意力架构的实际部署提供了重要的推理优化方案,特别适用于需要长序列处理的生成场景。