参数高效微调草案生成遭遇瓶颈:并行推理加速新思路受挫
在最新发表于arXiv的论文中,研究团队探索了一种名为PEFT-BD的新型推测解码方法。该方法采用类似LoRA的轻量适配器作为块扩散草案生成器,为目标自回归验证模型提供多词元预测。研究动机颇具吸引力:避免分词器不匹配问题、无需加载独立草案模型、仅增加少量可训练参数,并采用BD3LM风格的去噪目标并行生成词元块。
然而,在Qwen3-0.6B模型上的实验却给出了负面结果。尽管该方法能生成有效的接受前缀,但性能分析显示每个推测步骤都需要执行两次完整骨干网络计算:先启用适配器进行草案生成,再禁用适配器进行验证。这使得草案生成器虽然参数高效,但计算效率低下。
这项研究揭示了一个关键发现:成功的推测解码需要草案生成器的计算成本显著低于验证器。仅靠更长的接受前缀无法弥补草案计算与验证器同量级的开销。该结果对当前参数高效微调技术在推理加速领域的应用提出了重要警示,为后续研究划定了明确的技术边界。