扩散大语言模型存在位置偏见?新研究揭示查询放置对生成质量的关键影响
在自回归大语言模型中,上下文学习机制已得到广泛研究,但扩散大语言模型中的上下文学习机制仍鲜为人知。与受单向因果掩码限制的自回归模型不同,扩散大语言模型本质上采用双向注意力机制,为查询放置提供了更大的空间灵活性。然而,当前实践通常沿用自回归风格的尾随查询模板,往往忽视了结构范式的转变。
最新研究表明,查询位置实际上是扩散大语言模型中的一阶变量。通过实证解耦分析,研究人员发现位置变化对生成质量的影响与示例语义质量的影响相当。这种位置敏感性源于注意力流中的空间“近因效应”以及解码轨迹中与任务相关的偏移。
为在缺乏真实标签的情况下缓解这种不稳定性,研究团队发现传统的单步置信度指标在扩散大语言模型中失效。为此,他们提出了平均置信度这一新指标,通过跟踪迭代解码过程来评估模型性能。通过建立基础的空间上下文学习基准,团队开发了Auto-ICL——一种无需训练的自适应路由策略,能够动态优化查询放置,在异构推理和感知任务中稳健地接近最优性能。