语言模型存在可靠性天花板:信息论揭示性能极限
当前语言模型评估常假设:只要规模足够大,任何任务都能达到完美可靠性。最新研究从信息论角度证明这一假设不成立。任何生成任务都存在可靠性上限,该上限由可观测上下文能解析的输出不确定性决定。
研究将不确定性分解为两部分:可通过额外上下文解决的可解析部分,以及任务模糊性固有的主观部分。自回归生成会进一步降低这一上限,降低速率由任务的依赖核决定——该指标量化了输出中词元间的相关性。
基于这两个基本要素,研究者推导出首个基于第一性原理的扩展定律:语言模型性能受限于更稀缺的资源——训练数据或模型容量。该定律将Chinchilla扩展定律作为特例包含其中,并系统解释了何时扩展能提升可靠性。
除了扩展问题,该框架还统一解释了多种实际现象:检索增强的益处、灾难性遗忘的频谱机制等。研究形式化了控制模型跨领域性能的资源-复杂度权衡,为生成式语言模型的性能极限提供了统一理论。