新研究揭示大模型知识蒸馏通用机制:稀疏化交互是关键
知识蒸馏(KD)在大型语言模型(LLM)中广泛应用,但其有效性的内在机制一直不明确。近日,一项研究提出了一种基于交互的统一框架,揭示了不同KD方法的共同工作原理。研究人员将LLM的输出分数分解为大量交互项之和,每个交互项代表一组输入变量(如词语)之间的非线性关系。分析发现,各种KD方法的通用机制在于交互的稀疏化:学生模型在推理时保留少量关键交互,同时抑制其他交互至零效应。此外,不同KD方法的性能差异源于它们处理复杂交互的能力;能使学生模型实现更高复杂交互稀疏性的方法通常表现更优。基于这一发现,团队提出了一种即插即用的损失函数——复杂交互惩罚(CIP),在蒸馏过程中显式强制复杂交互的稀疏性。大量实验表明,CIP的集成能一致提升多种KD方法在领域内和分布外基准测试上的性能,为优化模型压缩提供了新思路。