新研究揭示大模型知识蒸馏通用机制:稀疏化交互是关键

arXiv·8 天前

知识蒸馏(KD)在大型语言模型(LLM)中广泛应用,但其有效性的内在机制一直不明确。近日,一项研究提出了一种基于交互的统一框架,揭示了不同KD方法的共同工作原理。研究人员将LLM的输出分数分解为大量交互项之和,每个交互项代表一组输入变量(如词语)之间的非线性关系。分析发现,各种KD方法的通用机制在于交互的稀疏化:学生模型在推理时保留少量关键交互,同时抑制其他交互至零效应。此外,不同KD方法的性能差异源于它们处理复杂交互的能力;能使学生模型实现更高复杂交互稀疏性的方法通常表现更优。基于这一发现,团队提出了一种即插即用的损失函数——复杂交互惩罚(CIP),在蒸馏过程中显式强制复杂交互的稀疏性。大量实验表明,CIP的集成能一致提升多种KD方法在领域内和分布外基准测试上的性能,为优化模型压缩提供了新思路。

知识蒸馏大型语言模型模型压缩交互分析机器学习

原文来源:https://arxiv.org/abs/2607.08776

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回