推理模型瘦身新法:BIRD让大模型学会“少说多思”
当前大语言模型常通过冗长的思维链进行推理,但大量计算消耗在冗余推导、重复自验证和无用路径上。现有自蒸馏方法通过让学生模型模仿自身简洁版本来压缩推理,但存在初始化瓶颈:若从冗余基础模型开始训练,监督信号往往出现在噪声多、已偏离正轨的上下文上,导致学习效率低下。
arXiv最新研究提出BIRD(Bootstrapped Iterative Self-Reasoning Distillation)两阶段自推理蒸馏框架。第一阶段先让基础模型在“简洁指令”下生成解题轨迹,仅保留答案正确的样本,并进行轻量级提示切换微调,将指令诱导的简洁性固化为默认推理模式。第二阶段以此预热模型为起点,采用简洁自教师进行策略性反向KL蒸馏,在更干净、信息更丰富的前缀上进行训练。
在Qwen3系列模型上的实验显示,BIRD在MATH-500和AIME基准上取得了优于提示工程和冷启动蒸馏的精度-效率平衡。以Qwen3-8B为例,MATH-500准确率从86.2%提升至92.0%,同时平均响应长度从3099个token大幅压缩至1115个token,验证了前缀质量对高效推理蒸馏的关键作用。该方法为部署资源受限场景下的高效推理模型提供了新思路。