推理模型瘦身新法:BIRD让大模型学会“少说多思”

arXiv·1 天前

当前大语言模型常通过冗长的思维链进行推理,但大量计算消耗在冗余推导、重复自验证和无用路径上。现有自蒸馏方法通过让学生模型模仿自身简洁版本来压缩推理,但存在初始化瓶颈:若从冗余基础模型开始训练,监督信号往往出现在噪声多、已偏离正轨的上下文上,导致学习效率低下。

arXiv最新研究提出BIRD(Bootstrapped Iterative Self-Reasoning Distillation)两阶段自推理蒸馏框架。第一阶段先让基础模型在“简洁指令”下生成解题轨迹,仅保留答案正确的样本,并进行轻量级提示切换微调,将指令诱导的简洁性固化为默认推理模式。第二阶段以此预热模型为起点,采用简洁自教师进行策略性反向KL蒸馏,在更干净、信息更丰富的前缀上进行训练。

在Qwen3系列模型上的实验显示,BIRD在MATH-500和AIME基准上取得了优于提示工程和冷启动蒸馏的精度-效率平衡。以Qwen3-8B为例,MATH-500准确率从86.2%提升至92.0%,同时平均响应长度从3099个token大幅压缩至1115个token,验证了前缀质量对高效推理蒸馏的关键作用。该方法为部署资源受限场景下的高效推理模型提供了新思路。

模型压缩推理优化自蒸馏Qwen思维链

原文来源:https://arxiv.org/abs/2607.15736

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回