HALO:让大语言模型学会“精打细算”的推理新方法
近日,一项名为HALO(混合自适应潜在推理)的新技术被提出,旨在解决大语言模型推理效率的难题。该方法的核心思路是:在冻结的预训练大模型基础上,通过自适应地分配额外计算资源来提升性能,而非对所有token进行无差别的密集计算。
传统方法通常采用固定的额外推理步骤,例如对所有token进行一次或两次全局精炼。但研究发现,这种“一刀切”的策略效率低下:单步精炼可能能力不足,而强制对所有token进行二次精炼则会浪费大量算力,且未必能带来性能提升。
HALO创新性地采用了两阶段混合策略:首先进行粗粒度推理,然后通过token评分和单调停止机制,智能筛选出需要进一步精炼的关键token子集进行第二阶段潜在推理。这种“好钢用在刀刃上”的设计,实现了计算资源的动态优化分配。
在基于MMLU-Pro和GPQA-Diamond构建的主流公开基准测试中,HALO在论文对标方法中取得了最佳平均成绩,超越了冻结骨干模型、固定单步和固定双步精炼方法。内部分析进一步显示,HALO在达到接近固定双步精炼准确率的同时,平均使用的精炼步骤比固定单步方法更少,远低于固定双步方法。
这表明,HALO的优势并非单纯增加计算量,而是通过更智能的计算分配策略,以更低的控制器计算成本实现了更强的推理性能。该研究为提升大模型效率提供了新思路,特别是在资源受限场景下具有重要应用价值。