因果归因剪枝法:精准保留大语言模型推理能力的新策略
大语言模型在多步推理任务中表现出色,但其庞大的参数量导致推理成本高昂。近日,arXiv平台发布了一项名为“因果归因剪枝”(Causal Attribution Pruning, CAP)的新研究,提出了一种无需训练的模型压缩方法。该方法通过测量注意力头在推理任务中的因果影响来识别关键组件,并以此指导细粒度权重剪枝。
CAP的核心创新在于采用干预式评估:在小型校准数据集上,通过掩蔽特定注意力头并观察性能下降程度,量化每个头对推理功能的实际贡献。这些因果评分随后转换为对应投影矩阵的权重级重要性指标。与传统的幅度剪枝或基于激活的方法不同,CAP直接捕捉每个注意力头的功能贡献,避免了相关性指标的局限性。
实验在Llama-3-8B-Instruct和Mistral-7B-Instruct模型上进行,测试了GSM8K、StrategyQA和ARC-Challenge三个推理基准。在20%稀疏度下,CAP在ARC-Challenge上相比Wanda方法实现了高达61%的相对准确率提升。在中等稀疏度(10%-20%)范围内,该方法在多数模型-基准组合中均优于现有剪枝技术,尤其在Llama-3模型上表现突出。
研究同时指出,当稀疏度达到50%时,由于MLP层的归因粒度较粗,方法效果受限。这项研究表明,基于注意力头层级的因果归因能更有效地保留下游推理性能,为高效大模型部署提供了新思路。