因果归因剪枝法:精准保留大语言模型推理能力的新策略

arXiv·31 天前

大语言模型在多步推理任务中表现出色,但其庞大的参数量导致推理成本高昂。近日,arXiv平台发布了一项名为“因果归因剪枝”(Causal Attribution Pruning, CAP)的新研究,提出了一种无需训练的模型压缩方法。该方法通过测量注意力头在推理任务中的因果影响来识别关键组件,并以此指导细粒度权重剪枝。

CAP的核心创新在于采用干预式评估:在小型校准数据集上,通过掩蔽特定注意力头并观察性能下降程度,量化每个头对推理功能的实际贡献。这些因果评分随后转换为对应投影矩阵的权重级重要性指标。与传统的幅度剪枝或基于激活的方法不同,CAP直接捕捉每个注意力头的功能贡献,避免了相关性指标的局限性。

实验在Llama-3-8B-Instruct和Mistral-7B-Instruct模型上进行,测试了GSM8K、StrategyQA和ARC-Challenge三个推理基准。在20%稀疏度下,CAP在ARC-Challenge上相比Wanda方法实现了高达61%的相对准确率提升。在中等稀疏度(10%-20%)范围内,该方法在多数模型-基准组合中均优于现有剪枝技术,尤其在Llama-3模型上表现突出。

研究同时指出,当稀疏度达到50%时,由于MLP层的归因粒度较粗,方法效果受限。这项研究表明,基于注意力头层级的因果归因能更有效地保留下游推理性能,为高效大模型部署提供了新思路。

模型压缩因果推理注意力机制大语言模型高效推理

原文来源:https://arxiv.org/abs/2606.19350

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回