量化大模型推理的“沉默失败”:正确率背后隐藏的推理空洞化
近日,一项发表于arXiv的研究揭示了大语言模型量化部署中的隐蔽风险:即使模型在量化后保持了任务准确率,其内在推理过程可能已发生根本性改变。研究团队通过对五个指令微调大模型(3B-14B参数)在三种量化精度下的三万个思维链输出进行分析,发现量化可能引发“空洞收敛”现象——模型给出的答案虽然正确,但推理过程不完整或无法验证。
研究采用六类失败分类法,经两名独立标注者验证一致性高达0.906。结果显示,在NF4量化下,空洞收敛现象呈现明显的模型规模依赖性:12B及以上参数模型受影响较小,而较小模型则出现显著变化。这种效应还呈现任务特异性:GSM8K数学推理任务完全免疫,而LogiQA逻辑推理和ARC-Challenge科学问答任务受影响最大。
更值得关注的是,量化可能导致失败模式发生质变。在LLaMA 3.2-3B模型中,NF4量化使“捷径崩溃”在错误答案中的占比从44%升至78%,而“信心雪崩”现象则从15.8%骤降至接近零。研究进一步证实,空洞收敛无法通过表层文本特征可靠检测(最佳F1分数仅0.53),这意味着当前标准评估流程难以捕捉这类部署相关的失败模式。