大语言模型也会被诡辩带偏?LoFa基准测试揭示逻辑谬误攻击下的模型脆弱性
大语言模型虽在语义理解上表现优异,但其面对逻辑谬误等操纵性语言模式的抵抗力尚未得到充分研究。以往工作多集中于模型能否识别或分类谬误,而对其在谬误性说服攻击下的稳健性探讨不足。为此,研究团队构建了LoFa(Logical Fallacy)基准测试,专门用于评估LLM抵抗逻辑谬误的能力。
LoFa通过多智能体流程构建,将事实性问题与包含逻辑谬误的论证配对形成测试集。同时,研究还设计了多轮辩论框架,用于评估模型在持续对抗性说服压力下的表现。为区分模型因知识局限导致的错误与真正被谬误说服的情况,团队进一步提出了LFR@k指标,量化模型对谬误攻击的抵抗能力。
实验结果显示,不同大语言模型在面对各类逻辑谬误时表现出明显差异的稳健性水平。某些模型在特定类型的谬误攻击下尤为脆弱,而另一些则展现出相对较强的抵抗力。这一发现揭示了当前大语言模型在逻辑推理和抗干扰能力方面存在的系统性弱点,为后续模型安全性和鲁棒性改进提供了重要参考。研究同时指出,单纯提升模型规模并不一定能增强其抵抗逻辑谬误的能力,需要针对性的训练和架构优化。