大语言模型也会被诡辩带偏?LoFa基准测试揭示逻辑谬误攻击下的模型脆弱性

arXiv·20 天前

大语言模型虽在语义理解上表现优异,但其面对逻辑谬误等操纵性语言模式的抵抗力尚未得到充分研究。以往工作多集中于模型能否识别或分类谬误,而对其在谬误性说服攻击下的稳健性探讨不足。为此,研究团队构建了LoFa(Logical Fallacy)基准测试,专门用于评估LLM抵抗逻辑谬误的能力。

LoFa通过多智能体流程构建,将事实性问题与包含逻辑谬误的论证配对形成测试集。同时,研究还设计了多轮辩论框架,用于评估模型在持续对抗性说服压力下的表现。为区分模型因知识局限导致的错误与真正被谬误说服的情况,团队进一步提出了LFR@k指标,量化模型对谬误攻击的抵抗能力。

实验结果显示,不同大语言模型在面对各类逻辑谬误时表现出明显差异的稳健性水平。某些模型在特定类型的谬误攻击下尤为脆弱,而另一些则展现出相对较强的抵抗力。这一发现揭示了当前大语言模型在逻辑推理和抗干扰能力方面存在的系统性弱点,为后续模型安全性和鲁棒性改进提供了重要参考。研究同时指出,单纯提升模型规模并不一定能增强其抵抗逻辑谬误的能力,需要针对性的训练和架构优化。

大语言模型基准测试逻辑推理模型安全对抗攻击

原文来源:https://arxiv.org/abs/2606.31039

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回