大模型与求解器协作中的“叙述鸿沟”:安全风险与缓解策略

arXiv·31 天前

当涉及安全或关键逻辑问题时,SAT、SMT等形式化求解器常被嵌入大模型推理流程,以提供可验证的可靠答案。然而,最新研究揭示,这种协作流程中的“叙述”环节——即将求解器输出转化为用户可读答案的步骤——可能破坏整体可靠性。研究团队将大模型-求解器循环建模为可验证决策过程,并测试了五个开源模型在提示注入攻击下的表现。结果显示,虽然证书验证机制能保证求解器结论的可靠性,但攻击者仍可能通过改写表述或跨通道攻击颠覆已验证结论。研究尝试通过强化提示降低注入风险,但无法完全消除漏洞,且在自适应攻击下依然脆弱。这表明,当前大模型-求解器协作流程的鲁棒性未能延伸至最终用户接收的答案层面。

大语言模型形式化验证安全漏洞提示注入人机协作

原文来源:https://arxiv.org/abs/2606.19588

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回