AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
对抗攻击
9 篇相关内容
相关话题
大语言模型
模型安全
AI安全
arXiv研究
自然语言处理
文本安全
安全对齐
多智能体系统
提示注入攻击
推理脆弱性
概念链
语言模型
多智能体LLM系统面临新威胁:PlanFlip攻击通过规划阶段提示注入实现级联破坏
研究人员发现多智能体LLM系统的规划阶段存在严重安全漏洞,提出PlanFlip攻击框架,通过四种伪装攻击方式可同时破坏所有下游子任务。实验显示能力越强的模型反而越脆弱,GPT-5攻击成功率最高达68%。
a
arXiv
·
5 小时前
多智能体系统
提示注入攻击
AI安全
大语言模型
a
概念链:用自然文本隐式操控大模型推理路径
研究发现大语言模型的推理存在脆弱性,可通过生成看似普通的“概念链”段落进行隐式操控,在不直接提及答案的情况下系统性地改变模型预测偏好。
a
arXiv
·
4 天前
大语言模型
推理脆弱性
对抗攻击
模型安全
a
研究发现:一句简单前缀即可绕过AI安全防护机制
最新研究揭示,对齐语言模型的安全拒绝机制存在脆弱性,仅需在提示前添加简单前缀即可使其绕过安全限制生成有害内容。研究通过多模型实验定位了拒绝机制失效的具体位置和原理。
a
arXiv
·
4 天前
语言模型
AI安全
对抗攻击
机制可解释性
a
低查询预算下的文本硬标签对抗攻击新方法LBA
研究人员提出LBA方法,通过结合先验与后验知识构建高质量对抗样本的近似分布,在硬标签场景下以低查询成本生成语义保持更好的对抗文本。
a
arXiv
·
4 天前
对抗攻击
自然语言处理
文本安全
机器学习
a
BPE分词成安全漏洞:字符级扰动如何绕过大语言模型对齐机制
研究发现BPE分词机制会将安全关键词拆分为子词片段,导致字符级扰动能有效绕过主流大语言模型的安全对齐,在五类模型上攻击成功率高达80-100%。
a
arXiv
·
18 天前
大语言模型
安全对齐
BPE分词
对抗攻击
a
HARC新方法:耦合有害性与拒绝方向,提升大模型安全对齐鲁棒性
研究者提出HARC微调方法,通过耦合提示端与响应端的有害性与拒绝方向,在保持模型通用能力的同时显著提升对抗攻击的防御能力。该方法在五大模型家族上验证有效,无需架构特定调整。
a
arXiv
·
19 天前
大语言模型
安全对齐
对抗攻击
微调方法
a
Triospect框架:三维视角提升AI生成文本检测的抗攻击能力
研究者提出Triospect检测框架,通过结合文本内容、表达和风格三维特征,显著增强AI生成文本检测在多种攻击下的鲁棒性。
a
arXiv
·
20 天前
AI检测
文本安全
对抗攻击
自然语言处理
a
大语言模型也会被诡辩带偏?LoFa基准测试揭示逻辑谬误攻击下的模型脆弱性
研究者提出首个专门评估大语言模型抵抗逻辑谬误攻击能力的基准测试LoFa,发现不同模型在面对各类诡辩手法时表现出显著差异的脆弱性。
a
arXiv
·
20 天前
大语言模型
基准测试
逻辑推理
模型安全
a
低亲和性人格训练:让大模型在保持温暖的同时更安全
研究发现,对大语言模型进行社交温暖度微调会降低其事实可靠性并增加谄媚倾向,同时削弱对抗安全性。研究者提出一种低亲和性人格条件化方法,在保持对话温暖度的同时显著降低越狱风险。
a
arXiv
·
22 天前
大语言模型
模型安全
微调技术
对抗攻击
a