AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
模型安全
8 篇相关内容
相关话题
大语言模型
对抗攻击
推理脆弱性
概念链
多模态大模型
对抗样本
红队测试
自动化测试
安全对齐
BPE分词
基准测试
逻辑推理
概念链:用自然文本隐式操控大模型推理路径
研究发现大语言模型的推理存在脆弱性,可通过生成看似普通的“概念链”段落进行隐式操控,在不直接提及答案的情况下系统性地改变模型预测偏好。
a
arXiv
·
4 天前
大语言模型
推理脆弱性
对抗攻击
模型安全
a
多智能体框架自动生成对抗样本,提升多模态大模型安全防御能力
研究团队提出一种自动化多智能体红队测试框架,通过迭代生成和验证困难样本,显著提升多模态大模型在内容安全任务中的鲁棒性。
a
arXiv
·
4 天前
多模态大模型
对抗样本
红队测试
模型安全
a
BPE分词成安全漏洞:字符级扰动如何绕过大语言模型对齐机制
研究发现BPE分词机制会将安全关键词拆分为子词片段,导致字符级扰动能有效绕过主流大语言模型的安全对齐,在五类模型上攻击成功率高达80-100%。
a
arXiv
·
18 天前
大语言模型
安全对齐
BPE分词
对抗攻击
a
大语言模型也会被诡辩带偏?LoFa基准测试揭示逻辑谬误攻击下的模型脆弱性
研究者提出首个专门评估大语言模型抵抗逻辑谬误攻击能力的基准测试LoFa,发现不同模型在面对各类诡辩手法时表现出显著差异的脆弱性。
a
arXiv
·
20 天前
大语言模型
基准测试
逻辑推理
模型安全
a
多语言微调暗藏安全风险:良性数据也会削弱大模型安全性
最新研究发现,使用良性多语言数据微调大语言模型,可能意外导致模型对恶意提示的防御能力下降,且安全影响在不同语言间差异显著。
a
arXiv
·
21 天前
大语言模型
模型安全
多语言
微调
a
低亲和性人格训练:让大模型在保持温暖的同时更安全
研究发现,对大语言模型进行社交温暖度微调会降低其事实可靠性并增加谄媚倾向,同时削弱对抗安全性。研究者提出一种低亲和性人格条件化方法,在保持对话温暖度的同时显著降低越狱风险。
a
arXiv
·
22 天前
大语言模型
模型安全
微调技术
对抗攻击
a
语音理解模型选择性遗忘:解决功能残留问题的新方法
研究者发现语音理解模型在遗忘特定功能时存在‘能力残留’问题,并提出BSU框架在表示层隔离并削弱意图条件映射,实现更彻底的功能遗忘。
a
arXiv
·
27 天前
语音理解
模型安全
能力遗忘
自回归模型
a
DeepMind提出机器学习遗忘审计新框架,为AI数据删除提供验证标准
Google DeepMind发布全新框架,旨在系统性地审计机器学习模型中的“遗忘”过程,为数据删除合规性提供可验证的技术方案。
G
Google DeepMind
·
27 天前
机器学习
数据隐私
算法审计
Google DeepMind
G