AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
安全对齐
4 篇相关内容
相关话题
大语言模型
对抗攻击
BPE分词
模型安全
微调方法
arXiv研究
政策合规
自蒸馏
AI安全
越狱攻击
模型可解释性
熵分析
BPE分词成安全漏洞:字符级扰动如何绕过大语言模型对齐机制
研究发现BPE分词机制会将安全关键词拆分为子词片段,导致字符级扰动能有效绕过主流大语言模型的安全对齐,在五类模型上攻击成功率高达80-100%。
a
arXiv
·
18 天前
大语言模型
安全对齐
BPE分词
对抗攻击
a
HARC新方法:耦合有害性与拒绝方向,提升大模型安全对齐鲁棒性
研究者提出HARC微调方法,通过耦合提示端与响应端的有害性与拒绝方向,在保持模型通用能力的同时显著提升对抗攻击的防御能力。该方法在五大模型家族上验证有效,无需架构特定调整。
a
arXiv
·
19 天前
大语言模型
安全对齐
对抗攻击
微调方法
a
PolicyAlign:无需标注数据,直接让大模型理解并遵守安全政策
研究者提出PolicyAlign框架,允许大语言模型直接根据自然语言描述的安全政策进行对齐,无需依赖传统的标注数据,在提升安全性的同时保持模型通用能力。
a
arXiv
·
26 天前
大语言模型
安全对齐
政策合规
自蒸馏
a
破解大模型越狱攻击新视角:中间层熵动态变化暗藏玄机
研究发现,大语言模型在遭遇越狱攻击时,其内部中间层的熵值动态变化会呈现特定模式,这为检测恶意意图提供了新线索。
a
arXiv
·
26 天前
大语言模型
安全对齐
越狱攻击
模型可解释性
a