AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
BPE分词
1 篇相关内容
相关话题
大语言模型
安全对齐
对抗攻击
模型安全
BPE分词成安全漏洞:字符级扰动如何绕过大语言模型对齐机制
研究发现BPE分词机制会将安全关键词拆分为子词片段,导致字符级扰动能有效绕过主流大语言模型的安全对齐,在五类模型上攻击成功率高达80-100%。
a
arXiv
·
18 天前
大语言模型
安全对齐
BPE分词
对抗攻击
a