AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
越狱攻击
2 篇相关内容
相关话题
Anthropic
AI安全
大模型
内容审核
大语言模型
安全对齐
模型可解释性
熵分析
Anthropic 详解 Fable 5 网络安全防护与越狱检测框架
Anthropic 首次公开 Fable 5 模型网络安全分类器的具体拦截范围,并发布了越狱攻击严重性评估框架草案。
A
Anthropic
·
18 天前
Anthropic
AI安全
大模型
内容审核
A
破解大模型越狱攻击新视角:中间层熵动态变化暗藏玄机
研究发现,大语言模型在遭遇越狱攻击时,其内部中间层的熵值动态变化会呈现特定模式,这为检测恶意意图提供了新线索。
a
arXiv
·
26 天前
大语言模型
安全对齐
越狱攻击
模型可解释性
a