Anthropic 详解 Fable 5 网络安全防护与越狱检测框架
近日,Anthropic 在其官网进一步披露了 Fable 5 模型在网络安全方面的技术细节。文章重点介绍了模型内置的网络安全分类器(cyber classifiers)的实际作用范围,明确了哪些类型的内容会被系统主动拦截,哪些则不会受到限制。这有助于用户更清晰地理解模型的安全边界和设计逻辑。
同时,Anthropic 首次提出了一个针对大模型“越狱”(jailbreak)攻击的严重性评估框架草案。该框架旨在对不同类型的提示注入、系统指令绕过等越狱尝试进行标准化分类和严重程度评级,为后续构建更系统化的防御、测试和响应机制奠定了基础。此举显示了 Anthropic 在推进 AI 安全实践和透明度方面的持续努力。
原文来源:https://www.anthropic.com/news/fable-safeguards-jailbreak-framework