Anthropic 推出新基准:评估大语言模型生成漏洞利用的能力

Anthropic·27 天前

近日,Anthropic 在官网宣布推出了两项具有挑战性的新学术基准测试。这两项测试旨在衡量大型语言模型在生成漏洞利用代码方面的能力。同时,该公司还更新了用于评估智能合约漏洞利用的基准测试版本。这些基准测试的推出,反映了业界对 AI 模型安全性和潜在滥用风险的持续关注。通过量化模型在发现和利用安全漏洞方面的“能力”,有助于研究人员和开发者更好地理解模型的风险边界,并推动开发更安全、更可靠的 AI 系统。此举也是 Anthropic 致力于负责任 AI 发展的一部分,旨在为 AI 安全评估提供更严谨、更标准化的工具。

大语言模型AI安全基准测试Anthropic漏洞利用

原文来源:https://www.anthropic.com/research/exploit-evals

相关阅读

Anthropic启动罕见病AI科研资助计划,最高提供5万美元Claude使用额度
Anthropic推出教师专用版Claude,助力教育领域AI应用
加拿大如何应用Claude:AI安全公司的实践探索
Anthropic 投入千万美元支持加拿大 AI 研究,培养下一代创新力量
Claude价值观研究:模型与语言如何影响AI表达倾向

← 返回