AI安全标准亟待统一:前沿公司能力阈值差异显著

arXiv·1 天前

当前,OpenAI、Anthropic等前沿人工智能公司各自设定了不同的能力安全阈值,这些标准差异显著,给第三方机构带来验证难题——既难以判断某公司是否突破阈值,也无法横向比较各企业的安全要求。更令人担忧的是,缺乏统一最低标准可能导致风险缓解措施参差不齐,引发安全标准的“逐底竞争”。

最新研究针对三大风险领域提出统一阈值制定框架:在滥用风险(网络与生物领域)方面,研究以预期危害为核心指标,采用显式风险建模方法,综合考虑风险传导路径与模型发布条件;对于自动化AI研发风险,则基于观测到的AI进展速率而非预期危害来设定阈值。该研究扩展了先前工作范围,同时揭示了现有实证数据的空白与局限性。

专家指出,这种“各自为政”的阈值设定方式,不仅使监管机构难以实施有效监督,也可能让企业在安全投入上产生投机心理。建立行业公认的基准线,已成为推动AI安全治理的关键一步。

AI安全能力阈值风险治理行业标准前沿模型

原文来源:https://arxiv.org/abs/2607.16112

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回