AI安全标准亟待统一:前沿公司能力阈值差异显著
当前,OpenAI、Anthropic等前沿人工智能公司各自设定了不同的能力安全阈值,这些标准差异显著,给第三方机构带来验证难题——既难以判断某公司是否突破阈值,也无法横向比较各企业的安全要求。更令人担忧的是,缺乏统一最低标准可能导致风险缓解措施参差不齐,引发安全标准的“逐底竞争”。
最新研究针对三大风险领域提出统一阈值制定框架:在滥用风险(网络与生物领域)方面,研究以预期危害为核心指标,采用显式风险建模方法,综合考虑风险传导路径与模型发布条件;对于自动化AI研发风险,则基于观测到的AI进展速率而非预期危害来设定阈值。该研究扩展了先前工作范围,同时揭示了现有实证数据的空白与局限性。
专家指出,这种“各自为政”的阈值设定方式,不仅使监管机构难以实施有效监督,也可能让企业在安全投入上产生投机心理。建立行业公认的基准线,已成为推动AI安全治理的关键一步。