前沿语言模型风险评估新框架:如何量化AI对生化核威胁的“助推”作用
随着前沿语言模型能力不断提升,政策制定者和模型开发者亟需可靠方法,评估模型访问是否会实质增强非专业人士策划化学、生物、放射或核(CBRN)高危威胁的能力——相较于仅使用公开工具。现有CBRN评估在研究定义、威胁范围、基线设定、评分标准和决策规则等方面存在差异,导致跨研究结果难以直接比较。
为此,研究团队提出“阈值超越标准”框架,将助推研究分解为三个可独立执行的模块:确定非专业参与者资格、定义研究的CBRN威胁范围、统计估计实质助推效应。该框架在一项大规模实证研究中得到应用,设计了两种助推形式评估:生成式(模型协助从零创建计划)和修订式(模型协助优化现有计划)。
研究产生了跨CBRN领域的攻击计划,并通过领域专家评审进行评价。应用该框架后,实证研究揭示了领域异质性:在此次受控预发布评估中,模型辅助计划有时获得与专家相当的指导评级,但确认的实质助推效应仅限于放射领域。这些发现为风险缓解和部署治理决策提供了依据,而非描述已部署模型的实际行为。
研究最后总结了未来CBRN助推评估的方法学经验,强调预设标准、明确基线、区分生成式与修订式估计,以及谨慎区分初步筛查信号与确认的风险判定。