Anthropic 公布 Glasswing 项目初步进展,探索 AI 安全与能力平衡
近日,AI 研究公司 Anthropic 发布了关于其内部研究项目 Glasswing 的初步更新。该项目主要聚焦于探索大型语言模型在能力扩展过程中,如何更有效地进行安全对齐(Alignment)与风险控制。Anthropic 的研究团队在初步实验中观察到,模型能力的提升与安全约束的施加之间存在复杂的相互作用,并非简单的此消彼长关系。他们正在尝试开发新的方法学与评估框架,以期在推动模型性能边界的同时,系统性地理解和降低潜在风险。此次更新并未披露具体的技术细节或数据,但表明了 Anthropic 在 AI 安全前沿领域持续投入研究的承诺。该项目的后续发现,可能为行业提供关于可扩展对齐(Scalable Alignment)的新思路。
原文来源:https://www.anthropic.com/research/glasswing-initial-update