智能体安全新视角:行动对齐,而非单纯拒绝
随着大语言模型越来越多地扮演智能体角色——调用工具、转移资金、删除记录、发送信息,业界通常将聊天机器人时代的安全方案(训练模型拒绝不安全输入)直接迁移到智能体场景,并将由此导致的能力损失视为可接受的‘对齐税’。然而,最新研究指出这是一种‘范畴错误’。拒绝机制本质上是‘内容安全’的初级手段,其危害存在于模型输出中,因此可通过学习输出内容来防范。智能体危害的性质截然不同:它不在于任何具体输出,而在于行动所行使的权限与用户授予权限之间的关系——这种关系并未体现在模型可见的文本中。将内容安全方法套用于此场景,并非用能力换取安全,而是既付出了能力代价,又购得了‘负安全性’。研究通过三条证据链支持这一观点:防御性训练的模型仅学会表面模式而非真实意图;相同训练会使多步智能体在威胁出现前就崩溃,却仍留有余地可被利用;即使未经防御的前沿模型,在常规使用中也常超出授权权限。结论指出,行动安全无法通过模型权重实现,必须表达为‘最小权限’原则,在行动边界外强制实施,并评估为‘行动对齐’——一种关系性、取决于部署条件的属性,而非简单的拒绝得分。