Safety Sentry:为AI智能体引入上下文感知的三路安全路由机制
大型语言模型(LLM)智能体通过工具调用与现实世界交互,但一次错误判断就可能导致不可逆的损害。传统防护方案依赖守卫模型对每个拟执行动作进行二元(安全/不安全)分类,但这种简化处理混淆了两个关键决策维度:动作本身是否具有危害性,以及该动作在用户当前上下文环境中是否适宜。
Safety Sentry框架创新性地将安全决策重构为面向每个具体实例的三路路由选择:EXECUTE(直接执行)、ASK(向用户询问确认)、REFUSE(拒绝执行)。该框架仅需单次解码调用即可完成推理,实现轻量级防护。其核心优势在于,通过调整单一解码时阈值,同一检查点模型无需重新训练即可适配不同风险容忍度的部署场景。
实验表明,Safety Sentry在整体准确率和安全相关召回率上均优于一系列开源及前沿闭源基线模型,同时能有效控制双向错误率。这一设计避免了传统方案因在动作类别层面操作而产生的频繁中断——那种例行公事的打断不仅侵蚀用户自主性,还可能使用户对最关键的安全警报产生麻木。研究团队强调,上下文感知的三路决策机制更符合实际应用场景,为LLM智能体的安全部署提供了更精细化的解决方案。