将“隔离”作为LLM智能体系统安全的首要原则:概念、分类与挑战
随着大语言模型(LLM)智能体逐渐成为复杂系统的“大脑”,其安全范畴已从传统的输入输出内容对齐,扩展至系统行为与现实执行结果。然而,当前研究分散于攻击类型、应用场景和评估基准之间,难以解释提示词注入、工具滥用、记忆污染等故障为何常源于同一结构性原因,以及它们如何在智能体工作流中传播。
近日,一项发布于arXiv的研究首次将“隔离”提升为LLM智能体系统安全的一级设计原则。所谓“隔离”,指的是对用户输入、工具访问、执行通道、智能体间通信以及环境上下文进行有效分离。研究团队提出了一套以边界为中心的分类法,涵盖五大关键边界:用户-智能体、智能体-工具、智能体-执行、智能体-智能体以及系统-环境。
这一框架有助于定位隔离失效的初始发生点,追踪安全威胁在边界间的传播路径,并为每个接口匹配最相关的防御机制。论文进一步总结了跨边界故障路径,讨论了当前面临的开放挑战,并为未来智能体系统实现“构建即隔离”的研究方向提供了路线图。该研究为统一理解LLM智能体安全风险提供了系统性视角,有望推动更健壮、可信的智能体系统设计。