指令泄露:提示组合式智能体系统中的跨模块干扰现象

arXiv·25 天前

在提示组合式智能体系统的实践中,工程师们反复遇到一种特殊故障:编辑某个提示模块会悄无声息地改变其他模块的行为表现,尽管这些模块之间不存在显式的变量共享或执行依赖关系。研究人员将这种现象形式化为组合行为泄露(CBL),即共享上下文窗口的模块之间产生的相互干扰。

这种干扰的根源在于架构层面的非隔离性:Transformer的自注意力机制无法为拼接的提示模块提供正式边界。研究团队在已部署的工作评估智能体(Claude Sonnet 4.6)上进行了144次实验,通过可复用的三通道协议进行探测——分别从文本量、内容实质和表达形式三个维度扰动非焦点模块。结果显示,仅内容通道产生了可检测的配对效应(Cohen's d = 0.63,自举95%置信区间不包含零),但未出现推荐结果翻转的情况。

这种亚阈值干扰在标准质量评估中难以察觉,却可能在已部署智能体做出的数千次决策中持续累积。值得注意的是,CBL与已知的智能体故障轴(对抗性注入、认知退化、多智能体故障传播、隐私泄露)相互正交。该研究贡献了操作性定义、可复用协议、可证伪预测集和系统级特征描述,确立了跨模块干扰测量作为提示组合式智能体评估的必要环节。

智能体系统提示工程Transformer架构系统评估AI可靠性

原文来源:https://arxiv.org/abs/2606.26356

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回