AI智能体不会单独失败:上下文环境先出问题

arXiv·4 天前

在AI智能体开发中,上下文工程已成为确保可靠性的关键环节,但长期以来缺乏系统性的测量方法。最新研究指出,智能体并非孤立失败——其行为受到指令、工具、记忆、检索知识、安全护栏及不可信输入等上下文要素的共同影响。当上下文环境薄弱时,智能体会出现偏离、幻觉、误用工具、忽视约束、易受注入攻击及资源浪费等问题。

该研究通过ProofAgent-Harness开源评估框架,首次实现了对上下文工程质量的独立测量。该框架采用多评审员共识评分机制,从七个维度评估上下文质量:角色清晰度、护栏覆盖度、指令一致性、工具模式质量、事实依据充分性、注入防护强度和令牌效率。重要的是,上下文评分与行为指标和发布决策相隔离,确保了验证的非循环性。

研究通过在受监管的智能体领域进行对照实验发现,在保持前沿大语言模型不变的情况下,仅改变操作上下文环境,上下文质量指标能稳定预测相应的行为结果:事实依据充分性预测抗幻觉能力,护栏覆盖度预测抗操纵能力,指令一致性预测指令遵循程度,工具模式质量预测工具使用效果。这些发现确立了上下文测量作为智能体可靠性的有效预检信号,并将上下文工程定位为可审计的智能体评估与治理层。

AI智能体上下文工程可靠性评估大语言模型AI安全

原文来源:https://arxiv.org/abs/2607.14275

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回