自进化AI代理新架构:SEA实现实时验证的安全演进

arXiv·19 天前

传统AI学习理论假设数据、评估器和假设空间相对稳定,但自进化代理打破了这一前提——它们会不断修改自身策略。近日arXiv发布的研究提出SEA架构,为解决这一难题提供了新思路。

SEA架构的核心设计是将自修改限制在小型转向适配器中,并用版本化封装包裹冻结的基础模型。每次修改都必须通过实时有效门控,该门控会发出可审计证书,并基于固定错误预算进行验证。系统包含五个循环控制器,它们组合已发布的保证机制。

由于这些门控只能选择冻结基础模型已有的行为,研究团队设计了五种验证器循环机制:最佳N选择、微步搜索、自编写复制预言机、搜索层控制和自我修复。这些机制仅从问题文本就能生成密集、无需人工评分的信号,满足门控需求。

在包含52个实例的SWE-bench验证子集上,对四个基础模型的测试表明,基础能力是主导且无混淆的影响因素。在两个强基础模型上,故意设计的无操作复合控制将套件贡献隔离在+4和+5的提升(GLM 5.2从24到28;GPT从29到34,达到65%最佳水平)。事件日志确认其机制能正常触发并防止性能退化。

研究者指出,当前结果是基于昂贵评估的单次运行,未来工作将包括确认运行间差异和调整每任务算法组合。该架构为安全可控的AI自进化提供了可验证的技术路径。

自进化代理AI安全模型架构实时验证SEA

原文来源:https://arxiv.org/abs/2607.00871

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回