CIPHER:数据科学AI代理新框架,解耦探索与选择提升任务表现
数据科学任务从封闭式信息提取到开放式分析,复杂度高且自动化难度大。当前基于大语言模型的AI代理虽展现出处理此类任务的潜力,但通常依赖单一初始状态驱动整个执行流程,容易因初始状态不佳引发连锁错误。为解决这一问题,研究团队提出CIPHER框架,通过测试时扩展生成多个候选初始状态,并采用解耦的探索-选择机制进行并行执行。
与传统方法不同,CIPHER明确将候选初始状态的生成与策略性选择分离,形成解耦的探索-选择架构。该框架在封闭式和开放式两类数据科学任务基准测试中均表现优异:在同等模型规模对比中超越现有最优方法,即使使用更小的基础语言模型,仍能保持与更大规模基线模型的竞争力。
实证研究深入分析了该框架的设计空间,量化了生成策略、选择策略和聚合模型能力对整体性能的贡献,为实践者提供了可操作的设计建议。这一进展为AI代理在复杂数据科学场景中的鲁棒性提升提供了新思路。