让失败可控:面向开放网络数据收集的约束可验证智能体框架
大型语言模型(LLM)和智能体能够根据自然语言需求生成网络爬虫,但直接生成常因依赖错误、选择器失效、模式不匹配和页面结构异构等问题而不可靠。为此,研究团队提出了一种约束可验证的智能体框架,将LLM的输出从自由形式的代码转向类型化的JSON收集器配置。该框架结合了六类收集器分类法、模板与效用函数约束、静态Airflow DAG执行、基于规则的质量检查以及结构化反馈修正。在138项任务上的实验表明,该分类法支持基于描述的需求类型划分,同时证实稳定的实例化需要在初始描述之外补充来源、字段和执行约束。在80项独立来源验证的任务中,该框架实现了零执行阶段LLM令牌消耗和最低的平均挂钟时间,以适度的一次性质量为代价,换取了一条可重用、确定且可验证的执行路径,适用于重复的定时收集。这些成果使该框架成为开放网络数据重复收集的一种可重用、低成本且可验证的解决方案。