迈向可审计的AI科学家:LLM智能体的假设演化协议
在人工智能驱动的科学探索中,大型语言模型(LLM)智能体正逐渐成为关键角色。它们凭借广泛的知识储备、灵活的推理能力以及工具使用技能,有望通过自主提出假设、验证假设并依据证据更新认知的循环,推动科学问题的解决。然而,现有智能体的假设生成、测试与信念更新过程通常隐藏在非结构化的日志中,缺乏让智能体或研究人员审计这些流程的有效机制。
为解决这一挑战,研究团队在arXiv平台发布新论文,提出名为“假设演化协议”(Hypothesis Evolution Protocol, HEP)的智能体框架。HEP将假设的生成、评估与演化设计为显式且可审计的操作,使整个科学推理流程变得透明、可追溯。在材料科学研究任务的实验中,配备HEP的智能体能够执行“假设-测试-证据-信念”的完整循环——这一能力正是当前基于规划的智能体所欠缺的。研究还表明,HEP具有良好的泛化能力,可适用于不同研究问题;且随着底层LLM能力的提升,智能体能更充分地利用该协议进行复杂推理。
这项成果标志着向“可审计的AI科学家”迈出了重要一步:未来,AI智能体的科学推理过程将能够被检查、验证,并成为人类科学家进一步构建研究的基础。该协议不仅提升了AI科研的可信度,也为人机协作的科学研究范式提供了新的技术支撑。