智能体自我进化:Critic Experience Bank 提升大模型行动置信度评估
在复杂环境中执行任务的大语言模型智能体面临一个关键挑战:每个行动都会改变环境状态,而单个错误步骤可能导致资源浪费或引发不可逆的副作用。可靠部署需要准确的步级置信度评估——即在执行每个行动前,就能获得该行动是否有效的校准概率。
现有置信度评估方法主要针对给定提示生成响应的评分,但智能体的置信度还取决于执行后果:在类似情境下采取的类似行动,在环境响应后是否真正推动了任务进展。
为此,研究团队提出 Critic Experience Bank 框架,这是一种自我进化的评论家框架。在该框架中,大语言模型评论家从其过去的判断及观察到的后果中积累证据。每次执行轨迹结束后,一个拥有完整执行反馈的后见之明大语言模型会对每个步骤是否有效进行投票。由此产生的伪标签存入记忆库,当类似步骤再次出现时,相关的有效和无效经验会被检索并纳入评论家的提示中。
该方法无需训练,也不依赖真实的步骤标签。在三个智能体基准测试和三个评论家骨干模型的实验中,Critic Experience Bank 在所有数据集-评论家组合中都取得了最佳的校准度和排序性能,将预期校准误差相对最强的无训练基线降低了高达 54%。这一进展为提升大语言模型智能体在现实世界中的可靠性和安全性提供了新思路。