AI科研助手新挑战:大模型能否根据证据强度校准科学简报?
随着大语言模型越来越多地担任科研助手角色,其能否根据支持证据的强度与范围准确校准研究结论,成为亟待验证的关键问题。近日,研究团队在arXiv发布题为《CalBrief:基于证据校准的科学简报诊断基准》的预印本论文,针对这一能力展开系统性测评。
该研究提出了“证据校准的科学简报”任务:给定一组相关论文,系统需生成涵盖证据强度、范围边界及证据缺失说明的综合性结论。团队构建了包含16个异构科学证据包、96条人工验证结论的基准数据集,并采用可审计的“角色/缺口/强度”框架(CalBrief)作为诊断工具,定位简报生成中的失效环节。
在公平架构评估下,结构化组织提升了角色与缺口推理能力,但显式的强度校准策略表现出系统性过度保守倾向,其表现甚至低于多数投票基准和直接提示大模型的方法。为探究原因,研究团队在GPT-4o、Claude Sonnet和Gemini Flash三个闭源模型上进行了控制诊断,分离出保守倾向的三个潜在成因。
结果显示:约63%的保守差距源于标签空间从二元{中等、弱}扩展至四元{中等、弱、不确定、证据不足};仅1%可归因于缺口/范围信号注入;剩余36%源于流程策略本身。值得注意的是,四元预测可通过事后合并为二元标签,达到甚至超越直接二元提示的效果,表明额外标签携带了严格匹配所掩盖的信息。
研究指出,标签级强度判断与可审计的证据组织是当前相互制约的两种能力,未来评估LLM科研助手时应予以区分考量。这一发现为优化模型在科学推理场景中的校准能力提供了重要方向。