AI医疗新突破:多智能体系统辅助乳腺癌治疗方案生成
随着大语言模型在临床决策支持领域的应用探索不断深入,其在复杂肿瘤治疗规划中的可靠性仍待验证。近日,一项发表在arXiv上的研究系统评估了智能体LLM系统在乳腺癌治疗推荐生成方面的表现。
研究团队采用72个真实临床病例(涵盖I-IV期)和1,147个病例特异性评分标准进行测试。这些评分标准通过非对称信息评分生成方法创建,评分生成器可访问评估模型无法获取的真实临床决策数据。
研究比较了七种不同技术路径,包括单LLM基线系统、工具增强系统以及具备事实核查和自主子智能体生成能力的多智能体架构。表现最佳的配置——Claude Opus 4.8模型搭配D&C+SA流程——获得了0.594±0.025的全局评分。
值得注意的是,工具使用和智能体自主性的提升效果不一:在某些场景下能改善性能,在其他场景中反而会导致表现下降。系统表现随临床领域和疾病阶段的不同而存在差异。肿瘤专家主导的错误分析揭示了系统仍存在持续性临床相关缺陷,包括推荐错误或缺失、论证缺陷、引用错误、过时主张以及过度自信等问题。
研究结果表明,虽然智能体LLM系统能够生成具有临床相关性的乳腺癌治疗建议,但其当前水平尚不足以支持无监督的临床实际应用。这为AI医疗辅助系统的进一步优化指明了方向。