医疗AI代理的临床反馈困境:RL在FHIR环境中的诊断与突破
临床协议执行任务——如检查实验室数值、应用阈值、生成符合FHIR标准的医嘱——理论上适合通过世界反馈进行强化学习训练:一旦临床专家将决策逻辑编码为验证器,该验证器即可对无限次任务执行进行自动评分,无需逐条人工标注。然而,实际应用RL需要可靠的反馈通道和足够的基础能力。
研究团队对MedAgentBench v1/v2进行审计,发现存在41.7%的“静默完成”上限,导致不作为成为RL的主导策略。为此构建了改进版MedAgentBench-v3(含508项任务,静默完成率降至8.9%)。
使用Qwen3-8B模型训练时,暴露出两大结构性障碍:一是“能力天花板”(20类任务中有10类基础性能为0%,梯度为零);二是“格式知识壁垒”(3类任务要求使用探索无法发现的精确临床代码)。
实验结果显示,纯RL方法的pass@1仅为18.2%,而基于规则的监督微调达到34.1%,15.9个百分点的差距完全归因于这两大障碍。研究提出决策/格式知识/查询的三元分类法,可预测RL可学习性并指导解决方案:通过SFT注入必要代码知识,再使用RL学习条件判断逻辑。