医疗AI代理的临床反馈困境:RL在FHIR环境中的诊断与突破

arXiv·18 天前

临床协议执行任务——如检查实验室数值、应用阈值、生成符合FHIR标准的医嘱——理论上适合通过世界反馈进行强化学习训练:一旦临床专家将决策逻辑编码为验证器,该验证器即可对无限次任务执行进行自动评分,无需逐条人工标注。然而,实际应用RL需要可靠的反馈通道和足够的基础能力。

研究团队对MedAgentBench v1/v2进行审计,发现存在41.7%的“静默完成”上限,导致不作为成为RL的主导策略。为此构建了改进版MedAgentBench-v3(含508项任务,静默完成率降至8.9%)。

使用Qwen3-8B模型训练时,暴露出两大结构性障碍:一是“能力天花板”(20类任务中有10类基础性能为0%,梯度为零);二是“格式知识壁垒”(3类任务要求使用探索无法发现的精确临床代码)。

实验结果显示,纯RL方法的pass@1仅为18.2%,而基于规则的监督微调达到34.1%,15.9个百分点的差距完全归因于这两大障碍。研究提出决策/格式知识/查询的三元分类法,可预测RL可学习性并指导解决方案:通过SFT注入必要代码知识,再使用RL学习条件判断逻辑。

医疗AI强化学习FHIR标准临床决策模型训练

原文来源:https://arxiv.org/abs/2607.01470

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回