医学大模型幻觉难题:神经元可读却不可控
在医学大模型应用场景中,幻觉生成仍是阻碍其可靠部署的核心障碍。arXiv最新研究通过四款开源模型在多个医学问答数据集上的实验发现:经过精心设计的条件探针可有效检测幻觉,AUROC评分达到0.77-0.86。更关键的是,研究揭示了幻觉信号在神经网络中的分布式特性——少量随机神经元组合即可捕获近乎完整的检测信号,低维随机投影也能保持大部分检测性能。
研究团队进一步探索了从检测到控制的转化可能性。在16组模型-数据集组合实验中,结果显示出明显的可解码性与可控性分离:虽然幻觉在神经元激活层面易于识别,但通过调控相关神经元实现可靠纠正的效果有限。这表明医学大模型的幻觉缓解并非简单的神经元定位问题,而是涉及表征揭示与行为改变之间的深层鸿沟。该发现为理解大模型幻觉机制提供了新视角,提示未来研究需要超越单纯的检测技术,探索更本质的干预路径。