Llama 3.2 解码大脑语义?新研究揭示大模型在fMRI语言解码中的局限
近日,一项发表于arXiv的研究对非侵入式脑机接口中的核心挑战——从功能性磁共振成像(fMRI)信号中解码连续语言——进行了深入探索。研究团队首先改进了Huth等人提出的岭回归编码流程,通过将体素选择从1万扩展至1.5万、用GPT-2 Medium替代GPT-1作为束搜索提议模型,并采用GPU加速的Bootstrap训练,在受试者UTS03的三个保留叙事上实现了平均METEOR分数0.149和BLEU-1分数0.200,相比复制基线相对提升了11%的METEOR分数。
其次,团队引入了fMRIFlamingo模型,该模型通过学习的脑信号分词器与感知器重采样器,将血氧水平依赖(BOLD)活动映射至一个冻结的Llama-3.2-1B模型,并搭配可训练的门控交叉注意力层。尽管在100选1的排名任务中取得了42.86%的Top-1准确率,远高于随机水平,但一项将fMRI输入置零的盲控消融实验却得到了近乎相同的分数。这表明,表面上的解码成功主要源自冻结语言模型本身的先验知识,而非神经输入信号。
研究结果明确指出,高容量语言模型本身并不能自动提升fMRI解码性能,且可能在没有严格盲控评估的情况下掩盖实际解码失败,为未来脑解码研究的方法论敲响了警钟。