大模型思维表征四大公理:揭示基准测试掩盖的深层缺陷
一项最新研究通过建立形式化公理框架,对大语言模型中的潜在思维表征质量进行系统性评估。该研究提出了四大功能公理:因果性、最小性、可分性和稳定性,并为每个公理定义了独立于下游任务精度的量化指标。研究团队对23类推理任务(包括空间推理、事实问答等)中的开源大模型进行了审计分析,发现所有候选模型均无法同时满足四项公理要求。结果表明,当前模型的表征能力虽然能够可靠区分任务类型,但无法区分同一任务内的不同问题,且表征信息基本局限于输入嵌入的已有内容。这一缺陷在密集模型、推理蒸馏模型和强化学习训练模型家族中普遍存在,表明问题根源在于结构层面而非模型规模或训练方法。该框架突破了传统评估将表征质量与模型能力混为一谈的局限,为诊断大模型思维表征的根本缺陷提供了新工具。