语义导航大比拼:人类与三大主流大模型谁更灵活?
语义记忆检索可被视作在概念空间中的导航过程。一项发表于arXiv的最新研究对比了人类与三大主流大语言模型(GPT-4o、Gemini-2.5-Pro、Claude-Sonnet-4.5)的语义搜索动态差异。研究团队收集了82名人类参与者的语言流畅性数据,并与大模型在8种不同温度设置下的输出进行对比分析。
通过应用基于轨迹的自然语言处理指标,研究人员从三个维度量化了语义搜索特征:熵值(预测步长的可预测性)、相邻距离(连续语义步骤的跨度)以及中心距离(全局分散程度)。结果显示,人类在所有维度上都表现出更高的熵值、更大的语义步长和更广的分散范围,表明人类的语义搜索更具变化性和探索性。
值得注意的是,虽然通过调节温度参数可以在某些特定设置下让个别指标与人类表现对齐,但没有任何一种配置能够完全复现人类在所有维度上的完整特征剖面。这表明,人类语义搜索实现了局部利用与全局探索之间的独特平衡,而当前的大模型架构尚未能捕捉到这种动态特性。该研究为理解人类认知与大模型语义处理机制的差异提供了量化依据,也为未来开发更接近人类思维模式的AI系统指明了改进方向。