大语言模型身份之谜:不同训练模式下的人格向量会“分裂”吗?

arXiv·19 天前

一项发布于arXiv的认知科学研究对当前大语言模型身份识别理论提出了重要挑战。传统观点认为,模型在不同操作模式下(如提示词引导、梯度微调、推理时干预)提取的人格向量应当指向相同的内容实体。然而,研究团队通过对Qwen3-4B-Instruct和Mistral-7B-Instruct-v0.2的实验发现,这一假设存在根本性问题。

实验揭示了四个关键现象:提示提取向量与微调后向量不共线;虚构人物比真实人物更能改变模型的行为方向;矛盾情感混合会偏向训练历史决定的吸引子;推理时算术与微调时混合训练产生不对称的组合代数。这些发现共同表明,同一向量方向在不同操作模式下可能对应完全不同的内容。

研究者提出了“模式索引身份识别”新框架,认为表征内容的身份单元应该是(载体,操作模式)配对,而非单独的载体。在这一框架下,现有理论中看似对立的观点实际上描述的是不同模式下的不同对象,而非竞争同一指称对象。这一发现对理解大语言模型的表征机制和人格建模具有重要理论意义。

大语言模型认知科学人格向量模型身份arXiv研究

原文来源:https://arxiv.org/abs/2607.00006

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回