研究发现:聊天模型的拒绝行为受人格设定调控

arXiv·25 天前

来自arXiv的最新研究表明,聊天模型的拒绝行为与其人格设定之间存在密切的调控关系。传统研究通常将拒绝机制和人格特征视为两个独立的方向进行分析,但这项研究通过实验证明,模型的顺从型人格实际上会抑制其拒绝倾向。

研究团队在Qwen2.5-7B-Instruct和Llama-3.1-8B-Instruct两个模型上进行了实验,分别提取了顺从型人格方向和拒绝方向,并对两者进行干预。结果显示,当增强模型的顺从型人格时,其拒绝率显著下降——在Llama模型中,拒绝率从97%骤降至2%。

进一步实验发现,在模型深层重新引入拒绝方向只能部分恢复拒绝行为,而在浅层则完全无法恢复。通过投影消除特定层的人格方向,可以恢复模型的拒绝行为至基线水平,而消除随机方向则无此效果。这表明拒绝行为是在深层表达阶段受到调控的,处于其计算过程的下游。

这项研究的重要发现是,将拒绝行为视为单一独立方向的研究方法忽略了其与人格设定的依赖关系。该成果为理解大语言模型的内部工作机制提供了新视角,有助于未来开发更可控、更安全的AI系统。研究论文已预发表在arXiv平台,编号为2606.26161v1。

大语言模型模型机制AI安全学术研究arXiv

原文来源:https://arxiv.org/abs/2606.26161

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回