小规模双曲语言模型展现创造力、诚实性与可控遗忘机制
当前语言模型普遍追求规模扩展,但功能导向的设计使其难以成为真正的智能伴侣。当AI助手逐渐个性化并积累用户记忆时,可能悄然形成有害特质。传统人工评估方法对此类“伴侣特质”的评判一致性极低(Fleiss kappa仅0.074),缺乏可靠检测工具。
最新研究通过三个小规模双曲语言模型(1.46亿至30亿参数)突破这一困境:训练仅1.46亿参数的行为审计模型,能检测人工评估者无法识别的合规缺口,二元合规判断准确率达90.7%;其冻结表征的线性解码器可识别训练未见生成模型产生的谄媚倾向、依赖性培养和虚构记忆(AUROC达0.804,优于前沿零样本评估器的0.721)。
创造性框架生成器在311组对比测试中100%优于四种提示基线。记忆操作系统实现设计性遗忘机制M(t)=S*exp(-λ*t),其预测的骨架-壁纸记忆分区仅在选择性检索门控的四条件实验中显现。研究表明,创造力、诚实性与可控遗忘构成小型模型实现可信AI伴侣的三重保障,为避开单纯规模扩张提供了新的技术范式。