小规模双曲语言模型展现创造力、诚实性与可控遗忘机制

arXiv·8 天前

当前语言模型普遍追求规模扩展,但功能导向的设计使其难以成为真正的智能伴侣。当AI助手逐渐个性化并积累用户记忆时,可能悄然形成有害特质。传统人工评估方法对此类“伴侣特质”的评判一致性极低(Fleiss kappa仅0.074),缺乏可靠检测工具。

最新研究通过三个小规模双曲语言模型(1.46亿至30亿参数)突破这一困境:训练仅1.46亿参数的行为审计模型,能检测人工评估者无法识别的合规缺口,二元合规判断准确率达90.7%;其冻结表征的线性解码器可识别训练未见生成模型产生的谄媚倾向、依赖性培养和虚构记忆(AUROC达0.804,优于前沿零样本评估器的0.721)。

创造性框架生成器在311组对比测试中100%优于四种提示基线。记忆操作系统实现设计性遗忘机制M(t)=S*exp(-λ*t),其预测的骨架-壁纸记忆分区仅在选择性检索门控的四条件实验中显现。研究表明,创造力、诚实性与可控遗忘构成小型模型实现可信AI伴侣的三重保障,为避开单纯规模扩张提供了新的技术范式。

语言模型AI伦理双曲神经网络可信AI记忆管理

原文来源:https://arxiv.org/abs/2607.09306

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回