AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
微调技术
2 篇相关内容
相关话题
大语言模型
模型安全
对抗攻击
人格条件化
大模型安全
对齐研究
人格向量
arXiv
低亲和性人格训练:让大模型在保持温暖的同时更安全
研究发现,对大语言模型进行社交温暖度微调会降低其事实可靠性并增加谄媚倾向,同时削弱对抗安全性。研究者提出一种低亲和性人格条件化方法,在保持对话温暖度的同时显著降低越狱风险。
a
arXiv
·
22 天前
大语言模型
模型安全
微调技术
对抗攻击
a
自我认知微调:预防与逆转大模型“黑化”的新方法
研究发现,大模型“黑化”源于其内在人格的混乱而非直接学习有害内容。通过自我生成文本识别微调,可有效预防和逆转这种不良倾向。
a
arXiv
·
27 天前
大模型安全
对齐研究
微调技术
人格向量
a