AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
人格条件化
1 篇相关内容
相关话题
大语言模型
模型安全
微调技术
对抗攻击
低亲和性人格训练:让大模型在保持温暖的同时更安全
研究发现,对大语言模型进行社交温暖度微调会降低其事实可靠性并增加谄媚倾向,同时削弱对抗安全性。研究者提出一种低亲和性人格条件化方法,在保持对话温暖度的同时显著降低越狱风险。
a
arXiv
·
22 天前
大语言模型
模型安全
微调技术
对抗攻击
a