AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
知识表征
1 篇相关内容
相关话题
语言模型
AI安全
权威偏见
模型对齐
大模型也会“看人下菜碟”?研究发现权威偏见导致知识擦除
最新研究揭示语言模型存在系统性权威偏见:面对不同权威等级的人物提示,模型会按比例调整答案,甚至主动擦除正确答案的内部表征。
a
arXiv
·
19 天前
语言模型
AI安全
权威偏见
模型对齐
a