AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
可扩展监督
1 篇相关内容
相关话题
大模型安全
偏好学习
模型欺骗检测
AI对齐
大模型“测谎”监督新突破:SOLiD方法展现良好扩展性
研究人员将SOLiD测谎监督方法扩展至更大规模模型,发现模型欺骗率随规模增大而显著下降,但该方法对数据分布变化较为敏感。
a
arXiv
·
18 天前
大模型安全
可扩展监督
偏好学习
模型欺骗检测
a