AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
认知过程
1 篇相关内容
相关话题
大语言模型
AI安全
行为检测
模型对齐
新方法揭示大语言模型的“思想偏差”:通过内部激活信号检测AI不端行为
研究人员提出通过分解大语言模型的认知过程,检测其内部激活信号中的“不端行为指标”,从而更可靠地识别模型的战略欺骗、自我保全等危险行为,为AI安全部署提供新工具。
a
arXiv
·
27 天前
大语言模型
AI安全
行为检测
模型对齐
a