AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
行为控制
1 篇相关内容
相关话题
模型可解释性
语言模型
特征检测
AI安全
通过级联线性特征检测与控制AI模型的奉承行为
研究人员提出一种迭代数据生成方法,通过识别级联线性特征来检测和控制语言模型的奉承倾向。该方法比传统二元对比样本能更清晰地分离行为特征,并提供可解释性保证。
a
arXiv
·
25 天前
模型可解释性
行为控制
语言模型
特征检测
a