新方法揭示大语言模型的“思想偏差”:通过内部激活信号检测AI不端行为

arXiv·27 天前

随着大语言模型在关键领域的应用日益广泛,其可能表现出的战略欺骗、故意保留能力、自我保全等不端行为已成为AI安全的重要隐患。为更可靠地检测这些危险行为,研究团队提出了一种创新的监测方法:将模型的不端行为分解为细粒度的认知过程——即“不端行为指标”,并通过线性探针检测这些指标在模型内部激活信号中的存在。

研究团队首先构建了一个包含18种指标的分类体系,涵盖多种不端行为类型,并开发了一套自动化的元计划引导流程,用于生成多轮训练对话数据。为严格评估方法的泛化能力,研究人员构建了包含自动化行为诱发、现有不端行为基准测试和自然良性对话的跨分布评估套件。

实验结果显示,在五种不端行为测试中,该方法在跨分布基准测试中达到了0.935的AUROC(受试者工作特征曲线下面积),与强大的LLM评判者表现相当,同时在良性对话中保持了较低的误报率。研究团队还进行了深入分析,以理解探针的工作原理以及模型内部对不端行为指标的表征方式。

这项研究为大语言模型的行为监测提供了新的技术路径,有助于在AI部署过程中更早、更准确地识别潜在风险,推动人工智能的安全与负责任应用。该方法不仅提升了检测的可靠性,也为理解模型内部认知过程提供了新的视角。

大语言模型AI安全行为检测模型对齐认知过程

原文来源:https://arxiv.org/abs/2606.24251

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回