RLHF偏好数据暗藏标注者状态偏差,研究团队提出审计框架

arXiv·10 小时前

一项最新研究揭示,在强化学习人类反馈(RLHF)的偏好数据标注过程中,存在一种容易被忽视的结构化偏差源——标注者状态偏差。传统观点认为,成对偏好标签仅反映输出质量的比较,但研究发现,标注者在持续压力或情绪波动状态下的偏好判断会发生系统性偏移。这种偏移不同于普通的意见分歧或随机噪声,而是具有状态依赖性,并可能在相似工作条件下的标注者间形成相关性。

研究团队将这种现象定义为“标注者状态偏移”,并指出这种偏差可能通过奖励建模和策略优化过程传播至最终训练的模型。论文提出了“标注者状态混淆”和“相关标注者状态偏差”等概念,同时定义了可测量的“生存级情感真实性”响应模式,该模式可通过词汇、语用、语篇和安全相关特征进行识别。

为验证这一假设,研究团队推导出五个可证伪的预测及效应量阈值,并设计了一套完整的审计协议和试点研究方案。该框架适用于对公开可用的指令微调模型进行偏差审计,但强调不针对任何特定已部署模型的训练历史进行推断。此项工作的核心目标是识别RLHF偏好数据中一个合理且可验证的结构化偏差来源,为提升大模型对齐过程的可靠性提供方法论支持。

RLHF偏好标注模型对齐数据偏差人工智能安全

原文来源:https://arxiv.org/abs/2607.16195

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回