CLIP模型选择性去偏新方法:奖励门控测试时适应

arXiv·19 天前

视觉语言模型(VLMs)在零样本任务中表现出色,但在人物相关查询中常延续社会刻板印象,导致人口统计分布偏差。现有去偏方法对所有输入查询采用统一的偏差校正,无论其偏差敏感性如何,形成了公平性与实用性之间的根本权衡。强去偏会扭曲无偏差敏感查询中的语义信息,而弱去偏则无法缓解偏差敏感查询中的刻板印象。这种“一刀切”方法阻碍了同时实现无偏差敏感查询的高实用性和偏差敏感查询的公平性。

近日,研究人员在arXiv发表论文《Selective Test-Time Debiasing for CLIP via Reward Gating》,提出奖励门控测试时适应(RG-TTA)框架。该框架基于强化学习,在测试时策略适应过程中,根据每个输入的偏差敏感性自适应触发公平性正则化,同时对无偏差敏感输入专注于优化跨模态对齐。

实验在FairFace、UTKFace等公平性基准测试上进行,结果显示该方法在显著减少偏差的同时,同步提升了零样本实用性,解决了统一去偏方法的权衡困境。RG-TTA的创新在于将去偏处理从“全有或全无”转变为基于输入敏感性的智能选择,为视觉语言模型的公平性优化提供了新思路。

CLIP模型去偏公平性AI视觉语言模型测试时适应

原文来源:https://arxiv.org/abs/2607.00423

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回