CLIP模型选择性去偏新方法:奖励门控测试时适应
视觉语言模型(VLMs)在零样本任务中表现出色,但在人物相关查询中常延续社会刻板印象,导致人口统计分布偏差。现有去偏方法对所有输入查询采用统一的偏差校正,无论其偏差敏感性如何,形成了公平性与实用性之间的根本权衡。强去偏会扭曲无偏差敏感查询中的语义信息,而弱去偏则无法缓解偏差敏感查询中的刻板印象。这种“一刀切”方法阻碍了同时实现无偏差敏感查询的高实用性和偏差敏感查询的公平性。
近日,研究人员在arXiv发表论文《Selective Test-Time Debiasing for CLIP via Reward Gating》,提出奖励门控测试时适应(RG-TTA)框架。该框架基于强化学习,在测试时策略适应过程中,根据每个输入的偏差敏感性自适应触发公平性正则化,同时对无偏差敏感输入专注于优化跨模态对齐。
实验在FairFace、UTKFace等公平性基准测试上进行,结果显示该方法在显著减少偏差的同时,同步提升了零样本实用性,解决了统一去偏方法的权衡困境。RG-TTA的创新在于将去偏处理从“全有或全无”转变为基于输入敏感性的智能选择,为视觉语言模型的公平性优化提供了新思路。