大语言模型推理中的“演绎刻板印象”:当逻辑严谨遭遇社会偏见
最新研究揭示了大语言模型推理过程中一种隐蔽的偏见模式——“演绎刻板印象”。尽管现代大模型在推理能力上普遍提升,但研究人员发现模型会基于群体层面的统计规律对个体案例做出推断,这种推断在逻辑上自洽却蕴含社会偏见。
研究团队通过统计分析阐释了这一现象的形成机制。为引导模型进行公平感知推理,研究者提出推理时注入框架,并开发了Fair-GCG方法系统性地发掘有效的注入短语。实验表明,Fair-GCG发现的短语不仅能提升多个公平性基准测试表现,还能从小模型泛化至大模型,改善推理层级的公平性,减少开放式生成中的偏见,并可迁移至现实世界的公平敏感任务。
值得注意的是,该研究特别标注论文包含可能引起不适的毒性内容,体现了AI伦理研究中对潜在危害的审慎态度。这项发现为理解模型偏见形成机制提供了新视角,也为开发更公平的AI系统提供了技术路径。