可视化追踪语言模型隐藏偏见:TreeTracer工具亮相
大语言模型(LLMs)存在表征和句法偏见,但由于文本生成的随机性,这些偏见难以评估。传统的审计方法通常依赖单一输出检查或静态自动化指标,这些方法掩盖了底层的概率分布,无法捕捉隐藏在低概率生成分支中的偏见。
近日,研究人员在arXiv上发布了一项新研究,提出名为TreeTracer的可视化分析工具。该工具采用系统性扰动分析流程:首先替换输入提示中本体定义的术语,然后将数百个随机生成结果聚合成语法对齐的层次结构,接着使用辅助语言模型进行基于分类的节点合并。最终结果通过定制的桑基图进行可视化展示。
通过并置两个本体驱动的树状结构,该工作空间支持语义上下文之间的直接比较,有助于系统性偏见检测。由于任何可视化都只能反映模型学习行为的一部分,该系统进一步应用对比推理来计算并直接显示跨上下文的对抗性标记概率,从而降低误解偏见存在的风险。
研究团队通过案例研究验证了该工具的有效性,比较了未经对齐的基线模型GPT-2 XL与经过宪法对齐的Apertus模型。可视化聚合成功揭示了隐藏的表征危害,如对抗性代词抑制和个体的对话边缘化。初步用户研究证实,这种聚合对比界面降低了认知负荷,有效支持分析人员检测系统性偏见。