无需训练即可定位概念?MLLM零样本概念命名能力评估
概念可解释人工智能旨在提供基于语义概念、易于人类理解的解释,但其发展常受限于细粒度概念标注数据的稀缺。一项新研究探索了能否利用中等规模的多模态大语言模型,在严格的零样本条件下,为图像中的边界框区域(包括物体整体和局部部件)自动赋予概念名称。研究者提出了一个可复现的零样本概念命名评估协议,包含针对中等规模词汇的封闭集提示方法,以及面向大规模标签空间的、基于嵌入相似度的开放集策略。在对四个参数量在7B至32B的MLLM进行实验后,结果显示模型在不同数据集上表现出一致的性能趋势,在物体级别的精确匹配准确率可达62%至88%。这揭示了无需额外训练、仅从局部图像区域获取低成本概念标注的潜力。研究同时讨论了当前方法的局限性与常见失败模式,并开源了评估框架以支持未来低成本的C-XAI研究。