Kimi发布PerceptionBench基准:从模型失败中提炼原子化视觉能力评估
月之暗面Kimi团队近日发布了PerceptionBench视觉感知基准。该基准的创新之处在于其构建逻辑:并非预先定义评估维度,而是通过系统分析当前前沿模型在42个现有基准测试中的失败案例,反向推导出10项核心的原子化视觉感知能力。基于这些发现,团队构建了包含3000个已验证问题的测试集,每个问题都严格隔离单一视觉能力,答案仅需通过观察图像即可获得,无需任何推理过程或外部知识介入。这种“从失败中学习”的构建方法旨在更精准地诊断模型在基础视觉感知层面的能力边界与缺陷,为多模态模型的视觉模块评估提供了新的工具视角。官方同时开放了博客、GitHub代码库及HuggingFace数据集页面。