Kimi发布PerceptionBench基准:从模型失败中提炼原子化视觉能力评估

月之暗面Kimi团队近日发布了PerceptionBench视觉感知基准。该基准的创新之处在于其构建逻辑:并非预先定义评估维度,而是通过系统分析当前前沿模型在42个现有基准测试中的失败案例,反向推导出10项核心的原子化视觉感知能力。基于这些发现,团队构建了包含3000个已验证问题的测试集,每个问题都严格隔离单一视觉能力,答案仅需通过观察图像即可获得,无需任何推理过程或外部知识介入。这种“从失败中学习”的构建方法旨在更精准地诊断模型在基础视觉感知层面的能力边界与缺陷,为多模态模型的视觉模块评估提供了新的工具视角。官方同时开放了博客、GitHub代码库及HuggingFace数据集页面。

视觉基准多模态模型模型评估月之暗面Kimi

原文来源:https://x.com/Kimi_Moonshot/status/2081813202514681878

相关阅读

Kimi Work 推出金融分析师教程第二期,详解三大投资研究任务
月之暗面启动Kimi全球大使计划:招募社区共建者
Kimi Work推出幻灯片制作功能,AI助手一键生成演示文稿
Kimi K3 模型正式登陆 Together AI 平台
Kimi K3 模型登陆 DigitalOcean Serverless Inference,开发者可快速调用

← 返回