MMBench

5天前发布 6 00

全方位的多模态大模型能力评测体系

语言:
zh
收录时间:
2026-09-07

MMBench:多模态模型综合评测基准

MMBench是由上海人工智能实验室等高校和机构联合推出的多模态模型评测基准,重点评估视觉语言模型从图像感知到复杂认知的综合能力。数据集包含约3000道中英文选择题,覆盖20项细粒度能力,并通过循环评估提高结果稳定性。

主要功能

  • 评估视觉问答、图像描述等多种任务
  • 覆盖感知、推理及多项细粒度能力
  • 提供中英文数据集和可视化样本
  • 支持循环推理,检验模型输出一致性
  • 提供VLMEvalKit标准化评测工具
  • 支持模型排行榜和性能结果对比

使用方式

安装VLMEvalKit并下载MMBench数据集,加载多模态模型后运行推理脚本,生成预测结果,再使用评测工具计算准确率。测试结果可提交至官方榜单进行排名。

适用场景

适合多模态模型研发、学术研究、企业模型选型、教育教学、视觉问答和跨领域AI应用评估。

数据统计

相关导航

暂无评论

none
暂无评论...