
新H2O EvalGPT
H2O.ai推出的基于Elo评级方法的大模型评估系统
MMBench是由上海人工智能实验室等高校和机构联合推出的多模态模型评测基准,重点评估视觉语言模型从图像感知到复杂认知的综合能力。数据集包含约3000道中英文选择题,覆盖20项细粒度能力,并通过循环评估提高结果稳定性。
安装VLMEvalKit并下载MMBench数据集,加载多模态模型后运行推理脚本,生成预测结果,再使用评测工具计算准确率。测试结果可提交至官方榜单进行排名。
适合多模态模型研发、学术研究、企业模型选型、教育教学、视觉问答和跨领域AI应用评估。







