
新CMMLU
一个综合性的大模型中文评估基准
OpenCompass是上海人工智能实验室推出的开放、可复现的大模型评测体系,支持大语言模型和多模态模型的一站式评估。平台从语言、知识、推理等八大能力维度进行测试,提供零样本、少样本等评测方式,推动大模型评估标准化。
用户可浏览CompassRank查看榜单,或使用CompassKit安装环境、配置模型和数据集后执行本地评测,也可以在CompassHub提交和共享自定义评测基准。
适合模型性能评估、算法优化、学术研究、企业模型选型、AI应用开发和评测社区共建。







