CMMLU

5天前发布 6 00

一个综合性的大模型中文评估基准

语言:
zh
收录时间:
2026-09-07

CMMLU:中文大模型知识与推理评测基准

CMMLU是面向中文语境的大语言模型评测套件,覆盖基础学科、自然科学、人文社科、专业知识及中国生活常识等67个主题。它重点测试模型在中文知识理解、逻辑推理和本土化任务中的表现,并支持zero-shot与five-shot评测。

主要功能

  • 覆盖67个中文多学科评测主题
  • 提供开发集、测试集和排行榜
  • 支持zero-shot、five-shot等评估方式
  • 提供数据预处理、提示生成和评估代码
  • 支持不同语言模型横向对比
  • 可从GitHub和Hugging Face获取数据集

使用方式

下载数据集并安装相关Python依赖,加载待评测模型和tokenizer,使用预处理及评估脚本运行测试,计算各任务准确率。开源模型可提交结果至项目仓库,最终在排行榜中查看表现。

适用场景

适合中文大模型研发、模型选型、学术研究、智能客服、教育辅导、文化知识问答和医疗领域能力评估。

数据统计

相关导航

暂无评论

none
暂无评论...