
新HELM
斯坦福大学推出的大模型评测体系
CMMLU是面向中文语境的大语言模型评测套件,覆盖基础学科、自然科学、人文社科、专业知识及中国生活常识等67个主题。它重点测试模型在中文知识理解、逻辑推理和本土化任务中的表现,并支持zero-shot与five-shot评测。
下载数据集并安装相关Python依赖,加载待评测模型和tokenizer,使用预处理及评估脚本运行测试,计算各任务准确率。开源模型可提交结果至项目仓库,最终在排行榜中查看表现。
适合中文大模型研发、模型选型、学术研究、智能客服、教育辅导、文化知识问答和医疗领域能力评估。







