C-Eval

5天前发布 12 00

一个全面的中文基础模型评估套件

语言:
zh
收录时间:
2026-09-07

C-Eval:中文大语言模型评测基准

C-Eval是由上海交通大学、清华大学和爱丁堡大学研究人员推出的中文大模型评估套件,用于测试模型的中文知识理解、推理和泛化能力。数据集包含约1.4万道选择题,覆盖52个学科及四个难度等级。

主要特点

  • 覆盖STEM、社会科学、人文科学等多个领域
  • 包含基础到高级四个难度级别
  • 支持零样本和少样本评测
  • 提供标准化准确率指标
  • 支持不同中文大模型横向比较

使用方式

用户可从Hugging Face下载C-Eval数据集,加载待评测模型并构建零样本或少样本提示,生成答案后计算验证集准确率;测试集结果可提交官方平台获取评分。

适用场景

适合中文大模型研发、学术研究、模型选型、教育评测、行业能力验证和模型优化。

数据统计

相关导航

暂无评论

none
暂无评论...