
新FlagEval
智源研究院推出的FlagEval(天秤)大模型评测平台
C-Eval是由上海交通大学、清华大学和爱丁堡大学研究人员推出的中文大模型评估套件,用于测试模型的中文知识理解、推理和泛化能力。数据集包含约1.4万道选择题,覆盖52个学科及四个难度等级。
用户可从Hugging Face下载C-Eval数据集,加载待评测模型并构建零样本或少样本提示,生成答案后计算验证集准确率;测试集结果可提交官方平台获取评分。
适合中文大模型研发、学术研究、模型选型、教育评测、行业能力验证和模型优化。







