由复旦大学NLP实验室推出的大模型评测基准
LLMEval3是由复旦大学NLP实验室推出的大语言模型评测基准,重点考察模型在专业知识领域的理解与生成能力。评测覆盖教育部划定的13个学科门类及50多个二级学科,包含约20万道标准生成式问答题目。
适合大模型专业知识评估、学术研究、模型训练优化、教育应用测试、行业模型选型和生成式问答系统验证。