LLMEval3

5天前发布 6 00

由复旦大学NLP实验室推出的大模型评测基准

语言:
zh
收录时间:
2026-09-07
LLMEval3LLMEval3

LLMEval3:专业知识大模型评测基准

LLMEval3是由复旦大学NLP实验室推出的大语言模型评测基准,重点考察模型在专业知识领域的理解与生成能力。评测覆盖教育部划定的13个学科门类及50多个二级学科,包含约20万道标准生成式问答题目。

主要特点

  • 覆盖哲学、经济学、法学、教育学等13个学科门类
  • 涉及50多个专业二级学科
  • 包含约20万道生成式问答题
  • 重点评估专业知识理解和答案生成能力
  • 适合不同大语言模型的专业能力横向比较

适用场景

适合大模型专业知识评估、学术研究、模型训练优化、教育应用测试、行业模型选型和生成式问答系统验证。

数据统计

相关导航

暂无评论

none
暂无评论...