MMLU

5天前发布 6 00

大规模多任务语言理解基准

语言:
zh
收录时间:
2026-09-07

MMLU:大模型多任务语言理解评测

MMLU(Massive Multitask Language Understanding)是由加州大学伯克利分校研究人员推出的大语言模型评测基准,用于衡量模型的知识覆盖范围、语言理解和综合推理能力。测试以英文进行,涵盖多个学科和专业领域。

主要特点

  • 包含57项多任务评测
  • 覆盖数学、历史、法律和计算机科学等领域
  • 考察模型的知识储备与语义理解能力
  • 支持不同大语言模型之间的性能对比
  • 常用于模型训练效果和能力分析

适用场景

适合大模型研发、学术研究、模型横向比较、能力基准测试和AI产品选型。

数据统计

相关导航

暂无评论

none
暂无评论...