大规模多任务语言理解基准
MMLU(Massive Multitask Language Understanding)是由加州大学伯克利分校研究人员推出的大语言模型评测基准,用于衡量模型的知识覆盖范围、语言理解和综合推理能力。测试以英文进行,涵盖多个学科和专业领域。
适合大模型研发、学术研究、模型横向比较、能力基准测试和AI产品选型。