SuperCLUE

5天前发布 6 00

中文通用大模型综合性测评基准

语言:
zh
收录时间:
2026-09-07
SuperCLUESuperCLUE

SuperCLUE:中文大模型综合评测基准

SuperCLUE是面向中文大语言模型的综合评测体系,从语言理解与生成、知识应用、专业技能、环境适应和安全性等维度,系统评估模型能力。平台结合多轮对话、客观题和主观题测试,并新增AI Agent工具使用与任务规划能力评估。

主要功能

  • 评测语言理解、文本创作和多轮对话能力
  • 测试知识问答、逻辑推理和数学计算
  • 评估代码生成和专业任务处理能力
  • 考察角色扮演、环境适应和模型安全性
  • 覆盖字形、拼音、古文、成语和诗词等中文能力
  • 结合客观量化与主观评价
  • 定期更新模型榜单并发布技术报告

使用方式

研究者可阅读评测报告和技术规范,准备支持API调用的中文模型,并联系评测组织方提交模型信息。评测完成后,可通过榜单和报告分析模型表现。

适用场景

适合模型研发优化、企业模型选型、学术比较、AI Agent评估、安全合规检测和中文AI应用开发。

数据统计

相关导航

暂无评论

none
暂无评论...