FlagEval

5天前发布 15 00

智源研究院推出的FlagEval(天秤)大模型评测平台

语言:
zh
收录时间:
2026-09-07
FlagEvalFlagEval

FlagEval:开放大模型评测平台

FlagEval(天秤)是北京智源人工智能研究院推出的大模型评测体系与开放平台,采用“能力—任务—指标”三维框架,系统评估基础模型和训练算法的性能。平台覆盖对话、问答、情感分析等任务,并支持文本、图像、视频等多模态模型。

主要功能

  • 提供22多个数据集和约8万道评测题目
  • 支持主观、客观评测及自动化评测流水线
  • 覆盖800多个开源和闭源模型
  • 兼容PyTorch、MindSpore等框架
  • 支持NVIDIA、昇腾、寒武纪等硬件
  • 提供模型排行榜、数据表格和可视化结果
  • 支持社区贡献模型和评测数据集

使用方式

注册登录后,准备模型文件、推理代码和配置,通过FlagEval-Serving上传资源,创建评测任务并选择领域、镜像和硬件。任务完成后即可查看性能指标和分析结果。

适用场景

适合学术研究、模型开发、企业模型选型、多模态评估、教育教学和国内外模型性能对比。

数据统计

相关导航

暂无评论

none
暂无评论...