
新LMArena
AI模型评估平台
FlagEval(天秤)是北京智源人工智能研究院推出的大模型评测体系与开放平台,采用“能力—任务—指标”三维框架,系统评估基础模型和训练算法的性能。平台覆盖对话、问答、情感分析等任务,并支持文本、图像、视频等多模态模型。
注册登录后,准备模型文件、推理代码和配置,通过FlagEval-Serving上传资源,创建评测任务并选择领域、镜像和硬件。任务完成后即可查看性能指标和分析结果。
适合学术研究、模型开发、企业模型选型、多模态评估、教育教学和国内外模型性能对比。







