
新LLMEval3
由复旦大学NLP实验室推出的大模型评测基准
SuperCLUE是面向中文大语言模型的综合评测体系,从语言理解与生成、知识应用、专业技能、环境适应和安全性等维度,系统评估模型能力。平台结合多轮对话、客观题和主观题测试,并新增AI Agent工具使用与任务规划能力评估。
研究者可阅读评测报告和技术规范,准备支持API调用的中文模型,并联系评测组织方提交模型信息。评测完成后,可通过榜单和报告分析模型表现。
适合模型研发优化、企业模型选型、学术比较、AI Agent评估、安全合规检测和中文AI应用开发。







