
新FlagEval
智源研究院推出的FlagEval(天秤)大模型评测平台
HELM(Holistic Evaluation of Language Models)是斯坦福大学推出的大模型综合评测框架,通过“场景—适配—指标”三部分配置评估任务。它不仅测试模型准确率,还关注鲁棒性、公平性、偏差、毒性、不确定性和推理效率,并支持文本及多模态任务。
安装HELM后,创建配置文件定义评测场景、模型和指标,再运行评测命令生成报告。用户也可以继承相关类,自定义评测任务或评价指标。
适合模型性能评估、算法优化、多模态测试、公平性与偏差检测、毒性分析和AI安全研究。







