FlagEval 的核心能力一览
采用“能力-任务-指标”三维评测框架,从多个维度全面评估大模型的认知能力,涵盖对话、问答、情感分析等多种应用场景。
提供超过22个数据集和8万道评测题目,覆盖不同应用场景、难度级别和语言类型,确保评测的全面性和准确性。
支持文本、图像、视频等多种模态的模型评测,满足不同类型模型的评估需求。
实现主观评测和客观评测的全自动流水线,支持自适应评测机制,用户可根据模型类型和状态选择评测策略,提高评测效率。
涵盖超过800个开源和闭源模型,支持多种AI框架(如PyTorch和MindSpore)和硬件架构(如NVIDIA、昇腾、寒武纪和昆仑芯等)。
提供详细的评测数据表格和排行榜,展示不同模型的评测结果,帮助研究人员直观了解模型性能。
采用“能力-任务-指标”三维评测框架,从多个维度全面评估大模型的认知能力,涵盖对话、问答、情感分析等多种应用场景。
提供超过22个数据集和8万道评测题目,覆盖不同应用场景、难度级别和语言类型,确保评测的全面性和准确性。
支持文本、图像、视频等多种模态的模型评测,满足不同类型模型的评估需求。
实现主观评测和客观评测的全自动流水线,支持自适应评测机制,用户可根据模型类型和状态选择评测策略,提高评测效率。
涵盖超过800个开源和闭源模型,支持多种AI框架(如PyTorch和MindSpore)和硬件架构(如NVIDIA、昇腾、寒武纪和昆仑芯等)。
采用“能力-任务-指标”三维评测框架,从多个维度全面评估大模型的认知能力,涵盖对话、问答、情感分析等多种应用场景。
提供超过22个数据集和8万道评测题目,覆盖不同应用场景、难度级别和语言类型,确保评测的全面性和准确性。
支持文本、图像、视频等多种模态的模型评测,满足不同类型模型的评估需求。
实现主观评测和客观评测的全自动流水线,支持自适应评测机制,用户可根据模型类型和状态选择评测策略,提高评测效率。
关于 FlagEval 的常见疑问解答
FlagEval 是一款面向AI聊天场景的 AI 工具。智源研究院推出的FlagEval(天秤)大模型评测平台
FlagEval 的核心功能包括:多维度评测框架、丰富的评测数据集、多模态支持、自动化评测机制,覆盖AI聊天场景下的常见需求。
FlagEval 的价格模式为:具体价格见官网,具体功能与额度请以官网为准。
您可以通过官网 https://flageval.baai.ac.cn/#/trending 直接访问 FlagEval 并开始使用,无需复杂配置即可上手。