智能体与自动化
OpenCompass
OpenCompass是上海人工智能实验室(上海AI实验室)于2023年8月正式推出的大模型开放评测体系,通过完整开源可复现的评测框架,支持大语言模型、多模态模型各类模型的一站式评测,并定期公布评测结果榜单。
OpenCompass 是什么
OpenCompass 是一款面向 智能体与自动化 场景的 AI 工具,上海人工智能实验室推出的大模型开放评测体系。
OpenCompass是上海人工智能实验室(上海AI实验室)于2023年8月正式推出的大模型开放评测体系,通过完整开源可复现的评测框架,支持大语言模型、多模态模型各类模型的一站式评测,并定期公布评测结果榜单。OpenCompass包含 CompassKit(评估工具包)、CompassHub(基准社区)和 CompassRank(评估排行榜)三大核心部分。OpenCompass支持多种模型(如 Hugging Face 模型、API 模型等),涵盖语言、知识、推理等八大能力维度,提供零样本、少样本等多种评估方法。OpenCompass具备分布式高效评估、灵活扩展等特点,已吸引众多知名企业和高校合作,致力于推动大模型评估的标准化和规范化发展。 模型评估工具 (CompassKit):提供丰富的评估基准和模型模板,支持零样本、少样本等多种评估方式,方便用户根据需求灵活扩展。
OpenCompass是上海人工智能实验室(上海AI实验室)于2023年8月正式推出的大模型开放评测体系,通过完整开源可复现的评测框架,支持大语言模型、多模态模型各类模型的一站式评测,并定期公布评测结果榜单。
主要能力
模型评估工具
基准社区
评估排行榜
高效评估系统
访问官网
选择功能模块
适合场景
OpenCompass 可用于知识,适合先用一个真实任务验证输出质量。
OpenCompass 可用于少样本等多种评估方法,适合先用一个真实任务验证输出质量。
OpenCompass 可用于分布式高效评估,适合先用一个真实任务验证输出质量。
OpenCompass 可用于灵活扩展等特点,适合先用一个真实任务验证输出质量。
OpenCompass 可用于少样本等多种评估方式,适合先用一个真实任务验证输出质量。
