返回工具列表 工具分类智能体与自动化按实际使用场景归类 官网入口cluebenchmarks.com保留原站直达链接 收费方式官网可查看最终价格以官网为准 关注人数5A+ 优先推荐 01AI模型评测 02核心能力 02 03核心能力 03 04核心能力 04 05核心能力 05 06核心能力 06 01
智能体与自动化
SuperCLUE
SuperCLUE 是针对中文大模型的综合性评测基准,能全面评估模型在多个维度上的性能表现。SuperCLUE 通过多轮对话、客观题测试等多种方式,从语言理解与生成、知识应用、专业技能、环境适应与安全性等四大能力象限的 12 项基础能力进行评估。
访问官网 更新于 2026/04/15
SuperCLUE 是什么
SuperCLUE 是一款面向 智能体与自动化 场景的 AI 工具,中文通用大模型综合性测评基准。
SuperCLUE 是针对中文大模型的综合性评测基准,能全面评估模型在多个维度上的性能表现。SuperCLUE 通过多轮对话、客观题测试等多种方式,从语言理解与生成、知识应用、专业技能、环境适应与安全性等四大能力象限的 12 项基础能力进行评估。SuperCLUE 对比不同模型之间的表现,支持与人类表现进行对比,为中文大模型的研发与优化提供科学依据。SuperCLUE 新增对 AI Agent 智能体的评估,重点测试工具使用和任务规划能力。SuperCLUE 定期更新榜单,发布详细的技术报告,推动中文大模型技术的发展。 多维度能力评估 :从语言理解、生成、知识应用、逻辑推理、代码能力、安全性等多个维度对模型进行测试。
SuperCLUE 是针对中文大模型的综合性评测基准,能全面评估模型在多个维度上的性能表现。SuperCLUE 通过多轮对话、客观题测试等多种方式,从语言理解与生成、知识应用、专业技能、环境适应与安全性等四大能力象限的 12 项基础能力进行评估。
主要能力
多维度能力评估
多轮对话测试
客观题与主观题结合
定期更新榜单
提供技术报告
语言理解与生成
适合场景
与人类表现进行对比
SuperCLUE 可用于与人类表现进行对比,适合先用一个真实任务验证输出质量。
