返回工具列表

智能体与自动化

HELM

HELM是由斯坦福大学推出的大模型评测体系,该评测方法主要包括场景、适配、指标三个模块,每次评测的运行都需要指定一个场景,一个适配模型的提示,以及一个或多个指标。

访问官网 更新于 2026/04/15
工具分类智能体与自动化按实际使用场景归类
官网入口crfm.stanford.edu保留原站直达链接
收费方式官网可查看最终价格以官网为准
关注人数8A+ 优先推荐

HELM 是什么

HELM 是一款面向 智能体与自动化 场景的 AI 工具,斯坦福大学推出的大模型评测体系。

HELM全称Holistic Evaluation of Language Models(语言模型整体评估)是斯坦福大学推出的大模型评测体系,评测方法主要包括场景、适配、指标三大模块,每次评测的运行都需要指定一个场景,一个适配模型的提示,以及一个或多个指标。它评测主要覆盖的是英语,通过准确率、不确定性/校准、鲁棒性、公平性、偏差、毒性、推断效率综合评测模型表现,适用问答、信息检索、文本分类等任务,为语言模型提供更全面、系统的评估方法,帮助研究人员和开发者更好地理解和优化模型性能。 全面的评估能力 :HELM支持多种语言模型任务(如问答、文本分类、信息检索、文本生成、摘要等),提供多种评估指标(包括准确率、鲁棒性、公平性、偏差、毒性、推断效率等),能够从多个维度全面评估语言模型的性能。

HELM是由斯坦福大学推出的大模型评测体系,该评测方法主要包括场景、适配、指标三个模块,每次评测的运行都需要指定一个场景,一个适配模型的提示,以及一个或多个指标。

主要能力

01AI模型评测

全面的评估能力

02核心能力 02

可复现性与透明性

03核心能力 03

多模态支持

04核心能力 04

自定义扩展

05核心能力 05

安装HELM

06核心能力 06

基于pip安装

适合场景

01
场景

HELM 可用于场景,适合先用一个真实任务验证输出质量。

02
适配

HELM 可用于适配,适合先用一个真实任务验证输出质量。

03
指标三大模块

HELM 可用于指标三大模块,适合先用一个真实任务验证输出质量。

04
更全面

HELM 可用于更全面,适合先用一个真实任务验证输出质量。

05
系统的评估方法

HELM 可用于系统的评估方法,适合先用一个真实任务验证输出质量。

06
文本分类

HELM 可用于文本分类,适合先用一个真实任务验证输出质量。