HumanEval:基准测试详解
详细介绍 HumanEval 基准:分类、评估指标、数据来源与适用模型。
基准介绍
OpenAI 发布的 164 道 Python 编程任务,每题包含函数签名、文档字符串、函数体与单元测试,评估模型的代码生成能力(pass@1)。
评测指标
| 指标名 | 单位 | 方向 |
|---|---|---|
| pass@1 | pass@1 | ↑ 越高越好 |
数据来源
模型得分排名
HumanEval
描述
OpenAI 发布的 164 道 Python 编程任务,每题包含函数签名、文档字符串、函数体与单元测试,评估模型的代码生成能力(pass@1)。
核心规格
| 分类 | 许可证 | 最后更新 |
|---|---|---|
| coding | MIT | 2022-01-01 |
基准
| 单位 |
|---|
| pass@1 |