HumanEval:基准测试详解
详细介绍 HumanEval 基准:分类、评估指标、数据来源与适用模型。
Overview
OpenAI 发布的 164 道 Python 编程任务,每题包含函数签名、文档字符串、函数体与单元测试,评估模型的代码生成能力(pass@1)。
Metrics
| Metric | Unit | Direction |
|---|---|---|
| pass@1 | pass@1 | ↑ Higher is better |
Sources
Model Score Ranking
HumanEval
描述
OpenAI 发布的 164 道 Python 编程任务,每题包含函数签名、文档字符串、函数体与单元测试,评估模型的代码生成能力(pass@1)。
核心规格
| 分类 | 许可证 | 最后更新 |
|---|---|---|
| coding | MIT | 2022-01-01 |
基准
| 单位 |
|---|
| pass@1 |