AI Benchmark Hub 引用的所有基准测试。

ARC

ARC

reasoning

小学级别科学考试问题集,分为Easy和Challenge两个子集,挑战子集需要推理能力

BBH

BBH (BIG-Bench Hard)

reasoning

BIG-Bench 的 23 个最难任务子集,覆盖逻辑推理、符号操作、常识推理等领域,传统模型表现不佳,用于评估模型的复杂推理能力。

GPQA

GPQA

knowledge

由生物学、物理学、化学领域的博士专家撰写的难题集,确保问题难以通过Google搜索直接找到答案

GSM8K

GSM8K (Grade School Math 8K)

math

OpenAI 发布的 8500 道小学数学应用题,需要 2-8 步推理求解,评估模型的多步数学推理与基础算术能力。

HUMANEVAL

HumanEval

coding

OpenAI 发布的 164 道 Python 编程任务,每题包含函数签名、文档字符串、函数体与单元测试,评估模型的代码生成能力(pass@1)。

IFEVAL

IFEval

reasoning

评估大型语言模型严格遵循指令的能力,包含500个可验证的指令

MATH

MATH

math

12,500 道竞赛数学题(含 7 个学科:代数、几何、数论、微积分、概率等,5 个难度级别),评估模型的复杂数学推理能力。

MMLU

MMLU (Massive Multitask Language Understanding)

knowledge

57 学科多选题知识评测,覆盖人文、社科、STEM、医学等领域,共 14042 道题,评估模型的广泛世界知识与问题解决能力。

MUSR

MUSR

reasoning

评估多步骤软推理能力,包含逻辑、数学和高效推理三个领域各250个问题

WINOGRANDE

WinoGrande

reasoning

大规模Winograd Schema挑战集,需要常识推理来消除代词指代歧义