LLM Reference
activeCoding

HumanEval

Metric: Pass@1 (higher is better)Introduced: 2021

164 Python coding problems measuring functional correctness of code generation via pass@k metric. Released by OpenAI in 2021; HumanEval+ provides a more rigorous extension.

Models ranked

97

tracked on this benchmark

Score band

98.0 – 28.1

best → lowest tracked

Snapshot trend

-19.12

Jun 7 → Jul 3 · 1 models

Leaderboard

Tracked models ranked by Pass@1 (higher is better).

Compare candidates
#Model variant and provenanceScore
1
Claude Sonnet 4.6
Version: HumanEval (pass@1)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
98.0
2
o3
Version: 2025-04Harness: Not recordedEvaluator: Not recordedObserved: Apr 9, 2026Confidence: Not recordedSource
96.7
3
Claude Opus 4.6
Version: HumanEval (pass@1)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
95.0
4
Grok-3
Version: Not recordedHarness: Not recordedEvaluator: Not recordedObserved: Feb 17, 2025Confidence: Not recordedSource
94.5
5
GPT-5.5
Version: Not recordedHarness: Not recordedEvaluator: Not recordedObserved: Apr 29, 2026Confidence: Not recordedSource
94.2
6
Gemini 3.1 Pro Preview
Version: HumanEval (pass@1)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
94.0
7
Gemini 2.5 Pro
Version: 2025-03Harness: Not recordedEvaluator: Not recordedObserved: Apr 9, 2026Confidence: Not recordedSource
93.1
8
Claude 3.7 Sonnet
Version: 2025-02Harness: Not recordedEvaluator: Not recordedObserved: Apr 9, 2026Confidence: Not recordedSource
93.0
9
GPT-4.1
Version: 2025-04Harness: Not recordedEvaluator: Not recordedObserved: Apr 9, 2026Confidence: Not recordedSource
92.9
10
Qwen2.5-Coder-32B-Instruct
Version: 2024-11Harness: Not recordedEvaluator: Not recordedObserved: Apr 9, 2026Confidence: Not recordedSource
92.7
11
Qwen3-235B-A22B
Version: 2025-04Harness: Not recordedEvaluator: Not recordedObserved: Apr 9, 2026Confidence: Not recordedSource
92.7
12
Claude 3.5 Sonnet
Version: pass@1Harness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
92.0
13
Kimi K2.6
Version: Not recordedHarness: Not recordedEvaluator: Not recordedObserved: Apr 29, 2026Confidence: Not recordedSource
92.0
14
Mistral Large 3 675B Instruct
Version: Not recordedHarness: Not recordedEvaluator: Not recordedObserved: Dec 1, 2025Confidence: Not recordedSource
92.0
15
Gemini 3.5 Flash
Version: Not recordedHarness: Not recordedEvaluator: Not recordedObserved: May 25, 2026Confidence: Not recordedSource
92.0
16
OLMo 3 32B Think
Version: HumanEval (pass@1)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
91.4
17
GPT-4o (05-13)
Version: pass@1Harness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
90.2
18
Gemini 2.5 Flash
Version: 2025-05Harness: Not recordedEvaluator: Not recordedObserved: Apr 9, 2026Confidence: Not recordedSource
90.1
19
DeepSeek R1
Version: 2025-01Harness: Not recordedEvaluator: Not recordedObserved: Apr 9, 2026Confidence: Not recordedSource
89.9
20
Granite 4.1 30B
Version: pass@1, instruct model (pass@1)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
89.6
21
Llama 3.1 405B
Version: pass@1Harness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
89.0
22
Grok-2
Version: pass@1Harness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
88.4
23
Qwen2.5-32B-Instruct
Version: pass@1Harness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
88.4
24
Granite 4.1 8B
Version: pass@1, instruct model (pass@1)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
87.2
25
OLMo 3.1 32B Instruct
Version: HumanEval (pass@1)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
86.7
Showing the top 25 of 97 tracked models. Browse all models.

How to read this benchmark

This benchmark scores models where higher is better. Use scores for directional filtering and shortlisting, not universal quality ranking; then validate pricing, context window, provider availability, and fit for your workload.

Trust this score when

  • There is a fresh timestamped snapshot (or multiple snapshots) for this benchmark.
  • The model list covers the same version family you can actually deploy today.
  • Top candidates overlap with your required routing and feature requirements.

Be cautious when

  • There is only one benchmark snapshot or the dataset appears stale.
  • The benchmark metric direction is opposite of your decision objective.
  • The score difference between options is narrow and likely within implementation variance.

Related benchmarks

Last reviewed: Apr 15, 2026