activeGeneral
MMLU PRO
Metric: Accuracy (higher is better)Introduced: 2024
Enhanced MMLU with 10-option questions (vs 4 in original), harder problems filtered through expert review, and reduced shortcuts. Maintains coverage of 57 academic subjects.
Models ranked
105
tracked on this benchmark
Score band
91.8 – 20.0
best → lowest tracked
Snapshot trend
+7.43
Jun 7 → Jul 3 · 1 models
Leaderboard
Tracked models ranked by Accuracy (higher is better).
#Model variant and provenanceRelative to leaderScore
1
Gemini 3 Pro
91.8Version: Not recordedHarness: Not recordedEvaluator: Not recordedObserved: Dec 11, 2025Confidence: Not recordedSource
2
Gemini 3.1 Pro Preview
91.0Version: MMLU-Pro (accuracy)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
3
Qwen3.7-Max
89.6Version: MMLU-Pro (accuracy)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
4
Claude Opus 4.6
89.1Version: Not recordedHarness: Not recordedEvaluator: Not recordedObserved: Apr 19, 2026Confidence: Not recordedSource
5
Claude Opus 4.5
88.9Version: Not recordedHarness: Not recordedEvaluator: Not recordedObserved: Apr 14, 2026Confidence: Not recordedSource
6
Gemini 3 Flash
88.6Version: Not recordedHarness: Not recordedEvaluator: Not recordedObserved: Apr 19, 2026Confidence: Not recordedSource
7
Qwen3.6 Max Preview
88.5Version: MMLU-Pro (accuracy)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
8
Qwen3.6-Plus
88.5Version: MMLU-Pro (accuracy)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
9
Gemini 2.5 Flash
88.4Version: Not recordedHarness: Not recordedEvaluator: Not recordedObserved: Jun 17, 2025Confidence: Not recordedSource
10
GPT-5.5
88.1Version: Not recordedHarness: Not recordedEvaluator: Not recordedObserved: Apr 29, 2026Confidence: Not recordedSource
11
Qwen3.5-397B-A17B
87.8Version: From official HuggingFace model card (accuracy)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
12
ByteDance Doubao Seed 2.0 Lite
87.7Version: MMLU-Pro (accuracy)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
13
Seed 2.0 Lite
87.7Version: From third-party comparison citing ByteDance official figures (accuracy%)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
14
GPT-5.4
87.5Version: Not recordedHarness: Not recordedEvaluator: Not recordedObserved: Apr 19, 2026Confidence: Not recordedSource
15
DeepSeek V4 Pro
87.5Version: Think Max mode (accuracy)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
16
Claude Sonnet 4.6
87.3Version: Not recordedHarness: Not recordedEvaluator: Not recordedObserved: Apr 19, 2026Confidence: Not recordedSource
17
Kimi K2.5
87.1Version: Thinking mode (accuracy)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
18
Grok 4
87.0Version: Not recordedHarness: Not recordedEvaluator: Not recordedObserved: Apr 14, 2026Confidence: Not recordedSource
19
ByteDance Doubao Seed 2.0 Pro
87.0Version: From ByteDance official launch materials (accuracy)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
20
ERNIE 5.0
87.0Version: From official ERNIE 5 (accuracy%)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
21
Qwen3.5-122B-A10B
86.7Version: From official HuggingFace model card (accuracy)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
22
DeepSeek V4 Flash
86.4Version: MMLU-Pro EM, V4-Flash Think HighHarness: Not recordedEvaluator: Not recordedObserved: Jul 3, 2026Confidence: Not recordedSource
23
Gemini 2.5 Pro
86.2Version: Not recordedHarness: Not recordedEvaluator: Not recordedObserved: Apr 14, 2026Confidence: Not recordedSource
24
Qwen3.6-27B
86.2Version: From official HuggingFace model card (accuracy)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
Showing the top 25 of 105 tracked models. Browse all models.
How to read this benchmark
This benchmark scores models where higher is better. Use scores for directional filtering and shortlisting, not universal quality ranking; then validate pricing, context window, provider availability, and fit for your workload.
Trust this score when
- There is a fresh timestamped snapshot (or multiple snapshots) for this benchmark.
- The model list covers the same version family you can actually deploy today.
- Top candidates overlap with your required routing and feature requirements.
Be cautious when
- There is only one benchmark snapshot or the dataset appears stale.
- The benchmark metric direction is opposite of your decision objective.
- The score difference between options is narrow and likely within implementation variance.
Related benchmarks
Last reviewed: Apr 15, 2026