MMLUactiveGeneral
MMLU: Massive Multitask Language Understanding
Metric: Accuracy (higher is better)Introduced: 2021Superseded by: mmlu-pro
Tests LLMs on undergraduate to professional level knowledge across 57 subjects with 15,908 multiple-choice questions. Top models now saturate at 86–90%; MMLU-Pro is the recommended harder successor.
Models ranked
95
tracked on this benchmark
Score band
98.0 – 49.3
best → lowest tracked
Snapshot trend
+4.11
Jun 7 → Jul 3 · 1 models
Leaderboard
Tracked models ranked by Accuracy (higher is better).
#Model variant and provenanceRelative to leaderScore
1
Gemini 3.1 Pro Preview
98.0Version: MMLU (accuracy)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
2
GPT-5.5
92.4Version: MMLU (accuracy)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
3
Claude Opus 4.6
91.1Version: MMLU (accuracy)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
4
DeepSeek V4 Pro
90.1Version: 5-shotHarness: Not recordedEvaluator: Not recordedObserved: Apr 24, 2026Confidence: Not recordedSource
5
Xiaomi MiMo-V2.5-Pro
89.4Version: Not recordedHarness: Not recordedEvaluator: Not recordedObserved: Apr 28, 2026Confidence: Not recordedSource
6
Claude Sonnet 4.6
89.3Version: MMLU (accuracy)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
7
Claude 3 Opus
88.7Version: 5-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
8
Claude 3.5 Sonnet
88.7Version: 5-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
9
GPT-4o (05-13)
88.7Version: 5-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
10
DeepSeek V4 Flash
88.7Version: MMLU EM, DeepSeek-V4-Flash-Base, 5-shotHarness: Not recordedEvaluator: Not recordedObserved: Jul 3, 2026Confidence: Not recordedSource
11
Llama 3.1 405B
88.6Version: 5-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
12
Llama 3.1 405B Instruct
88.6Version: 5-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 7, 2026Confidence: Not recordedSource
13
DeepSeek V3
88.5Version: 5-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
14
Qwen2.5-72B-Instruct
88.2Version: 5-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
15
Qwen3-Coder-Next
87.7Version: From official technical report arXiv:2603 (accuracy)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
16
Grok-2
87.5Version: 5-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
17
GPT-4 Turbo
86.5Version: 5-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 7, 2026Confidence: Not recordedSource
18
Qwen2.5-32B-Instruct
86.1Version: 5-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
19
Qwen2.5-72B
86.1Version: 5-shotHarness: Not recordedEvaluator: Not recordedObserved: Sep 1, 2024Confidence: Not recordedSource
20
Llama 3.1 70B Instruct
86.0Version: 5-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
21
OLMo 3 32B Think
85.4Version: From official HuggingFace model card (accuracy)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
22
Phi-4 14B
84.8Version: Not recordedHarness: Not recordedEvaluator: Not recordedObserved: Apr 28, 2026Confidence: Not recordedSource
23
Mixtral 8x22B Instruct v0.1
84.5Version: 5-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
24
Mixtral 8x22B v0.1
84.5Version: 5-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource: research
25
Falcon 180B
84.2Version: 5-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
Showing the top 25 of 95 tracked models. Browse all models.
How to read this benchmark
This benchmark scores models where higher is better. Use scores for directional filtering and shortlisting, not universal quality ranking; then validate pricing, context window, provider availability, and fit for your workload.
Trust this score when
- There is a fresh timestamped snapshot (or multiple snapshots) for this benchmark.
- The model list covers the same version family you can actually deploy today.
- Top candidates overlap with your required routing and feature requirements.
Be cautious when
- There is only one benchmark snapshot or the dataset appears stale.
- The benchmark metric direction is opposite of your decision objective.
- The score difference between options is narrow and likely within implementation variance.
Related benchmarks
Last reviewed: Apr 15, 2026