LLM Reference
MMLUactiveGeneral

MMLU: Massive Multitask Language Understanding

Metric: Accuracy (higher is better)Introduced: 2021Superseded by: mmlu-pro

Tests LLMs on undergraduate to professional level knowledge across 57 subjects with 15,908 multiple-choice questions. Top models now saturate at 86–90%; MMLU-Pro is the recommended harder successor.

Models ranked

95

tracked on this benchmark

Score band

98.0 – 49.3

best → lowest tracked

Snapshot trend

+4.11

Jun 7 → Jul 3 · 1 models

Leaderboard

Tracked models ranked by Accuracy (higher is better).

Compare candidates
#Model variant and provenanceScore
1
Gemini 3.1 Pro Preview
Version: MMLU (accuracy)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
98.0
2
GPT-5.5
Version: MMLU (accuracy)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
92.4
3
Claude Opus 4.6
Version: MMLU (accuracy)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
91.1
4
DeepSeek V4 Pro
Version: 5-shotHarness: Not recordedEvaluator: Not recordedObserved: Apr 24, 2026Confidence: Not recordedSource
90.1
5
Xiaomi MiMo-V2.5-Pro
Version: Not recordedHarness: Not recordedEvaluator: Not recordedObserved: Apr 28, 2026Confidence: Not recordedSource
89.4
6
Claude Sonnet 4.6
Version: MMLU (accuracy)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
89.3
7
Claude 3 Opus
Version: 5-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
88.7
8
Claude 3.5 Sonnet
Version: 5-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
88.7
9
GPT-4o (05-13)
Version: 5-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
88.7
10
DeepSeek V4 Flash
Version: MMLU EM, DeepSeek-V4-Flash-Base, 5-shotHarness: Not recordedEvaluator: Not recordedObserved: Jul 3, 2026Confidence: Not recordedSource
88.7
11
Llama 3.1 405B
Version: 5-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
88.6
12
Llama 3.1 405B Instruct
Version: 5-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 7, 2026Confidence: Not recordedSource
88.6
13
DeepSeek V3
Version: 5-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
88.5
14
Qwen2.5-72B-Instruct
Version: 5-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
88.2
15
Qwen3-Coder-Next
Version: From official technical report arXiv:2603 (accuracy)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
87.7
16
Grok-2
Version: 5-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
87.5
17
GPT-4 Turbo
Version: 5-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 7, 2026Confidence: Not recordedSource
86.5
18
Qwen2.5-32B-Instruct
Version: 5-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
86.1
19
Qwen2.5-72B
Version: 5-shotHarness: Not recordedEvaluator: Not recordedObserved: Sep 1, 2024Confidence: Not recordedSource
86.1
20
Llama 3.1 70B Instruct
Version: 5-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
86.0
21
OLMo 3 32B Think
Version: From official HuggingFace model card (accuracy)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
85.4
22
Phi-4 14B
Version: Not recordedHarness: Not recordedEvaluator: Not recordedObserved: Apr 28, 2026Confidence: Not recordedSource
84.8
23
Mixtral 8x22B Instruct v0.1
Version: 5-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
84.5
24
Mixtral 8x22B v0.1
Version: 5-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource: research
84.5
25
Falcon 180B
Version: 5-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
84.2
Showing the top 25 of 95 tracked models. Browse all models.

How to read this benchmark

This benchmark scores models where higher is better. Use scores for directional filtering and shortlisting, not universal quality ranking; then validate pricing, context window, provider availability, and fit for your workload.

Trust this score when

  • There is a fresh timestamped snapshot (or multiple snapshots) for this benchmark.
  • The model list covers the same version family you can actually deploy today.
  • Top candidates overlap with your required routing and feature requirements.

Be cautious when

  • There is only one benchmark snapshot or the dataset appears stale.
  • The benchmark metric direction is opposite of your decision objective.
  • The score difference between options is narrow and likely within implementation variance.

Related benchmarks

Last reviewed: Apr 15, 2026