activeMathematics
AIME 2025
Metric: Score (higher is better)
American Invitational Mathematics Examination 2025 problems
Models ranked
31
tracked on this benchmark
Score band
98.4 – 14.0
best → lowest tracked
Snapshot trend
-5.30
Jun 2 → Jul 1 · 1 models
Leaderboard
Tracked models ranked by Score (higher is better).
#Model variant and provenanceRelative to leaderScore
1
o4-mini
98.4Version: Not recordedHarness: Not recordedEvaluator: Not recordedObserved: Apr 16, 2025Confidence: Not recordedSource
2
ByteDance Doubao Seed 2.0 Pro
98.3Version: AIME 2025 (accuracy)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
3
Qwen3.6-Max
97.3Version: Not recordedHarness: Not recordedEvaluator: Not recordedObserved: Apr 13, 2026Confidence: Not recordedSource
4
Step 3.5 Flash
97.3Version: From official StepFun blog post (accuracy%)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
5
MAI-Thinking-1
97.0Version: AIME 2025Harness: Not recordedEvaluator: Not recordedObserved: Jun 2, 2026Confidence: Not recordedSource
Notes: Official Microsoft AI announcement result for MAI-Thinking-1.
6
Kimi K2.5
96.1Version: Thinking mode (accuracy)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
7
Ring-2.6-1T
95.8Version: AIME 2026 (accuracy)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
8
GLM-5.1
95.3Version: AIME 2026 (accuracy)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
9
Gemini 3.1 Pro Preview
95.0Version: AIME 2025 (accuracy)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
10
GPT-5
94.6Version: Not recordedHarness: Not recordedEvaluator: Not recordedObserved: Aug 7, 2025Confidence: Not recordedSource
11
Claude Opus 4.6
94.2Version: AIME 2025 (accuracy)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
12
Xiaomi MiMo-V2.5
94.1Version: From HuggingFace model card for MiMo-V2 (accuracy%)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
13
Claude Sonnet 4.6
94.0Version: AIME 2025 (accuracy)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
14
Grok-3
93.3Version: Not recordedHarness: Not recordedEvaluator: Not recordedObserved: Feb 17, 2025Confidence: Not recordedSource
15
ByteDance Doubao Seed 2.0 Lite
93.0Version: AIME 2025 (accuracy)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
16
GLM-5
92.7Version: AIME 2026 (accuracy)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
17
Nemotron-Cascade-2-30B-A3B
92.4Version: AIME 2025 (accuracy)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
18
Grok 4
91.7Version: AIME 2025 no tools, pass@1, base Grok 4Harness: Not recordedEvaluator: Not recordedObserved: Jul 1, 2026Confidence: Not recordedSource
19
MiniMax M2.7
91.0Version: AIME 2025 (accuracy)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
20
Nemotron 3 Super-120B-A12B
90.2Version: Widely reported from NVIDIA launch materials (accuracy)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
21
Command A+
90.0Version: AIME 2025 (accuracy)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
22
o3
88.9Version: AIME 2025 pass@1, high reasoningHarness: Not recordedEvaluator: Not recordedObserved: Apr 16, 2025Confidence: Not recordedSource
Notes: DAT-5669: official OpenAI o3 launch figure.
23
DeepSeek R1 0528
87.5Version: Not recordedHarness: Not recordedEvaluator: Not recordedObserved: May 28, 2025Confidence: Not recordedSource
24
ERNIE 5.0
87.0Version: From official ERNIE 5 (accuracy%)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
25
Gemini 2.5 Pro
86.7Version: AIME 2025 pass@1, extended thinkingHarness: Not recordedEvaluator: Not recordedObserved: Mar 25, 2025Confidence: Not recordedSource
Notes: DAT-5669: official Google launch figure for Gemini 2.5 Pro exp-03-25.
Showing the top 25 of 31 tracked models. Browse all models.
How to read this benchmark
This benchmark scores models where higher is better. Use scores for directional filtering and shortlisting, not universal quality ranking; then validate pricing, context window, provider availability, and fit for your workload.
Trust this score when
- There is a fresh timestamped snapshot (or multiple snapshots) for this benchmark.
- The model list covers the same version family you can actually deploy today.
- Top candidates overlap with your required routing and feature requirements.
Be cautious when
- There is only one benchmark snapshot or the dataset appears stale.
- The benchmark metric direction is opposite of your decision objective.
- The score difference between options is narrow and likely within implementation variance.
Related benchmarks
Last reviewed: May 20, 2026