activeReasoning
HellaSwag
Metric: Accuracy (higher is better)Introduced: 2019
Commonsense sentence-completion benchmark using adversarially filtered wrong answers. Top LLMs now exceed 95% accuracy.
Models ranked
48
tracked on this benchmark
Score band
96.4 – 78.9
best → lowest tracked
Snapshot trend
+2.06
Sep 1 → Mar 6 · 47 models
Leaderboard
Tracked models ranked by Accuracy (higher is better).
#Model variant and provenanceRelative to leaderScore
1
GPT-4o (05-13)
96.4Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
2
Claude 3.5 Sonnet
96.2Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
3
Llama 3.1 405B
95.8Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
4
DeepSeek V3
95.7Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
5
Qwen2.5-72B-Instruct
95.6Version: standardHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
6
Llama 3.1 70B Instruct
94.2Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
7
Mistral Medium
93.9Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource: research
8
Mistral Large 2
93.8Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
9
Mixtral 8x22B v0.1
93.8Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource: research
10
Falcon 180B
92.7Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
11
Gemma 2 27B
92.6Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource: research
12
Llama 3 70B
92.4Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource: research
13
Qwen2-7B
92.0Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
14
Mistral NeMo Instruct (2407)
91.8Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
15
StarCoder2 15B
91.7Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource: research
16
DeepSeek Coder V2 Lite
91.4Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
17
Llama 3 8B Instruct
91.1Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource: research
18
Mixtral 8x7B
90.9Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
19
Command R
90.8Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource: research
20
Phi-3 Small 128K
90.8Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
21
Mistral 7B Instruct v0.3
90.2Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
22
Phi-3 Mini 128K
90.2Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
23
DeepSeek Math 7B Instruct
90.1Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
24
Mistral 7B Instruct v0.1
89.4Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
25
OpenChat 3.5 (0106)
89.3Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource: research
Showing the top 25 of 48 tracked models. Browse all models.
How to read this benchmark
This benchmark scores models where higher is better. Use scores for directional filtering and shortlisting, not universal quality ranking; then validate pricing, context window, provider availability, and fit for your workload.
Trust this score when
- There is a fresh timestamped snapshot (or multiple snapshots) for this benchmark.
- The model list covers the same version family you can actually deploy today.
- Top candidates overlap with your required routing and feature requirements.
Be cautious when
- There is only one benchmark snapshot or the dataset appears stale.
- The benchmark metric direction is opposite of your decision objective.
- The score difference between options is narrow and likely within implementation variance.
Related benchmarks
Last reviewed: Apr 15, 2026