LLM Reference
activeReasoning

HellaSwag

Metric: Accuracy (higher is better)Introduced: 2019

Commonsense sentence-completion benchmark using adversarially filtered wrong answers. Top LLMs now exceed 95% accuracy.

Models ranked

48

tracked on this benchmark

Score band

96.4 – 78.9

best → lowest tracked

Snapshot trend

+2.06

Sep 1 → Mar 6 · 47 models

Leaderboard

Tracked models ranked by Accuracy (higher is better).

Compare candidates
#Model variant and provenanceScore
1
GPT-4o (05-13)
Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
96.4
2
Claude 3.5 Sonnet
Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
96.2
3
Llama 3.1 405B
Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
95.8
4
DeepSeek V3
Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
95.7
5
Qwen2.5-72B-Instruct
Version: standardHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
95.6
6
Llama 3.1 70B Instruct
Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
94.2
7
Mistral Medium
Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource: research
93.9
8
Mistral Large 2
Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
93.8
9
Mixtral 8x22B v0.1
Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource: research
93.8
10
Falcon 180B
Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
92.7
11
Gemma 2 27B
Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource: research
92.6
12
Llama 3 70B
Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource: research
92.4
13
Qwen2-7B
Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
92.0
14
Mistral NeMo Instruct (2407)
Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
91.8
15
StarCoder2 15B
Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource: research
91.7
16
DeepSeek Coder V2 Lite
Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
91.4
17
Llama 3 8B Instruct
Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource: research
91.1
18
Mixtral 8x7B
Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
90.9
19
Command R
Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource: research
90.8
20
Phi-3 Small 128K
Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
90.8
21
Mistral 7B Instruct v0.3
Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
90.2
22
Phi-3 Mini 128K
Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
90.2
23
DeepSeek Math 7B Instruct
Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
90.1
24
Mistral 7B Instruct v0.1
Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource
89.4
25
OpenChat 3.5 (0106)
Version: 10-shotHarness: Not recordedEvaluator: Not recordedObserved: Mar 6, 2026Confidence: Not recordedSource: research
89.3
Showing the top 25 of 48 tracked models. Browse all models.

How to read this benchmark

This benchmark scores models where higher is better. Use scores for directional filtering and shortlisting, not universal quality ranking; then validate pricing, context window, provider availability, and fit for your workload.

Trust this score when

  • There is a fresh timestamped snapshot (or multiple snapshots) for this benchmark.
  • The model list covers the same version family you can actually deploy today.
  • Top candidates overlap with your required routing and feature requirements.

Be cautious when

  • There is only one benchmark snapshot or the dataset appears stale.
  • The benchmark metric direction is opposite of your decision objective.
  • The score difference between options is narrow and likely within implementation variance.

Related benchmarks

Last reviewed: Apr 15, 2026