LLM Reference
activeAgents

MultiChallenge

Metric: % Score (higher is better)

Scale AI benchmark for multi-turn instruction following across instruction retention, inference memory, versioned editing, and self-coherence challenges.

Models ranked

12

tracked on this benchmark

Score band

71.4 – 41.2

best → lowest tracked

Snapshot trend

+3.48

Apr 26 → Jun 7 · 3 models

Leaderboard

Tracked models ranked by % Score (higher is better).

Compare candidates
#Model variant and provenanceScore
1
Gemini 3.1 Pro Preview
Version: MultiChallengeHarness: Not recordedEvaluator: Not recordedObserved: Apr 26, 2026Confidence: Not recordedSource
71.4
2
GPT-5.4
Version: MultiChallengeHarness: Not recordedEvaluator: Not recordedObserved: Apr 26, 2026Confidence: Not recordedSource
69.2
3
Qwen3.5-397B-A17B
Version: Multi-Challenge leaderboard rank 2 of 28 (accuracy%)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
67.6
4
Qwen3.5-122B-A10B
Version: Multi-Challenge leaderboard rank 7 of 28 (accuracy%)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
61.5
5
Kimi K2.5
Version: MultiChallengeHarness: Not recordedEvaluator: Not recordedObserved: Apr 26, 2026Confidence: Not recordedSource
61.4
6
Gemini 3.1 Flash Lite Preview
Version: MultiChallengeHarness: Not recordedEvaluator: Not recordedObserved: Apr 26, 2026Confidence: Not recordedSource
60.6
7
Claude Opus 4.7
Version: MultiChallengeHarness: Not recordedEvaluator: Not recordedObserved: Apr 26, 2026Confidence: Not recordedSource
58.6
8
Claude Sonnet 4.6
Version: MultiChallengeHarness: Not recordedEvaluator: Not recordedObserved: Apr 26, 2026Confidence: Not recordedSource
57.1
9
MAI-Thinking-1
Version: Multi-Challenge leaderboard rank 15 of 28 (accuracy%)Harness: Not recordedEvaluator: Not recordedObserved: Jun 7, 2026Confidence: Not recordedSource
53.0
10
Claude Haiku 4.5
Version: MultiChallengeHarness: Not recordedEvaluator: Not recordedObserved: Apr 26, 2026Confidence: Not recordedSource
50.5
11
o4-mini
Version: MultiChallengeHarness: Not recordedEvaluator: Not recordedObserved: Apr 26, 2026Confidence: Not recordedSource
44.9
12
Qwen3-Max
Version: MultiChallengeHarness: Not recordedEvaluator: Not recordedObserved: Apr 26, 2026Confidence: Not recordedSource
41.2

How to read this benchmark

This benchmark scores models where higher is better. Use scores for directional filtering and shortlisting, not universal quality ranking; then validate pricing, context window, provider availability, and fit for your workload.

Trust this score when

  • There is a fresh timestamped snapshot (or multiple snapshots) for this benchmark.
  • The model list covers the same version family you can actually deploy today.
  • Top candidates overlap with your required routing and feature requirements.

Be cautious when

  • There is only one benchmark snapshot or the dataset appears stale.
  • The benchmark metric direction is opposite of your decision objective.
  • The score difference between options is narrow and likely within implementation variance.

Related benchmarks

Last reviewed: Apr 26, 2026

Resources