activeCoding

DeepSWE 1.1

Metric: Pass@1 (higher is better)Introduced: 2026

DeepSWE 1.1 is Datacurve's June 2026 revised execution and grading setup for the same long-horizon DeepSWE tasks, grading committed patches in a clean isolated verifier environment and using mini-swe-agent for the public leaderboard. Model scores must preserve the mini-swe-agent harness/evaluator context.

Models ranked

16

tracked on this benchmark

Score band

74.2 – 42.2

best → lowest tracked

Snapshot trend

+2.55

Aug 26 → Sep 22 · 5 models

Leaderboard

Tracked models ranked by Pass@1 (higher is better).

Compare candidates
#Model variant and provenanceScore
1
DeepSeek V4.1 Flash
Version: DeepSWE 1.1 Resolved; mini-SWE harness; max reasoning effortHarness: Not recordedEvaluator: Not recordedObserved: Sep 10, 2026Confidence: Not recordedSource
74.2
2
GPT-6 Astra

Configuration: gpt-6-astra (Extra High)

Version: DeepSWE 1.1Harness: mini-swe-agent (Datacurve DeepSWE 1.1)Evaluator: DatacurveObserved: Sep 22, 2026Confidence: confirmedSource

Notes: Datacurve DeepSWE 1.1 leaderboard (113 tasks, mini-swe-agent, Pass@1 over 4 runs). Verified on https://deepswe.datacurve.ai/ (page generated_at 2026-09-22; page shows integer %%). Precise value from Epoch AI mirror deepswe_external.csv (Source column = deepswe.datacurve.ai). Highest-scoring published effort selected.

74.1
3
Gemini 3.8 Flash

Configuration: gemini-3.8-flash (High)

Version: DeepSWE 1.1Harness: mini-swe-agent (Datacurve DeepSWE 1.1)Evaluator: DatacurveObserved: Sep 22, 2026Confidence: confirmedSource

Notes: Datacurve DeepSWE 1.1 leaderboard (113 tasks, mini-swe-agent, Pass@1 over 4 runs). Verified on https://deepswe.datacurve.ai/ (page generated_at 2026-09-22; page shows integer %%). Precise value from Epoch AI mirror deepswe_external.csv (Source column = deepswe.datacurve.ai). Highest-scoring published effort selected.

73.8
4
GPT-5.6 Sol
Version: DeepSWE 1.1; OpenAI GA launch tableHarness: Not recordedEvaluator: Not recordedObserved: Jul 9, 2026Confidence: Not recordedSource

Notes: Official GPT-5.6 GA launch benchmark row.

72.7
5
Claude Opus 5

Configuration: Maximum effort

Version: DeepSWE v1.1Harness: 113 long-horizon agentic software-engineering tasks; five-trial averageEvaluator: AnthropicObserved: Jul 24, 2026Confidence: confirmedSource

Notes: Vendor-reported. Source: pp.149-150, Table 8.1.A and Figure 8.2. The effort sweep ranges from 57.7 at low to 68.8 at maximum.

68.8
6
Kimi K3

Configuration: kimi-k3 (Max)

Version: DeepSWE 1.1Harness: mini-swe-agent (Datacurve DeepSWE 1.1)Evaluator: DatacurveObserved: Sep 22, 2026Confidence: confirmedSource

Notes: Datacurve DeepSWE 1.1 leaderboard (113 tasks, mini-swe-agent, Pass@1 over 4 runs). Verified on https://deepswe.datacurve.ai/ (page generated_at 2026-09-22; page shows integer %%). Precise value from Epoch AI mirror deepswe_external.csv (Source column = deepswe.datacurve.ai). Highest-scoring published effort selected.

68.5
7
GLM-5.3
Version: DeepSWE v1.1Harness: Not recordedEvaluator: Not recordedObserved: Aug 14, 2026Confidence: Not recordedSource
66.9
8
Grok 4.6
Version: DeepSWE v1.1, Grok 4.6 High (xAI first-party evals table)Harness: Not recordedEvaluator: Not recordedObserved: Aug 12, 2026Confidence: Not recordedSource

Notes: xAI launch post evals table reports Grok 4.6 High at 65.9% on DeepSWE v1.1. Variant: Grok 4.6 High (same model ID grok-4.6; high is the API default reasoning_effort).

65.9
9
Gemini 3.7 Flash

Configuration: high thinking

Version: DeepSWE v1.1Harness: Not recordedEvaluator: Not recordedObserved: Aug 13, 2026Confidence: Not recordedSource
65.3
10
GLM-5.3-Flash
Version: DeepSWE v1.1Harness: Not recordedEvaluator: Not recordedObserved: Aug 26, 2026Confidence: Not recordedSource
63.4
11
Qwen3.8-Flash-Next
Version: DeepSWE 1.1Harness: Not recordedEvaluator: Not recordedObserved: Aug 26, 2026Confidence: Not recordedSource
58.7
12
Qwen3.8-Max
Version: DeepSWE 1.1Harness: Not recordedEvaluator: Not recordedObserved: Aug 12, 2026Confidence: Not recordedSource
56.6
13
Muse Spark 1.2

Configuration: muse-spark-1.2 (Extra High)

Version: DeepSWE 1.1Harness: mini-swe-agent (Datacurve DeepSWE 1.1)Evaluator: DatacurveObserved: Sep 22, 2026Confidence: confirmedSource

Notes: Datacurve DeepSWE 1.1 leaderboard (113 tasks, mini-swe-agent, Pass@1 over 4 runs). Verified on https://deepswe.datacurve.ai/ (page generated_at 2026-09-22; page shows integer %%). Precise value from Epoch AI mirror deepswe_external.csv (Source column = deepswe.datacurve.ai). Highest-scoring published effort selected.

54.9
14
Grok 4.5
Version: DeepSWE 1.1, Pass@1, mini-swe-agent harness run by Datacurve (xAI first-party claim)Harness: Not recordedEvaluator: Not recordedObserved: Jul 8, 2026Confidence: Not recordedSource

Notes: xAI launch blog DeepSWE 1.1 chart reports Grok 4.5 at 53% Pass@1. Evaluator/source: Datacurve with mini-swe-agent harness per xAI first-party claim. Variant: Grok 4.5 base API model. Harness status: mini-swe-agent (DeepSWE 1.1 public leaderboard setup). Confidence: medium for vendor-reported chart value, medium for harness identifiability. Recommended seed value: 53.

53.0
15
Gemini 3.6 Flash

Configuration: gemini-3.6-flash (High)

Version: DeepSWE 1.1Harness: mini-swe-agent (Datacurve DeepSWE 1.1)Evaluator: DatacurveObserved: Sep 22, 2026Confidence: confirmedSource

Notes: Datacurve DeepSWE 1.1 leaderboard (113 tasks, mini-swe-agent, Pass@1 over 4 runs). Verified on https://deepswe.datacurve.ai/ (page generated_at 2026-09-22; page shows integer %%). Precise value from Epoch AI mirror deepswe_external.csv (Source column = deepswe.datacurve.ai). Highest-scoring published effort selected.

46.7
16
Qwen3.8-27B
Version: DeepSWE 1.1Harness: Not recordedEvaluator: Not recordedObserved: Aug 14, 2026Confidence: Not recordedSource
42.2

How to read this benchmark

This benchmark scores models where higher is better. Use scores for directional filtering and shortlisting, not universal quality ranking; then validate pricing, context window, provider availability, and fit for your workload.

Trust this score when

  • There is a fresh timestamped snapshot (or multiple snapshots) for this benchmark.
  • The model list covers the same version family you can actually deploy today.
  • Top candidates overlap with your required routing and feature requirements.

Be cautious when

  • There is only one benchmark snapshot or the dataset appears stale.
  • The benchmark metric direction is opposite of your decision objective.
  • The score difference between options is narrow and likely within implementation variance.

Related benchmarks

Last reviewed: Jul 8, 2026