GenAiHub
Code & Software Engineering
1,865 repository problems · 2025

SWE-bench Pro

A long-horizon repository benchmark built to test realistic software engineering work. Its scores need a task-quality and setup check before they support a coding-agent decision.

Metric

Resolved

Results shown

78

Publisher

BenchLM exact-source leaderboard

Snapshot

Fetched 2026-10-08T23:19:28.332Z

78 of 78 models

78 of 78 models

Higher is better

Claude Opus 5.5 logo
Claude Opus 5.5
Claude Sonnet 5.5 logo
Claude Sonnet 5.5
Claude Fable 5.1 logo
Claude Fable 5.1
Claude Mythos 5 logo
Claude Mythos 5
Claude Fable 5 logo
Claude Fable 5
Claude Opus 5 logo
Claude Opus 5
Sa
Sakana Fugu-Ultra
Claude Opus 4.8 logo
Claude Opus 4.8
Qwen3.8 Max logo
Qwen3.8 Max
Hy
Hy4 preview
Be
Beam
Or
Ornith-1.5-397B
Grok 4.5 logo
Grok 4.5
GPT-5.6 Sol logo
GPT-5.6 Sol
Claude Opus 4.7 (Adaptive) logo
Claude Opus 4.7 (Adaptive)
GPT-5.6 Terra logo
GPT-5.6 Terra
Qwen3.8-Omni-Flash logo
Qwen3.8-Omni-Flash
Claude Sonnet 5 logo
Claude Sonnet 5
GPT-5.6 Luna logo
GPT-5.6 Luna
Qwen3.8-Flash-Next logo
Qwen3.8-Flash-Next
Or
Ornith-1.0-397B
GLM-5.2 logo
GLM-5.2
Qwen3.8-27B logo
Qwen3.8-27B
Muse Spark 1.1 logo
Muse Spark 1.1
do
dots3-note Preview
Qwen3.7 Max logo
Qwen3.7 Max
At
Atria Dawn Preview
Or
Ornith-1.5-35B-A3B
La
Laguna S 2.1
MiniMax M3 logo
MiniMax M3
Sa
Sakana Fugu
GPT-5.5 logo
GPT-5.5
Kimi K2.6 logo
Kimi K2.6
GLM-5.1 logo
GLM-5.1
GPT-5.4 logo
GPT-5.4
Qwen3.7 Plus logo
Qwen3.7 Plus
Qwen 3.6 Max (preview) logo
Qwen 3.6 Max (preview)
MiMo-V2.5-Pro logo
MiMo-V2.5-Pro
Claude Opus 4.5 logo
Claude Opus 4.5
GPT-5.3 Codex logo
GPT-5.3 Codex
Qwen3.6 Plus logo
Qwen3.6 Plus
Li
Ling 3.0 Flash
St
Step 3.7 Flash
MiniMax M2.7 logo
MiniMax M2.7
MiMo-V2.5 logo
MiMo-V2.5
In
Inkling-Small
GPT-5.2 logo
GPT-5.2
DeepSeek V4 Pro 0813 logo
DeepSeek V4 Pro 0813
Gemini 3.5 Flash logo
Gemini 3.5 Flash
GLM-5 logo
GLM-5
DeepSeek V4 Pro (High) logo
DeepSeek V4 Pro (High)
In
Inkling
Gemini 3.5 Flash-Lite logo
Gemini 3.5 Flash-Lite
Qwen3.6-27B logo
Qwen3.6-27B
Claude Opus 4.6 logo
Claude Opus 4.6
MA
MAI-Thinking-1
DeepSeek V4 Flash 0731 logo
DeepSeek V4 Flash 0731
Muse Spark logo
Muse Spark
DeepSeek V4 Flash (High) logo
DeepSeek V4 Flash (High)
DeepSeek V4 Pro logo
DeepSeek V4 Pro
Grok 4.20 logo
Grok 4.20
Muse Glimmer 30B logo
Muse Glimmer 30B
Qwen3.5 397B logo
Qwen3.5 397B
Kimi K2.5 logo
Kimi K2.5
Or
Ornith-1.0-35B
Qwen3.6-35B-A3B logo
Qwen3.6-35B-A3B
La
Laguna M.1
DeepSeek V4 Flash logo
DeepSeek V4 Flash
La
Laguna XS 2.1
Or
Ornith-1.5-9B
La
Laguna XS.2
Or
Ornith-1.0-9B
Lo
LongCat-Flash-Lite-Sparse
Gr
Granite 4.2 30B
LL
LLaDA2.2-flash
Me
Mellum2.1-12B-A2.5B-Thinking
Gr
Granite 4.2 8B
Mi
MiniCPM5-2B
List bars visualize relative performance. Plot bars use published 0–100 scores, shrink to a 1.5rem minimum, then scroll horizontally.

Scores are published snapshots and are only comparable within the same benchmark, version, metric, and evaluation configuration.