GenAiHub
Code & Software Engineering
Multilingual software-engineering tasks · 2026

SWE Multilingual

A multilingual software-engineering benchmark for real-world code issue resolution across multiple programming languages.

Metric

Resolved

Results shown

48

Publisher

BenchLM exact-source leaderboard

Snapshot

Fetched 2026-10-08T23:19:29.645Z

48 of 48 models

48 of 48 models

Higher is better

Claude Opus 5.5 logo
Claude Opus 5.5
Claude Sonnet 5.5 logo
Claude Sonnet 5.5
Claude Opus 5 logo
Claude Opus 5
Claude Fable 5.1 logo
Claude Fable 5.1
Claude Opus 4.8 logo
Claude Opus 4.8
Hy
Hy4 preview
Qwen3.8-Flash-Next logo
Qwen3.8-Flash-Next
Qwen3.8-Omni-Flash logo
Qwen3.8-Omni-Flash
Co
Composer 2.5
Or
Ornith-1.5-397B
Or
Ornith-1.0-397B
La
Laguna S 2.1
Qwen3.7 Max logo
Qwen3.7 Max
Claude Sonnet 5 logo
Claude Sonnet 5
Grok 4.5 logo
Grok 4.5
Be
Beam
SW
SWE-1.7
Claude Opus 4.5 logo
Claude Opus 4.5
Kimi K2.6 logo
Kimi K2.6
MiniMax M2.7 logo
MiniMax M2.7
DeepSeek V4 Pro 0813 logo
DeepSeek V4 Pro 0813
Qwen3.7 Plus logo
Qwen3.7 Plus
do
dots3-note Preview
DeepSeek V4 Pro (High) logo
DeepSeek V4 Pro (High)
Qwen3.6 Plus logo
Qwen3.6 Plus
Co
Composer 2
GLM-5 logo
GLM-5
DeepSeek V4 Flash 0731 logo
DeepSeek V4 Flash 0731
Kimi K2.5 logo
Kimi K2.5
Li
Ling 3.0 Flash
Or
Ornith-1.5-35B-A3B
Qwen3.6-27B logo
Qwen3.6-27B
DeepSeek V4 Flash (High) logo
DeepSeek V4 Flash (High)
DeepSeek V4 Pro logo
DeepSeek V4 Pro
DeepSeek V4 Flash logo
DeepSeek V4 Flash
Or
Ornith-1.0-35B
Ne
Nemotron 3 Ultra
Qwen3.6-35B-A3B logo
Qwen3.6-35B-A3B
La
Laguna M.1
La
Laguna XS 2.1
Lo
LongCat-Flash-Lite-Sparse
La
Laguna XS.2
Or
Ornith-1.5-9B
Or
Ornith-1.0-9B
Gr
Granite 4.2 30B
Ne
Nemotron 3.5 Lightning 30B A3B NVFP4
Gr
Granite 4.2 8B
LL
LLaDA2.2-flash
List bars visualize relative performance. Plot bars use published 0–100 scores, shrink to a 1.5rem minimum, then scroll horizontally.

Scores are published snapshots and are only comparable within the same benchmark, version, metric, and evaluation configuration.