Code & Software Engineering
Artificial Analysis public leaderboardCritPt
Critical-points programming evaluation published by Artificial Analysis.
Metric
Accuracy
Results shown
520
Publisher
Artificial Analysis
Snapshot
Fetched 2026-09-08T22:57:37.545Z
520 of 520 models
520 of 520 models
Higher is better
Ag
Agnes 2.5 Pro BetaAg
Agnes 2.5 Pro AlphaQu
Quasar 438B (max)A.
A.X-K2Ne
Nex-N2-ProIn
Inkling SmallMo
Motif 3Mo
Motif 3 (Beta)So
Solar Open2 250BIn
InklingSo
Solar Pro 4Hy
Hy3Ap
Apodex 1.1Hy
Hy3-previewK2
K2 Horizon 375B A23BRi
Ring-2.6-1TNe
Nemotron 3 UltraNe
Nemotron 3 SuperLo
LongCat 2.0St
Step 3.5 FlashSt
Step 3.5 Flash 2603St
Step 3.7 FlashLi
Ling 3.0 FlashER
ERNIE 5.0 Thinking PreviewGe
Gemma 4 31BAp
Apriel-v1.5-15B-ThinkerK-
K-EXAONEK-
K-EXAONE 2.0Hy
HyperNova 60B 2605 (high)Ne
Nemotron 3 NanoTr
Trinity Large ThinkingMe
Mercury 2Li
Ling-1TNe
Nemotron Cascade 2 30B A3BRi
Ring-1TGe
Gemma 4 E4BGr
Granite 4.2 30BMi
Mistral Small 4 (Non-reasoning)No
North Mini CodeLi
Ling-2.6-1TCo
Command A+IN
INTELLECT-3Mi
Mistral Small 4Do
Doubao Seed CodeEX
EXAONE 4.5 33BGe
Gemma 4 E4B (Non-reasoning)Tr
Tri-21B-ThinkNo
Nova 2.0 Lite (high)Mi
MiniCPM5-2BMa
Magistral Medium 1Ma
Magistral Small 1.2Sa
Sarvam 30B (high)He
Hermes 4 405BMa
Magistral Medium 1.2Ap
Apriel-v1.6-15B-ThinkerGr
Granite 4.2 8BHy
Hy3-preview (Non-reasoning)G9
G9v3-39A5BDi
DiffusionGemma 26B A4BFa
Falcon-H1R-7BRi
Ring-flash-2.0JT
JT-35B-FlashNo
Nova 2.0 Omni (medium)Ge
Gemma 4 12B (Non-reasoning)Ge
Gemma 3 270MMi
Mistral Medium 3.1De
Devstral 2Gr
Granite 4.2 3BNo
Nova 2.0 Pro Preview (medium)LF
LFM2 1.2BMa
Magistral Small 1No
Nova 2.0 Omni (Non-reasoning)Gr
Granite 4.0 MicroMi
Mistral 7BGe
Gemma 3 4BHe
Hermes 4 70B (Non-reasoning)Ne
Nemotron 3 Nano (Non-reasoning)Mi
Mistral Small 3.1Ne
Nemotron 3.5 LightningGe
Gemma 3 27BGr
Granite 3.3 8BGe
Gemma 3 12BNV
NVIDIA Nemotron Nano 9B V2 (Non-reasoning)EX
EXAONE 4.0 32B (Non-reasoning)G9
G9v3-3BOl
Olmo 3 7B ThinkHy
HyperCLOVA X SEED Think (32B)No
Nova MicroSa
Sarvam MOl
Olmo 3.1 32B ThinkCo
Command ALF
LFM2.5-VL-1.6BJT
JT-MINILi
Ling-mini-2.0Mo
Molmo2-8BMi
MiniCPM-V 4.6 1.3BMi
Mistral Small 3.2EX
EXAONE 4.0 32BSo
Solar Pro 2 (Non-reasoning)Sa
Sarvam 105B (high)LF
LFM2.5-1.2B-InstructMi
Mistral Large 3Ap
Apertus 70B InstructMi
Mistral Large 2 (Nov)No
Nova ProGr
Granite 4.0 350MSo
Solar Open 100BMi
Mistral Medium 3LF
LFM2.5-1.2B-ThinkingK2
K2 Think V2No
Nova LiteSe
Seed-OSS-36B-InstructGr
Granite 4.0 H SmallLo
LongCat Flash LiteTr
Tri-21B-think PreviewMo
Motif-2-12.7BMi
Ministral 3 3BLF
LFM2 8B A1BHe
Hermes 4 70BGe
Gemma 4 26B A4BNV
NVIDIA Nemotron Nano 12B v2 VLNo
Nova 2.0 Lite (low)Ge
Gemma 4 26B A4B (Non-reasoning)Mi
Ministral 3 14BLF
LFM2 2.6BGe
Gemma 4 E2B (Non-reasoning)No
Nova 2.0 Lite (Non-reasoning)Mi
MiniCPM5-1BJa
Jamba 1.7 LargeNa
Nanbeige4.1-3BLi
Ling 3.0 TinyCe
Celeris-1Ti
Tiny Aya GlobalEx
Exaone 4.0 1.2B (Non-reasoning)Gr
Granite 4.1 8BLi
Ling-flash-2.0Ap
Apertus 8B InstructNe
Nemotron 3 Nano Omni 30B A3BOl
Olmo 3 7BJT
JT-4.1 Flash 236B A21BGr
Granite 4.1 3BLi
Ling 2.6 FlashOl
Olmo 3.1 32B InstructMi
Ministral 3 8BK-
K-EXAONE (Non-reasoning)De
Devstral SmallNe
Nemotron 3 Nano 4BPh
Phi-4 MiniNo
Nova 2.0 Pro Preview (Non-reasoning)Gr
Granite 4.0 1BK2
K2-V2 (high)Gr
Granite 4.0 H 350MGe
Gemma 3n E4BGe
Gemma 3n E2BNV
NVIDIA Nemotron Nano 12B v2 VL (Non-reasoning)De
Devstral MediumSt
Step3 VL 10BER
ERNIE 4.5 300B A47BGe
Gemma 4 E2BNo
Nova 2.0 Omni (low)Ja
Jamba 1.7 MiniSo
Solar Pro 3Ol
Olmo 3 32B ThinkDe
Devstral Small (May)De
Devstral Small 2Ge
Gemma 4 31B (Non-reasoning)Ge
Gemma 3 1BMi
MiniCPM5-1B (Non-reasoning)He
Hermes 4 405B (Non-reasoning)Gr
Granite 4.1 30BEx
Exaone 4.0 1.2BK2
K2-V2 (low)Gr
Granite 4.0 H 1BRe
Reka Flash 3Mi
Mistral Medium 3.5K2
K2-V2 (medium)Mi
Mi:dm K 2.5 ProMi
Mi:dm K 2.5 Pro PreviewLF
LFM2.5-2.6BLF
LFM2.5-8B-A1BNo
Nova PremierCo
Cogito v2.1So
Solar Pro 2Ph
Phi-4NV
NVIDIA Nemotron Nano 9B V2No
Nova 2.0 Pro Preview (low)Ja
Jamba Reasoning 3BKA
KAT-Coder-Pro V1LF
LFM2 24B A2BNo
Nova 2.0 Lite (medium)KA
KAT-Coder-Pro V2Ge
Gemma 4 12BList bars visualize relative performance. Plot bars use published 0–100 scores, shrink to a 1.5rem minimum, then scroll horizontally.
Scores are published snapshots and are only comparable within the same benchmark, version, metric, and evaluation configuration.