Instruction Following & Long Context
Artificial Analysis public leaderboardLong Context Reasoning
Long-context reasoning results published by Artificial Analysis.
Metric
Accuracy
Results shown
516
Publisher
Artificial Analysis
Snapshot
Fetched 2026-09-08T22:57:37.545Z
516 of 516 models
516 of 516 models
Higher is better
Ag
Agnes 2.5 Pro BetaNe
Nex-N2-ProK2
K2 Horizon 375B A23BAp
Apodex 1.1Ne
Nemotron 3 UltraHy
Hy3In
InklingQu
Quasar 438B (max)Mo
Motif 3In
Inkling SmallAg
Agnes 2.5 Pro AlphaMo
Motif 3 (Beta)So
Solar Pro 4St
Step 3.7 FlashLi
Ling 3.0 FlashKA
KAT-Coder-Pro V2Do
Doubao Seed CodeSo
Solar Open2 250BJT
JT-4.1 Flash 236B A21BA.
A.X-K2Ri
Ring-2.6-1TGe
Gemma 4 31BMi
Mistral Medium 3.5JT
JT-35B-FlashNe
Nemotron 3 SuperGe
Gemma 4 26B A4BG9
G9v3-39A5BLo
LongCat 2.0Hy
Hy3-previewNo
Nova 2.0 Pro Preview (low)No
Nova 2.0 Pro Preview (medium)Ge
Gemma 4 12BSt
Step 3.5 Flash 2603Se
Seed-OSS-36B-InstructK-
K-EXAONENe
Nemotron 3.5 LightningNo
Nova 2.0 Lite (high)Li
Ling 3.0 TinyK-
K-EXAONE 2.0No
Nova 2.0 Lite (medium)No
Nova 2.0 Omni (medium)Mi
MiniCPM5-2BNo
Nova 2.0 Omni (low)K2
K2 Think V2EX
EXAONE 4.5 33BRi
Ring-1TNo
Nova 2.0 Lite (low)K-
K-EXAONE (Non-reasoning)Ma
Magistral Medium 1.2Co
Command A+St
Step 3.5 FlashMi
Mistral Small 4Gr
Granite 4.2 30BGe
Gemma 4 31B (Non-reasoning)Gr
Granite 4.2 8BMe
Mercury 2Ge
Gemma 4 26B A4B (Non-reasoning)Hy
Hy3-preview (Non-reasoning)Li
Ling-2.6-1TG9
G9v3-3BSo
Solar Open 100BNV
NVIDIA Nemotron Nano 12B v2 VLIN
INTELLECT-3Ne
Nemotron 3 Nano Omni 30B A3BNe
Nemotron Cascade 2 30B A3BKA
KAT-Coder-Pro V1Ne
Nemotron 3 NanoCe
Celeris-1Tr
Trinity Large ThinkingNo
North Mini CodeLi
Ling-1THy
HyperNova 60B 2605 (high)Mi
Mistral Large 3Ge
Gemma 4 12B (Non-reasoning)K2
K2-V2 (high)No
Nova PremierDe
Devstral 2So
Solar Pro 3De
Devstral MediumDe
Devstral Small (May)Ge
Gemma 4 E4BMi
Mistral Medium 3Li
Ling 2.6 FlashNo
Nova 2.0 Pro Preview (Non-reasoning)Mi
Mistral Small 4 (Non-reasoning)Lo
LongCat Flash LiteDe
Devstral Small 2K2
K2-V2 (medium)Qw
QwQ-32BMi
Ministral 3 14BMi
Ministral 3 8BNo
Nova 2.0 Omni (Non-reasoning)Gr
Granite 4.2 3BNV
NVIDIA Nemotron Nano 9B V2 (Non-reasoning)Ge
Gemma 4 E4B (Non-reasoning)Gr
Granite 4.1 30BCo
Cogito v2.1NV
NVIDIA Nemotron Nano 9B V2Mi
Mistral Small 3.1He
Hermes 4 405BHe
Hermes 4 405B (Non-reasoning)Tr
Tri-21B-think PreviewNe
Nemotron 3 Nano 4BCo
Command AAp
Apriel-v1.5-15B-ThinkerRi
Ring-flash-2.0No
Nova ProNV
NVIDIA Nemotron Nano 12B v2 VL (Non-reasoning)Mi
Mistral Small 3.2K2
K2-V2 (low)Di
DiffusionGemma 26B A4BMa
Magistral Small 1.2Ja
Jamba 1.7 LargeNo
Nova LiteNo
Nova 2.0 Lite (Non-reasoning)De
Devstral SmallLi
Ling-flash-2.0Mi
Ministral 3 3BGe
Gemma 4 E2B (Non-reasoning)Ge
Gemma 4 E2BJa
Jamba 1.7 MiniTr
Tri-21B-ThinkPh
Phi-4 MiniMo
Motif-2-12.7BMi
Mi:dm K 2.5 Pro PreviewHy
HyperCLOVA X SEED Think (32B)Gr
Granite 4.1 8BNo
Nova MicroJT
JT-MINIGr
Granite 4.0 H SmallFa
Falcon-H1R-7BNe
Nemotron 3 Nano (Non-reasoning)He
Hermes 4 70BMi
Mi:dm K 2.5 ProGe
Gemma 3 12BGe
Gemma 3 27BGr
Granite 4.0 MicroMi
MiniCPM-V 4.6 1.3BGr
Granite 4.0 H 1BGe
Gemma 3 4BJa
Jamba Reasoning 3BMi
MiniCPM5-1BGr
Granite 4.1 3BGr
Granite 4.0 1BLF
LFM2.5-2.6BMi
MiniCPM5-1B (Non-reasoning)He
Hermes 4 70B (Non-reasoning)Mi
Mistral Large 2 (Jul)Ge
Gemma 3 270MLF
LFM2 1.2BMa
Magistral Small 1Mi
Mistral 7BOl
Olmo 3 7B ThinkSa
Sarvam MOl
Olmo 3.1 32B ThinkLF
LFM2.5-VL-1.6BMo
Molmo2-8BSo
Solar Pro 2 (Non-reasoning)Sa
Sarvam 105B (high)LF
LFM2.5-1.2B-InstructAp
Apertus 70B InstructOL
OLMo 2 32BGr
Granite 4.0 350MLF
LFM2.5-1.2B-ThinkingMa
Magistral Medium 1LF
LFM2 2.6BSa
Sarvam 30B (high)Na
Nanbeige4.1-3BTi
Tiny Aya GlobalEx
Exaone 4.0 1.2B (Non-reasoning)Ap
Apertus 8B InstructOl
Olmo 3 7BOl
Olmo 3.1 32B InstructGr
Granite 4.0 H 350MGe
Gemma 3n E4BGe
Gemma 3n E2BSt
Step3 VL 10BMo
Molmo 7B-DOl
Olmo 3 32B ThinkGe
Gemma 3 1BEx
Exaone 4.0 1.2BRe
Reka Flash 3LF
LFM2.5-8B-A1BMi
Mistral Small 3So
Solar Pro 2Ph
Phi-4OL
OLMo 2 7BLF
LFM2 24B A2BList bars visualize relative performance. Plot bars use published 0–100 scores, shrink to a 1.5rem minimum, then scroll horizontally.
Scores are published snapshots and are only comparable within the same benchmark, version, metric, and evaluation configuration.