GenAiHub
Task Planning & Knowledge Search
Artificial Analysis public leaderboard

Agentic Index

Artificial Analysis composite index for tool use, planning, autonomy, and complex agentic workflows.

Metric

Index score

Results shown

151

Publisher

Artificial Analysis

Snapshot

Fetched 2026-09-08T22:57:37.545Z

151 of 151 models

151 of 151 models

Higher is better

Claude Fable 5.1 (max with fallback) logo
Claude Fable 5.1 (max with fallback)
Claude Fable 5.1 (xhigh with fallback) logo
Claude Fable 5.1 (xhigh with fallback)
Claude Opus 5 (max) logo
Claude Opus 5 (max)
Muse Spark 1.3 (max) logo
Muse Spark 1.3 (max)
Claude Opus 5 (xhigh) logo
Claude Opus 5 (xhigh)
GLM-5.3 (max) logo
GLM-5.3 (max)
Grok 4.6 (high) logo
Grok 4.6 (high)
Claude Fable 5.1 (high with fallback) logo
Claude Fable 5.1 (high with fallback)
Grok 4.6 (xhigh) logo
Grok 4.6 (xhigh)
Claude Opus 5 (high) logo
Claude Opus 5 (high)
Muse Spark 1.3 (xhigh) logo
Muse Spark 1.3 (xhigh)
GPT-6 Astra (max) logo
GPT-6 Astra (max)
GLM-5.3-Flash logo
GLM-5.3-Flash
Grok 4.6 (medium) logo
Grok 4.6 (medium)
Claude Fable 5 (with fallback) logo
Claude Fable 5 (with fallback)
Kimi K3 (max) logo
Kimi K3 (max)
GPT-6 Astra (xhigh) logo
GPT-6 Astra (xhigh)
Claude Fable 5.1 (medium with fallback) logo
Claude Fable 5.1 (medium with fallback)
GPT-5.6 Sol (max) logo
GPT-5.6 Sol (max)
Qwen3.8 2.4T A95B logo
Qwen3.8 2.4T A95B
Qwen3.8 Max logo
Qwen3.8 Max
GPT-6 Astra (high) logo
GPT-6 Astra (high)
DeepSeek V4 Flash Vision (max) logo
DeepSeek V4 Flash Vision (max)
GPT-6 Astra (Non-reasoning) logo
GPT-6 Astra (Non-reasoning)
GPT-5.6 Sol (xhigh) logo
GPT-5.6 Sol (xhigh)
Claude Fable 5.1 (low with fallback) logo
Claude Fable 5.1 (low with fallback)
Claude Opus 5 (medium) logo
Claude Opus 5 (medium)
Qwen3.8 27B (xhigh) logo
Qwen3.8 27B (xhigh)
GPT-6 Astra (medium) logo
GPT-6 Astra (medium)
GPT-5.6 Sol (high) logo
GPT-5.6 Sol (high)
Claude Sonnet 5 (max) logo
Claude Sonnet 5 (max)
Muse Spark 1.2 (xhigh) logo
Muse Spark 1.2 (xhigh)
GPT-5.6 Terra (max) logo
GPT-5.6 Terra (max)
GPT-5.6 Luna (max) logo
GPT-5.6 Luna (max)
Claude Opus 4.8 (max) logo
Claude Opus 4.8 (max)
DeepSeek V4 Pro 0813 (max) logo
DeepSeek V4 Pro 0813 (max)
Grok 4.6 (low) logo
Grok 4.6 (low)
GPT-5.6 Terra (xhigh) logo
GPT-5.6 Terra (xhigh)
Grok 4.5 (high) logo
Grok 4.5 (high)
DeepSeek V4 Flash 0731 (max) logo
DeepSeek V4 Flash 0731 (max)
Gemini 3.8 Flash (high) logo
Gemini 3.8 Flash (high)
K2
K2 Horizon 375B A23B
GPT-5.6 Sol (medium) logo
GPT-5.6 Sol (medium)
Gemini 3.8 Flash (medium) logo
Gemini 3.8 Flash (medium)
Qwen3.8 27B (low) logo
Qwen3.8 27B (low)
Claude Opus 4.7 (max) logo
Claude Opus 4.7 (max)
GPT-6 Astra (low) logo
GPT-6 Astra (low)
GPT-5.6 Luna (xhigh) logo
GPT-5.6 Luna (xhigh)
GLM-5.2 (max) logo
GLM-5.2 (max)
GPT-5.6 Terra (high) logo
GPT-5.6 Terra (high)
Claude Opus 5 (low) logo
Claude Opus 5 (low)
GPT-5.5 (xhigh) logo
GPT-5.5 (xhigh)
Gemini 3.7 Flash (high) logo
Gemini 3.7 Flash (high)
GPT-5.6 Luna (high) logo
GPT-5.6 Luna (high)
GPT-5.5 (high) logo
GPT-5.5 (high)
Gemini 3.8 Flash (low) logo
Gemini 3.8 Flash (low)
Claude Sonnet 4.6 (max) logo
Claude Sonnet 4.6 (max)
Qu
Quasar 438B (max)
GPT-5.6 Sol (low) logo
GPT-5.6 Sol (low)
GPT-5.6 Terra (medium) logo
GPT-5.6 Terra (medium)
MiniMax-M3 logo
MiniMax-M3
Kimi K3 (low) logo
Kimi K3 (low)
GPT-5.5 (medium) logo
GPT-5.5 (medium)
Gemini 3.6 Flash logo
Gemini 3.6 Flash
Ag
Agnes 2.5 Pro Alpha
GPT-5.6 Sol (Non-reasoning) logo
GPT-5.6 Sol (Non-reasoning)
DeepSeek V4 Flash (high) logo
DeepSeek V4 Flash (high)
DeepSeek V4 Pro (max) logo
DeepSeek V4 Pro (max)
Muse Spark 1.1 (xhigh) logo
Muse Spark 1.1 (xhigh)
GPT-5.6 Terra (low) logo
GPT-5.6 Terra (low)
Gemini 3.5 Flash logo
Gemini 3.5 Flash
Hy
Hy3
GPT-5.6 Luna (medium) logo
GPT-5.6 Luna (medium)
GLM-5.1 logo
GLM-5.1
In
Inkling Small
GPT-5.6 Terra (Non-reasoning) logo
GPT-5.6 Terra (Non-reasoning)
In
Inkling
Qwen3.7 Max logo
Qwen3.7 Max
DeepSeek V4 Flash (max) logo
DeepSeek V4 Flash (max)
MiMo-V2.5-Pro logo
MiMo-V2.5-Pro
Kimi K2.7 Code logo
Kimi K2.7 Code
Kimi K2.6 logo
Kimi K2.6
Ne
Nemotron 3 Ultra
Li
Ling 3.0 Flash
Qwen3.6 27B logo
Qwen3.6 27B
Qwen3.7 Plus logo
Qwen3.7 Plus
GPT-5.4 mini (xhigh) logo
GPT-5.4 mini (xhigh)
GPT-5.5 Instant (June 2026) logo
GPT-5.5 Instant (June 2026)
GPT-5.6 Luna (low) logo
GPT-5.6 Luna (low)
GPT-5.4 nano (xhigh) logo
GPT-5.4 nano (xhigh)
Claude 4.5 Sonnet logo
Claude 4.5 Sonnet
MiMo-V2.5 logo
MiMo-V2.5
Grok 4.3 (high) logo
Grok 4.3 (high)
MiniMax-M2.7 logo
MiniMax-M2.7
Gemini 3.5 Flash-Lite logo
Gemini 3.5 Flash-Lite
Lo
LongCat 2.0
Grok 4.3 (Non-reasoning) logo
Grok 4.3 (Non-reasoning)
GPT-5.6 Luna (Non-reasoning) logo
GPT-5.6 Luna (Non-reasoning)
Qwen3.6 35B A3B logo
Qwen3.6 35B A3B
Ri
Ring-2.6-1T
Qwen3.5 397B A17B logo
Qwen3.5 397B A17B
Muse Glimmer (high) logo
Muse Glimmer (high)
Claude 4.5 Haiku logo
Claude 4.5 Haiku
Gemini 3.1 Pro Preview logo
Gemini 3.1 Pro Preview
Qwen3.5 122B A10B logo
Qwen3.5 122B A10B
Mi
Mistral Medium 3.5
Mi
MiniCPM5-2B
DeepSeek V3.1 Terminus logo
DeepSeek V3.1 Terminus
GPT-5 mini (high) logo
GPT-5 mini (high)
Li
Ling 3.0 Tiny
Ge
Gemma 4 31B
gpt-oss-120b (high) logo
gpt-oss-120b (high)
Ne
Nemotron 3.5 Lightning
De
Devstral 2
De
Devstral Small 2
Ne
Nemotron 3 Super
Me
Mercury 2
Gr
Granite 4.2 8B
Qwen3 Coder Next logo
Qwen3 Coder Next
Co
Command A+
Gemini 2.5 Pro logo
Gemini 2.5 Pro
Gemini 3.1 Flash-Lite logo
Gemini 3.1 Flash-Lite
Mi
Mistral Medium 3.1
Hy
HyperNova 60B 2605 (high)
Mi
Mistral Large 3
Mi
Mistral Small 3.1
So
Solar Pro 3
Mi
Mistral Small 4
gpt-oss-20b (high) logo
gpt-oss-20b (high)
Qwen3 235B A22B 2507 logo
Qwen3 235B A22B 2507
Tr
Trinity Large Thinking
Mi
Ministral 3 14B
DeepSeek R1 (Jan) logo
DeepSeek R1 (Jan)
No
North Mini Code
Mi
Mistral Small 3.2
Ne
Nemotron 3 Nano
Gr
Granite 4.2 3B
Qwen3 14B logo
Qwen3 14B
Qwen3 30B A3B 2507 logo
Qwen3 30B A3B 2507
Qwen3 32B logo
Qwen3 32B
o3-mini (high) logo
o3-mini (high)
DeepSeek V3 (Dec) logo
DeepSeek V3 (Dec)
Mi
Ministral 3 3B
DeepSeek V3 0324 logo
DeepSeek V3 0324
Qwen3 8B logo
Qwen3 8B
Ce
Celeris-1
Llama 4 Maverick logo
Llama 4 Maverick
Mi
Ministral 3 8B
Llama 4 Scout logo
Llama 4 Scout
Ge
Gemma 3 27B
Ge
Gemma 3 12B
List bars visualize relative performance. Plot bars use published 0–100 scores, shrink to a 1.5rem minimum, then scroll horizontally.

Scores are published snapshots and are only comparable within the same benchmark, version, metric, and evaluation configuration.