GenAiHub
Math and science
Epoch live leaderboard

FrontierMath Tier 4 (v2)

Exceptionally difficult research-level mathematics problems.

Metric

Accuracy

Results shown

70

Publisher

Epoch AI live leaderboard

Snapshot

Fetched 2026-10-08T23:19:29.491Z

70 of 70 models

70 of 70 models

Higher is better

GPT-6.1 Sol (max) logo
GPT-6.1 Sol (max)
GPT-6 Astra (high) logo
GPT-6 Astra (high)
GPT-6 Astra (xhigh) logo
GPT-6 Astra (xhigh)
GPT-6 Astra (max) logo
GPT-6 Astra (max)
GPT-6 Astra (medium) logo
GPT-6 Astra (medium)
Claude Opus 5.5 (max) logo
Claude Opus 5.5 (max)
Claude Fable 5 (max) logo
Claude Fable 5 (max)
GPT-6 Sol (max) logo
GPT-6 Sol (max)
Claude Fable 5.1 (max) logo
Claude Fable 5.1 (max)
GPT-6 Astra (low) logo
GPT-6 Astra (low)
GPT-6 Astra (none) logo
GPT-6 Astra (none)
GPT-5.6 Sol (max) logo
GPT-5.6 Sol (max)
Claude Sonnet 5.5 (max) logo
Claude Sonnet 5.5 (max)
GPT-5.6 Sol (pro, max) logo
GPT-5.6 Sol (pro, max)
GPT-5.5 Pro (xhigh) logo
GPT-5.5 Pro (xhigh)
AI
AI co-mathematician
Claude Opus 5 (max) logo
Claude Opus 5 (max)
GPT-5.5 (xhigh) logo
GPT-5.5 (xhigh)
GPT-5.6 Terra (max) logo
GPT-5.6 Terra (max)
GPT-5.6 Luna (max) logo
GPT-5.6 Luna (max)
GPT-5.4 Pro (xhigh) logo
GPT-5.4 Pro (xhigh)
GPT-6 Luna (max) logo
GPT-6 Luna (max)
Claude Opus 4.8 (max) logo
Claude Opus 4.8 (max)
GPT-5.4 (xhigh) logo
GPT-5.4 (xhigh)
Muse Spark 1.3 (max) logo
Muse Spark 1.3 (max)
Qwen3.8 Max (xhigh) logo
Qwen3.8 Max (xhigh)
GPT-5.2 Pro (xhigh) logo
GPT-5.2 Pro (xhigh)
Muse Spark 1.3 (xhigh) logo
Muse Spark 1.3 (xhigh)
Kimi K3 (Max) logo
Kimi K3 (Max)
Gemini 3.7 Flash (high) logo
Gemini 3.7 Flash (high)
Qwen3.8 Max (0902) (xhigh) logo
Qwen3.8 Max (0902) (xhigh)
Qwen3.7 Max logo
Qwen3.7 Max
Grok 4.6 (xhigh) logo
Grok 4.6 (xhigh)
Claude Opus 4.7 (max) logo
Claude Opus 4.7 (max)
GPT-5.2 (xhigh) logo
GPT-5.2 (xhigh)
GLM-5.3 (max) logo
GLM-5.3 (max)
Claude Sonnet 5 (max) logo
Claude Sonnet 5 (max)
GLM-5.2 (max) logo
GLM-5.2 (max)
DeepSeek V4 Pro 0813 (max) logo
DeepSeek V4 Pro 0813 (max)
Gemini 3.1 Pro Preview logo
Gemini 3.1 Pro Preview
Claude Opus 4.6 (max) logo
Claude Opus 4.6 (max)
Gemini 3.5 Flash (high) logo
Gemini 3.5 Flash (high)
Kimi K2.6 logo
Kimi K2.6
DeepSeek V4 Flash 0731 (max) logo
DeepSeek V4 Flash 0731 (max)
Grok 4.5 (high) logo
Grok 4.5 (high)
Gemini 3.8 Flash (high) logo
Gemini 3.8 Flash (high)
Gemini 3.6 Flash (high) logo
Gemini 3.6 Flash (high)
GPT-5 (high) logo
GPT-5 (high)
GPT-5 Pro (high) logo
GPT-5 Pro (high)
Grok 4.7 (xhigh) logo
Grok 4.7 (xhigh)
GLM-5.3-Flash (max) logo
GLM-5.3-Flash (max)
In
Inkling Small (xhigh)
Grok 4.20 logo
Grok 4.20
Gemini 3 Flash Preview logo
Gemini 3 Flash Preview
Grok 4.3 Beta logo
Grok 4.3 Beta
Kimi K2.7 Code logo
Kimi K2.7 Code
GPT-5 mini (high) logo
GPT-5 mini (high)
GPT-5.4 nano (high) logo
GPT-5.4 nano (high)
GPT-5.4 mini (xhigh) logo
GPT-5.4 mini (xhigh)
In
Inkling (xhigh)
o4-mini (high) logo
o4-mini (high)
Claude Opus 4.5 (32k thinking) logo
Claude Opus 4.5 (32k thinking)
GPT-5.5 Instant logo
GPT-5.5 Instant
DeepSeek v4 (max) logo
DeepSeek v4 (max)
GPT-5 nano (high) logo
GPT-5 nano (high)
Claude Opus 4.1 (32k thinking) logo
Claude Opus 4.1 (32k thinking)
Claude Sonnet 4.5 (32k thinking) logo
Claude Sonnet 4.5 (32k thinking)
Gemini 3.5 Flash-Lite (high) logo
Gemini 3.5 Flash-Lite (high)
Gemini 2.5 Pro logo
Gemini 2.5 Pro
o3-mini (high) logo
o3-mini (high)
List bars visualize relative performance. Plot bars use published 0–100 scores, shrink to a 1.5rem minimum, then scroll horizontally.

Scores are published snapshots and are only comparable within the same benchmark, version, metric, and evaluation configuration.