GenAiHub
Task Planning & Knowledge Search
Research questions requiring browsing · 2025

BrowseComp

A benchmark for web-browsing agents that must search, inspect sources, gather evidence, and return the correct answer to research-oriented questions.

Metric

Accuracy

Results shown

47

Publisher

BenchLM exact-source leaderboard

Snapshot

Fetched 2026-10-08T23:19:28.309Z

47 of 47 models

47 of 47 models

Higher is better

At
Atria Dawn Preview
GPT-5.6 Sol logo
GPT-5.6 Sol
GPT-6 Astra logo
GPT-6 Astra
Kimi K3 logo
Kimi K3
Claude Opus 5 logo
Claude Opus 5
GPT-5.5 Pro logo
GPT-5.5 Pro
GPT-5.4 Pro logo
GPT-5.4 Pro
St
Step 5 Preview
Claude Mythos 5 logo
Claude Mythos 5
GPT-5.6 Terra logo
GPT-5.6 Terra
Or
Ornith-1.5-397B
Claude Sonnet 5 logo
Claude Sonnet 5
GPT-5.5 logo
GPT-5.5
Claude Opus 4.8 logo
Claude Opus 4.8
Claude Opus 4.6 logo
Claude Opus 4.6
MiniMax M3 logo
MiniMax M3
DeepSeek V4 Pro 0813 logo
DeepSeek V4 Pro 0813
GPT-5.6 Luna logo
GPT-5.6 Luna
do
dots3-note Preview
Kimi K2.6 logo
Kimi K2.6
GPT-5.4 logo
GPT-5.4
DeepSeek V4 Pro (High) logo
DeepSeek V4 Pro (High)
Claude Opus 4.7 (Adaptive) logo
Claude Opus 4.7 (Adaptive)
In
Inkling-Small
Be
Beam
In
Inkling
St
Step 3.7 Flash
Ag
Agents-A1
DeepSeek V4 Flash 0731 logo
DeepSeek V4 Flash 0731
Li
Ling 3.0 Flash
GLM-5.1 logo
GLM-5.1
Or
Ornith-1.5-35B-A3B
Ag
Agents-A1-4B
GPT-5.2 logo
GPT-5.2
Qwen3.5-122B-A10B logo
Qwen3.5-122B-A10B
Qwen3.5 397B logo
Qwen3.5 397B
Qwen3.5-27B logo
Qwen3.5-27B
Qwen3.5-35B-A3B logo
Qwen3.5-35B-A3B
Kimi K2.5 logo
Kimi K2.5
Kimi K2.5 (Reasoning) logo
Kimi K2.5 (Reasoning)
Or
Ornith-1.5-9B
DeepSeek V4 Flash (High) logo
DeepSeek V4 Flash (High)
GLM-4.7 logo
GLM-4.7
So
Solar Pro 4
Lo
LongCat-Flash-Lite-Sparse
Ne
Nemotron 3 Ultra
Ne
Nemotron 3.5 Lightning 30B A3B NVFP4
List bars visualize relative performance. Plot bars use published 0–100 scores, shrink to a 1.5rem minimum, then scroll horizontally.

Scores are published snapshots and are only comparable within the same benchmark, version, metric, and evaluation configuration.