GenAiHub
Cybersecurity & Risk
Level 1 · 1,507 instances

CyberGym

Real-world cybersecurity evaluation of AI agents reproducing vulnerabilities with working proof-of-concept tests.

Metric

Success rate

Results shown

77

Publisher

CyberGym live leaderboard

Snapshot

Fetched 2026-10-08T23:19:27.968Z

49 of 49 models

77 of 77 models

Higher is better

Multi-model (DeepSeek-V4.1-Flash, Abliterated GLM-5.2) logo
Multi-model (DeepSeek-V4.1-Flash, Abliterated GLM-5.2)
Multi-model (Creation Model, DeepSeek-V4-Pro, Qwen 3.8 Max) logo
Multi-model (Creation Model, DeepSeek-V4-Pro, Qwen 3.8 Max)
Multi-model (DeepSeek-V4-Flash, OrcaCyber-Zero-1.0) logo
Multi-model (DeepSeek-V4-Flash, OrcaCyber-Zero-1.0)
DeepSeek-V4.1-Flash logo
DeepSeek-V4.1-Flash
GLM-5.3 logo
GLM-5.3
DeepSeek-V4-Flash logo
DeepSeek-V4-Flash
GLM-5.3 logo
GLM-5.3
Hero (finetuned from GLM-5.2) logo
Hero (finetuned from GLM-5.2)
DeepSeek-V4-Pro logo
DeepSeek-V4-Pro
GLM-5.3 logo
GLM-5.3
GLM-5.3 logo
GLM-5.3
DeepSeek-V4-Flash logo
DeepSeek-V4-Flash
Qwen-Internal logo
Qwen-Internal
DeepSeek-V4-Flash logo
DeepSeek-V4-Flash
Multi-model (Grok 4.5, Grok 4.6) logo
Multi-model (Grok 4.5, Grok 4.6)
DeepSeek-V4-Flash logo
DeepSeek-V4-Flash
DeepSeek-V4-Flash logo
DeepSeek-V4-Flash
Claude Opus 4.6 logo
Claude Opus 4.6
Multi-model (GPT-5.4, Claude Opus 4.6, Claude Sonnet 4.6) logo
Multi-model (GPT-5.4, Claude Opus 4.6, Claude Sonnet 4.6)
Multi-model (GPT-5.5, Claude Opus 4.6) logo
Multi-model (GPT-5.5, Claude Opus 4.6)
Claude Opus 4.6 logo
Claude Opus 4.6
XekRung-1.5-27B-Preview (finetuned from Qwen3.8-27B) logo
XekRung-1.5-27B-Preview (finetuned from Qwen3.8-27B)
DeepSeek-V4-Flash logo
DeepSeek-V4-Flash
GLM-5.2 logo
GLM-5.2
Gemini 3.8 Flash Cyber logo
Gemini 3.8 Flash Cyber
ASL-Cyber-Flash (finetuned from DeepSeek-V4-Flash) logo
ASL-Cyber-Flash (finetuned from DeepSeek-V4-Flash)
GPT-5.5-Cyber logo
GPT-5.5-Cyber
Xe
XekRung
GLM-5.2 logo
GLM-5.2
GLM-5.3 logo
GLM-5.3
Feyospace-v1.1 (finetuned from Qwen3.8-27B) logo
Feyospace-v1.1 (finetuned from Qwen3.8-27B)
DeepSeek-V4-Pro logo
DeepSeek-V4-Pro
Claude Mythos Preview logo
Claude Mythos Preview
GPT-5.5 logo
GPT-5.5
Grok 4.6 logo
Grok 4.6
Grok 4.5 logo
Grok 4.5
GPT-5.4 logo
GPT-5.4
GLM-5.2 logo
GLM-5.2
DeepSeek-V4-Flash logo
DeepSeek-V4-Flash
MiniMax M3 logo
MiniMax M3
GLM-5.1 logo
GLM-5.1
GLM-5.1 logo
GLM-5.1
Claude Sonnet 4.5 logo
Claude Sonnet 4.5
Claude Opus 4.6 logo
Claude Opus 4.6
GPT-5.4 logo
GPT-5.4
Claude Sonnet 4.6 logo
Claude Sonnet 4.6
DeepSeek-V4-Pro Preview logo
DeepSeek-V4-Pro Preview
Claude Opus 4.1 logo
Claude Opus 4.1
GPT-5 logo
GPT-5
Claude Sonnet 4 logo
Claude Sonnet 4
Muse Spark 1.1 (helpful-only) logo
Muse Spark 1.1 (helpful-only)
DeepSeek-V4-Pro Preview logo
DeepSeek-V4-Pro Preview
Claude Opus 4.5 logo
Claude Opus 4.5
Claude Sonnet 3.7 logo
Claude Sonnet 3.7
Muse Spark logo
Muse Spark
GLM-5 logo
GLM-5
Kimi K2.5 logo
Kimi K2.5
GPT-5 logo
GPT-5
Gemini 3.1 Pro logo
Gemini 3.1 Pro
Claude Sonnet 4.5 logo
Claude Sonnet 4.5
Claude Opus 4.1 logo
Claude Opus 4.1
GLM-4.7 logo
GLM-4.7
Claude Sonnet 4 logo
Claude Sonnet 4
Claude Sonnet 4 logo
Claude Sonnet 4
Claude Sonnet 3.7 logo
Claude Sonnet 3.7
Claude Sonnet 3.7 logo
Claude Sonnet 3.7
GPT-4.1 logo
GPT-4.1
GPT-4.1 logo
GPT-4.1
GPT-4.1 logo
GPT-4.1
GPT-4.1 logo
GPT-4.1
Gemini 2.5 Flash Preview logo
Gemini 2.5 Flash Preview
DeepSeek-V3 logo
DeepSeek-V3
o4-mini logo
o4-mini
R2
R2E-Gym-32B
Qwen3-235B-A22B logo
Qwen3-235B-A22B
Op
OpenHands-LM-32B
SW
SWE-Gym-32B
List bars visualize relative performance. Plot bars use published 0–100 scores, shrink to a 1.5rem minimum, then scroll horizontally.

Scores are published snapshots and are only comparable within the same benchmark, version, metric, and evaluation configuration.