En direct
Benchmarks

SimpleBench

Models scored
91
Best score
0.82
Metric
Score (AVG@5)

SimpleBench is an AI evaluation tracked by Epoch AI, with 91 scored model versions on record. The scores here are reported by third parties rather than produced by Epoch AI running the evaluation itself.

Scored models span February 2024 to July 2026. The best score recorded is 0.82, measured as Score (AVG@5). Models come from Anthropic, Google DeepMind, OpenAI, Google, Alibaba, xAI, DeepSeek, Moonshot and others.

Full record
Score metric
Score (AVG@5)
Models scored
91
Best score recorded
0.82
Earliest model scored
Feb 29, 2024
Most recent model scored
Jul 9, 2026
Third-party reported
Yes
Leaderboard
01claude-fable-5_maxAnthropic0.82
02gemini-3.1-pro-previewGoogle DeepMind0.8
03gpt-5.5-pro_highOpenAI0.77
04gpt-5.5-pro_unknownOpenAI0.77
05gemini-3.5-flash_unknownGoogle0.77
06gemini-3-pro-previewGoogle DeepMind0.76
07gpt-5.4-pro-2026-03-05_unknownOpenAI0.74
08gpt-5.6-sol_prounknownOpenAI0.72
09qwen3.7-maxAlibaba0.7
10grok-4.5_unknownxAI0.7
11gpt-5.5_unknownOpenAI0.69
12claude-opus-4-6Anthropic0.68
13claude-opus-4-8_unknownAnthropic0.65
14gpt-5.6-sol_unknownOpenAI0.65
15qwen3.6-max-previewAlibaba0.63
16claude-opus-4-7_unknownAnthropic0.63
17gemini-2.5-pro-preview-06-05Google DeepMind0.62
18claude-opus-4-5-20251101_unknownAnthropic0.62
19claude-opus-4-5-20251101Anthropic0.62
20gpt-5-pro-2025-10-06_unknownOpenAI0.62
21gpt-5-pro-2025-10-06_highOpenAI0.62
22deepseek-v4-pro_unknownDeepSeek0.61
23gemini-3-flash-previewGoogle DeepMind0.61
24claude-sonnet-5_unknownAnthropic0.61
25grok-4-0709xAI0.6
26claude-opus-4-1-20250805Anthropic0.6
27claude-opus-4-1-20250805_unknownAnthropic0.6
28claude-opus-4-20250514_unknownAnthropic0.59
29claude-opus-4-20250514_12KAnthropic0.59
30kimi-k2.7-codeMoonshot0.58
31gpt-5.2-pro-2025-12-11OpenAI0.57
32gpt-5-2025-08-07_highOpenAI0.57
33grok-4-1-fast-non-reasoningxAI0.56
34grok-4-1-fast-reasoningxAI0.56
35glm-5.1Z.ai (Zhipu AI)0.55
36claude-sonnet-4-5-20250929_12KAnthropic0.54
37claude-sonnet-4-5-20250929_unknownAnthropic0.54
38glm-5Z.ai (Zhipu AI)0.53
39gpt-5.1-2025-11-13_highOpenAI0.53
40o3-2025-04-16_highOpenAI0.53
41DeepSeek-V3.2-SpecialeDeepSeek0.53
42gemini-2.5-pro-exp-03-25Google DeepMind0.52
43gemini-2.5-pro-preview-03-25Google DeepMind0.52
44gpt-5.6-terra_unknownOpenAI0.49
45zai-org/glm-4.7Z.ai (Zhipu AI)0.48
46glm-4.7Z.ai (Zhipu AI)0.48
47gpt-5.6-luna_unknownOpenAI0.47
48kimi-k2.5Moonshot0.47
49claude-3-7-sonnet-20250219_12KAnthropic0.46
50claude-3-7-sonnet-20250219_unknownAnthropic0.46
51gpt-5.2-2025-12-11_highOpenAI0.46
52MiniMax-M3MiniMax0.46
53gpt-5.2-2025-12-11_unknownOpenAI0.46
54claude-sonnet-4-20250514_unknownAnthropic0.46
55claude-sonnet-4-20250514_12KAnthropic0.46
56claude-3-7-sonnet-20250219Anthropic0.45
57o1-preview-2024-09-12OpenAI0.42
58claude-3-5-sonnet-20241022Anthropic0.41
59gemini-2.5-flashGoogle DeepMind0.41
60DeepSeek-R1-0528DeepSeek0.41
More benchmarks
SourceEpoch AI, 'AI Benchmarking Hub'. Published online at epoch.ai. Retrieved 2026-07-29 from https://epoch.ai/benchmarks. Licensed under CC BY 4.0.
← All benchmarks