SimpleBench is an AI evaluation tracked by Epoch AI, with 91 scored model versions on record. The scores here are reported by third parties rather than produced by Epoch AI running the evaluation itself.
Scored models span February 2024 to July 2026. The best score recorded is 0.82, measured as Score (AVG@5). Models come from Anthropic, Google DeepMind, OpenAI, Google, Alibaba, xAI, DeepSeek, Moonshot and others.
| 01 | claude-fable-5_max | Anthropic | 0.82 |
| 02 | gemini-3.1-pro-preview | Google DeepMind | 0.8 |
| 03 | gpt-5.5-pro_high | OpenAI | 0.77 |
| 04 | gpt-5.5-pro_unknown | OpenAI | 0.77 |
| 05 | gemini-3.5-flash_unknown | 0.77 | |
| 06 | gemini-3-pro-preview | Google DeepMind | 0.76 |
| 07 | gpt-5.4-pro-2026-03-05_unknown | OpenAI | 0.74 |
| 08 | gpt-5.6-sol_prounknown | OpenAI | 0.72 |
| 09 | qwen3.7-max | Alibaba | 0.7 |
| 10 | grok-4.5_unknown | xAI | 0.7 |
| 11 | gpt-5.5_unknown | OpenAI | 0.69 |
| 12 | claude-opus-4-6 | Anthropic | 0.68 |
| 13 | claude-opus-4-8_unknown | Anthropic | 0.65 |
| 14 | gpt-5.6-sol_unknown | OpenAI | 0.65 |
| 15 | qwen3.6-max-preview | Alibaba | 0.63 |
| 16 | claude-opus-4-7_unknown | Anthropic | 0.63 |
| 17 | gemini-2.5-pro-preview-06-05 | Google DeepMind | 0.62 |
| 18 | claude-opus-4-5-20251101_unknown | Anthropic | 0.62 |
| 19 | claude-opus-4-5-20251101 | Anthropic | 0.62 |
| 20 | gpt-5-pro-2025-10-06_unknown | OpenAI | 0.62 |
| 21 | gpt-5-pro-2025-10-06_high | OpenAI | 0.62 |
| 22 | deepseek-v4-pro_unknown | DeepSeek | 0.61 |
| 23 | gemini-3-flash-preview | Google DeepMind | 0.61 |
| 24 | claude-sonnet-5_unknown | Anthropic | 0.61 |
| 25 | grok-4-0709 | xAI | 0.6 |
| 26 | claude-opus-4-1-20250805 | Anthropic | 0.6 |
| 27 | claude-opus-4-1-20250805_unknown | Anthropic | 0.6 |
| 28 | claude-opus-4-20250514_unknown | Anthropic | 0.59 |
| 29 | claude-opus-4-20250514_12K | Anthropic | 0.59 |
| 30 | kimi-k2.7-code | Moonshot | 0.58 |
| 31 | gpt-5.2-pro-2025-12-11 | OpenAI | 0.57 |
| 32 | gpt-5-2025-08-07_high | OpenAI | 0.57 |
| 33 | grok-4-1-fast-non-reasoning | xAI | 0.56 |
| 34 | grok-4-1-fast-reasoning | xAI | 0.56 |
| 35 | glm-5.1 | Z.ai (Zhipu AI) | 0.55 |
| 36 | claude-sonnet-4-5-20250929_12K | Anthropic | 0.54 |
| 37 | claude-sonnet-4-5-20250929_unknown | Anthropic | 0.54 |
| 38 | glm-5 | Z.ai (Zhipu AI) | 0.53 |
| 39 | gpt-5.1-2025-11-13_high | OpenAI | 0.53 |
| 40 | o3-2025-04-16_high | OpenAI | 0.53 |
| 41 | DeepSeek-V3.2-Speciale | DeepSeek | 0.53 |
| 42 | gemini-2.5-pro-exp-03-25 | Google DeepMind | 0.52 |
| 43 | gemini-2.5-pro-preview-03-25 | Google DeepMind | 0.52 |
| 44 | gpt-5.6-terra_unknown | OpenAI | 0.49 |
| 45 | zai-org/glm-4.7 | Z.ai (Zhipu AI) | 0.48 |
| 46 | glm-4.7 | Z.ai (Zhipu AI) | 0.48 |
| 47 | gpt-5.6-luna_unknown | OpenAI | 0.47 |
| 48 | kimi-k2.5 | Moonshot | 0.47 |
| 49 | claude-3-7-sonnet-20250219_12K | Anthropic | 0.46 |
| 50 | claude-3-7-sonnet-20250219_unknown | Anthropic | 0.46 |
| 51 | gpt-5.2-2025-12-11_high | OpenAI | 0.46 |
| 52 | MiniMax-M3 | MiniMax | 0.46 |
| 53 | gpt-5.2-2025-12-11_unknown | OpenAI | 0.46 |
| 54 | claude-sonnet-4-20250514_unknown | Anthropic | 0.46 |
| 55 | claude-sonnet-4-20250514_12K | Anthropic | 0.46 |
| 56 | claude-3-7-sonnet-20250219 | Anthropic | 0.45 |
| 57 | o1-preview-2024-09-12 | OpenAI | 0.42 |
| 58 | claude-3-5-sonnet-20241022 | Anthropic | 0.41 |
| 59 | gemini-2.5-flash | Google DeepMind | 0.41 |
| 60 | DeepSeek-R1-0528 | DeepSeek | 0.41 |