MATH Level 5 is an AI evaluation tracked by Epoch AI, with 108 scored model versions on record. Epoch AI runs this evaluation directly, so the scores are reproducible against their published logs.
Scored models span June 2023 to October 2025. The best score recorded is 0.98, measured as mean_score. Models come from OpenAI, Anthropic, Alibaba, DeepSeek, Google DeepMind, Mistral AI, xAI, Meta AI and others.
| 01 | gpt-5-2025-08-07_high | OpenAI | 0.98 |
| 02 | gpt-5-2025-08-07_medium | OpenAI | 0.98 |
| 03 | gpt-5-mini-2025-08-07_high | OpenAI | 0.98 |
| 04 | o4-mini-2025-04-16_high | OpenAI | 0.98 |
| 05 | o3-2025-04-16_high | OpenAI | 0.98 |
| 06 | claude-sonnet-4-5-20250929_32K | Anthropic | 0.98 |
| 07 | qwen3-max-2025-09-23 | Alibaba | 0.97 |
| 08 | gpt-5-mini-2025-08-07_medium | OpenAI | 0.97 |
| 09 | DeepSeek-R1-0528 | DeepSeek | 0.97 |
| 10 | o3-mini-2025-01-31_high | OpenAI | 0.96 |
| 11 | claude-haiku-4-5-20251001_32K | Anthropic | 0.96 |
| 12 | gemini-2.5-pro-preview-05-06 | Google DeepMind | 0.96 |
| 13 | gemini-2.5-pro-preview-03-25 | Google DeepMind | 0.96 |
| 14 | gpt-5-nano-2025-08-07_medium | OpenAI | 0.95 |
| 15 | o3-mini-2025-01-31_medium | OpenAI | 0.95 |
| 16 | gpt-5-nano-2025-08-07_high | OpenAI | 0.95 |
| 17 | o1-2024-12-17_high | OpenAI | 0.95 |
| 18 | o1-2024-12-17_medium | OpenAI | 0.94 |
| 19 | DeepSeek-R1 | DeepSeek | 0.93 |
| 20 | claude-3-7-sonnet-20250219_64K | Anthropic | 0.91 |
| 21 | grok-3-mini-beta_low | xAI | 0.91 |
| 22 | claude-3-7-sonnet-20250219_32K | Anthropic | 0.9 |
| 23 | DeepSeek-R1-Distill-Llama-70B | DeepSeek | 0.9 |
| 24 | o1-mini-2024-09-12_high | OpenAI | 0.89 |
| 25 | grok-3-beta | xAI | 0.89 |
| 26 | grok-3-mini-beta_high | xAI | 0.88 |
| 27 | gpt-4.1-mini-2025-04-14 | OpenAI | 0.87 |
| 28 | DeepSeek-R1-Distill-Qwen-14B | DeepSeek | 0.87 |
| 29 | claude-haiku-4-5-20251001 | Anthropic | 0.87 |
| 30 | claude-3-7-sonnet-20250219_16K | Anthropic | 0.86 |
| 31 | claude-opus-4-20250514 | Anthropic | 0.85 |
| 32 | claude-sonnet-4-20250514 | Anthropic | 0.84 |
| 33 | o1-mini-2024-09-12_medium | OpenAI | 0.84 |
| 34 | gemini-2.0-pro-exp-02-05 | Google DeepMind | 0.83 |
| 35 | gpt-4.1-2025-04-14 | OpenAI | 0.83 |
| 36 | gemini-2.0-flash-001 | Google DeepMind,Google | 0.82 |
| 37 | o1-preview-2024-09-12 | OpenAI | 0.82 |
| 38 | mistral-medium-2505 | Mistral AI | 0.82 |
| 39 | gpt-4.5-preview-2025-02-27 | OpenAI | 0.79 |
| 40 | DeepSeek-V3-0324 | DeepSeek | 0.76 |
| 41 | gemma-3-27b-it | Google DeepMind | 0.74 |
| 42 | Llama-4-Maverick-17B-128E-Instruct-FP8 | Meta AI | 0.73 |
| 43 | gemini-1.5-pro-002 | Google DeepMind | 0.7 |
| 44 | gpt-4.1-nano-2025-04-14 | OpenAI | 0.7 |
| 45 | qwen3-235b-a22b | Alibaba | 0.69 |
| 46 | claude-3-7-sonnet-20250219 | Anthropic | 0.68 |
| 47 | qwen-max-2025-01-25 | Alibaba | 0.67 |
| 48 | qwen-plus-2025-01-25 | Alibaba | 0.65 |
| 49 | phi-4 | Microsoft Research | 0.65 |
| 50 | DeepSeek-V3 | DeepSeek | 0.65 |
| 51 | grok-2-1212 | xAI | 0.64 |
| 52 | qwen2.5-72b-instruct | Alibaba | 0.63 |
| 53 | Llama-4-Scout-17B-16E-Instruct | Meta AI | 0.62 |
| 54 | gemini-1.5-flash-002 | Google DeepMind | 0.62 |
| 55 | claude-3-5-sonnet-20241022 | Anthropic | 0.57 |
| 56 | qwen-turbo-2024-11-01 | Alibaba | 0.56 |
| 57 | qwen2.5-32b-instruct | Alibaba | 0.56 |
| 58 | gpt-4o-2024-08-06 | OpenAI | 0.53 |
| 59 | gpt-4o-mini-2024-07-18 | OpenAI | 0.53 |
| 60 | claude-3-5-sonnet-20240620 | Anthropic | 0.52 |