ForecastBench is an AI evaluation tracked by Epoch AI, with 68 scored model versions on record. The scores here are reported by third parties rather than produced by Epoch AI running the evaluation itself.
Scored models span June 2023 to March 2026. The best score recorded is 62.5, measured as Overall score. Models come from OpenAI, Anthropic, xAI, Google DeepMind, Z.ai (Zhipu AI), Moonshot, DeepSeek, Meta AI and others.
| 01 | o3-2025-04-16_unknown | OpenAI | 62.5 |
| 02 | claude-opus-4-1-20250805_unknown | Anthropic | 62 |
| 03 | claude-sonnet-4-5-20250929_unknown | Anthropic | 61.9 |
| 04 | claude-3-7-sonnet-20250219_unknown | Anthropic | 61.8 |
| 05 | o4-mini-2025-04-16_unknown | OpenAI | 61.8 |
| 06 | gpt-4.5-preview-2025-02-27 | OpenAI | 61.7 |
| 07 | gpt-4.1-2025-04-14 | OpenAI | 61.5 |
| 08 | gpt-5-2025-08-07_unknown | OpenAI | 61.4 |
| 09 | claude-haiku-4-5-20251001_unknown | Anthropic | 61.4 |
| 10 | grok-4-20 | xAI | 61.4 |
| 11 | gemini-2.5-pro-preview-03-25 | Google DeepMind | 61.3 |
| 12 | gemini-3-pro-preview | Google DeepMind | 61.2 |
| 13 | claude-opus-4-20250514_unknown | Anthropic | 61.1 |
| 14 | grok-4-1-fast-reasoning | xAI | 61 |
| 15 | gpt-5-mini-2025-08-07_unknown | OpenAI | 61 |
| 16 | glm-5 | Z.ai (Zhipu AI) | 61 |
| 17 | grok-4-0709 | xAI | 60.9 |
| 18 | claude-opus-4-5-20251101_unknown | Anthropic | 60.7 |
| 19 | claude-3-5-sonnet-20241022 | Anthropic | 60.7 |
| 20 | gemini-2.5-flash-preview-04-17 | Google DeepMind | 60.6 |
| 21 | grok-4-fast | xAI | 60.5 |
| 22 | gemini-2.5-pro | Google DeepMind | 60.4 |
| 23 | Kimi-K2-Instruct | Moonshot | 60.2 |
| 24 | claude-sonnet-4-20250514_unknown | Anthropic | 60.2 |
| 25 | gpt-5.2-2025-12-11_unknown | OpenAI | 60.1 |
| 26 | claude-opus-4-6_unknown | Anthropic | 60 |
| 27 | DeepSeek-R1 | DeepSeek | 60 |
| 28 | Llama-3.1-405B-Instruct | Meta AI | 59.9 |
| 29 | Kimi-K2-Instruct-0905 | Moonshot | 59.8 |
| 30 | Qwen3-235B-A22B | Alibaba | 59.7 |
| 31 | claude-sonnet-4-6_unknown | Anthropic | 59.6 |
| 32 | o3-mini-2025-01-31_unknown | OpenAI | 59.6 |
| 33 | gpt-5.4-2026-03-05_unknown | OpenAI | 59.5 |
| 34 | gpt-4-turbo-2024-04-09 | OpenAI | 59.4 |
| 35 | claude-3-5-sonnet-20240620 | Anthropic | 59.4 |
| 36 | GLM-4.5-Air | Z.ai (Zhipu AI),Tsinghua University | 59.2 |
| 37 | DeepSeek-V3 | DeepSeek | 59.1 |
| 38 | gpt-5-nano-2025-08-07_unknown | OpenAI | 59.1 |
| 39 | gemini-3.1-pro-preview | Google DeepMind | 59 |
| 40 | gemini-2.5-flash | Google DeepMind | 59 |
| 41 | Llama-3.3-70B-Instruct | Meta AI | 58.6 |
| 42 | Meta-Llama-3-8B-Instruct | Meta AI | 58.6 |
| 43 | gemini-3-flash-preview | Google DeepMind | 58.5 |
| 44 | claude-3-opus-20240229 | Anthropic | 58.4 |
| 45 | QwQ-32B-Preview | Alibaba | 58.3 |
| 46 | gpt-5.1-2025-11-13_unknown | OpenAI | 58.1 |
| 47 | DeepSeek-V3.1 | DeepSeek | 58 |
| 48 | gpt-4-0613 | OpenAI | 57.8 |
| 49 | qwen1.5-110b-chat | Alibaba | 57.7 |
| 50 | gpt-4o-2024-05-13 | OpenAI | 57.7 |
| 51 | Llama-4-Maverick-17B-128E-Instruct-FP8 | Meta AI | 57.5 |
| 52 | Llama-4-Scout-17B-16E-Instruct | Meta AI | 57.5 |
| 53 | qwen2.5-72b-instruct | Alibaba | 57.5 |
| 54 | gpt-5.4-nano-2026-03-17_unknown | OpenAI | 57.3 |
| 55 | mistral-large-2407 | Mistral AI | 57.1 |
| 56 | gemini-2.0-flash-lite-001 | Google DeepMind | 57.1 |
| 57 | Meta-Llama-3-70B | Meta AI | 57.1 |
| 58 | gpt-5.4-mini-2026-03-17_unknown | OpenAI | 57 |
| 59 | mistral-large-2411 | Mistral AI | 56.9 |
| 60 | Mixtral-8x22B-Instruct-v0.1 | Mistral AI | 56.3 |