Live
Benchmarks

ForecastBench

Models scored
68
Best score
62.5
Metric
Overall score

ForecastBench is an AI evaluation tracked by Epoch AI, with 68 scored model versions on record. The scores here are reported by third parties rather than produced by Epoch AI running the evaluation itself.

Scored models span June 2023 to March 2026. The best score recorded is 62.5, measured as Overall score. Models come from OpenAI, Anthropic, xAI, Google DeepMind, Z.ai (Zhipu AI), Moonshot, DeepSeek, Meta AI and others.

Full record
Score metric
Overall score
Models scored
68
Best score recorded
62.5
Earliest model scored
Jun 13, 2023
Most recent model scored
Mar 17, 2026
Third-party reported
Yes
Leaderboard
01o3-2025-04-16_unknownOpenAI62.5
02claude-opus-4-1-20250805_unknownAnthropic62
03claude-sonnet-4-5-20250929_unknownAnthropic61.9
04claude-3-7-sonnet-20250219_unknownAnthropic61.8
05o4-mini-2025-04-16_unknownOpenAI61.8
06gpt-4.5-preview-2025-02-27OpenAI61.7
07gpt-4.1-2025-04-14OpenAI61.5
08gpt-5-2025-08-07_unknownOpenAI61.4
09claude-haiku-4-5-20251001_unknownAnthropic61.4
10grok-4-20xAI61.4
11gemini-2.5-pro-preview-03-25Google DeepMind61.3
12gemini-3-pro-previewGoogle DeepMind61.2
13claude-opus-4-20250514_unknownAnthropic61.1
14grok-4-1-fast-reasoningxAI61
15gpt-5-mini-2025-08-07_unknownOpenAI61
16glm-5Z.ai (Zhipu AI)61
17grok-4-0709xAI60.9
18claude-opus-4-5-20251101_unknownAnthropic60.7
19claude-3-5-sonnet-20241022Anthropic60.7
20gemini-2.5-flash-preview-04-17Google DeepMind60.6
21grok-4-fastxAI60.5
22gemini-2.5-proGoogle DeepMind60.4
23Kimi-K2-InstructMoonshot60.2
24claude-sonnet-4-20250514_unknownAnthropic60.2
25gpt-5.2-2025-12-11_unknownOpenAI60.1
26claude-opus-4-6_unknownAnthropic60
27DeepSeek-R1DeepSeek60
28Llama-3.1-405B-InstructMeta AI59.9
29Kimi-K2-Instruct-0905Moonshot59.8
30Qwen3-235B-A22BAlibaba59.7
31claude-sonnet-4-6_unknownAnthropic59.6
32o3-mini-2025-01-31_unknownOpenAI59.6
33gpt-5.4-2026-03-05_unknownOpenAI59.5
34gpt-4-turbo-2024-04-09OpenAI59.4
35claude-3-5-sonnet-20240620Anthropic59.4
36GLM-4.5-AirZ.ai (Zhipu AI),Tsinghua University59.2
37DeepSeek-V3DeepSeek59.1
38gpt-5-nano-2025-08-07_unknownOpenAI59.1
39gemini-3.1-pro-previewGoogle DeepMind59
40gemini-2.5-flashGoogle DeepMind59
41Llama-3.3-70B-InstructMeta AI58.6
42Meta-Llama-3-8B-InstructMeta AI58.6
43gemini-3-flash-previewGoogle DeepMind58.5
44claude-3-opus-20240229Anthropic58.4
45QwQ-32B-PreviewAlibaba58.3
46gpt-5.1-2025-11-13_unknownOpenAI58.1
47DeepSeek-V3.1DeepSeek58
48gpt-4-0613OpenAI57.8
49qwen1.5-110b-chatAlibaba57.7
50gpt-4o-2024-05-13OpenAI57.7
51Llama-4-Maverick-17B-128E-Instruct-FP8Meta AI57.5
52Llama-4-Scout-17B-16E-InstructMeta AI57.5
53qwen2.5-72b-instructAlibaba57.5
54gpt-5.4-nano-2026-03-17_unknownOpenAI57.3
55mistral-large-2407Mistral AI57.1
56gemini-2.0-flash-lite-001Google DeepMind57.1
57Meta-Llama-3-70BMeta AI57.1
58gpt-5.4-mini-2026-03-17_unknownOpenAI57
59mistral-large-2411Mistral AI56.9
60Mixtral-8x22B-Instruct-v0.1Mistral AI56.3
More benchmarks
SourceEpoch AI, 'AI Benchmarking Hub'. Published online at epoch.ai. Retrieved 2026-07-29 from https://epoch.ai/benchmarks. Licensed under CC BY 4.0.
← All benchmarks