Live
Benchmarks

METR Time Horizons

Models scored
50
Best score
0.85
Metric
average_score

METR Time Horizons is an AI evaluation tracked by Epoch AI, with 50 scored model versions on record. The scores here are reported by third parties rather than produced by Epoch AI running the evaluation itself.

Scored models span November 2019 to April 2026. The best score recorded is 0.85, measured as average_score. Models come from Anthropic, Google DeepMind, OpenAI, xAI, Moonshot, DeepSeek, Alibaba.

Full record
Score metric
average_score
Models scored
50
Best score recorded
0.85
Earliest model scored
Nov 5, 2019
Most recent model scored
Apr 7, 2026
Third-party reported
Yes
Leaderboard
01claude-mythos-preview-earlyAnthropic0.85
02claude-opus-4-6_unknownAnthropic0.79
03gemini-3.1-pro-previewGoogle DeepMind0.77
04gpt-5.2-2025-12-11_highOpenAI0.75
05claude-opus-4-5-20251101_16KAnthropic0.75
06gpt-5.3-codexOpenAI0.75
07gpt-5.4-2026-03-05_unknownOpenAI0.74
08gpt-5.4-2026-03-05_xhighOpenAI0.74
09claude-opus-4-5-20251101Anthropic0.73
10gpt-5.1-codex-maxOpenAI0.72
11gemini-3-pro-previewGoogle DeepMind0.71
12gpt-5-2025-08-07_mediumOpenAI0.7
13gpt-5-2025-08-07_highOpenAI0.69
14claude-sonnet-4-5-20250929_16KAnthropic0.67
15claude-opus-4-1-20250805_16KAnthropic0.67
16grok-4-0709xAI0.67
17o3-2025-04-16_mediumOpenAI0.65
18claude-opus-4-20250514_16KAnthropic0.64
19o4-mini-2025-04-16_mediumOpenAI0.64
20o3-2025-04-16_unknownOpenAI0.64
21claude-sonnet-4-20250514_16KAnthropic0.62
22claude-opus-4-1-20250805Anthropic0.62
23claude-opus-4-20250514_unknownAnthropic0.62
24claude-3-7-sonnet-20250219_16KAnthropic0.6
25kimi-k2-thinkingMoonshot0.59
26gpt-oss-120bOpenAI0.57
27o1-2024-12-17_mediumOpenAI0.56
28claude-3-7-sonnet-20250219Anthropic0.56
29gemini-2.5-pro-preview-06-05Google DeepMind0.55
30DeepSeek-R1-0528DeepSeek0.54
31claude-3-5-sonnet-20241022Anthropic0.53
32DeepSeek-R1DeepSeek0.52
33DeepSeek-V3-0324DeepSeek0.5
34o1-preview-2024-09-12OpenAI0.49
35claude-3-5-sonnet-20240620Anthropic0.48
36DeepSeek-V3DeepSeek0.47
37gpt-4o-2024-11-20OpenAI0.41
38gpt-4-1106-previewOpenAI0.4
39claude-3-opus-20240229Anthropic0.38
40gpt-4-turbo-2024-04-09OpenAI0.37
41gpt-4-0314OpenAI0.36
42qwen2.5-72b-instructAlibaba0.36
43gpt-4-0125-previewOpenAI0.35
44gpt-4o-2024-08-06OpenAI0.34
45qwen2-72b-instructAlibaba0.3
46gpt-4-0613OpenAI0.29
47gpt-4-turboOpenAI0.27
48gpt-3.5-turbo-instructOpenAI0.21
49davinci-002OpenAI0.16
50gpt2-xlOpenAI0.1
More benchmarks
SourceEpoch AI, 'AI Benchmarking Hub'. Published online at epoch.ai. Retrieved 2026-07-29 from https://epoch.ai/benchmarks. Licensed under CC BY 4.0.
← All benchmarks