METR Time Horizons is an AI evaluation tracked by Epoch AI, with 50 scored model versions on record. The scores here are reported by third parties rather than produced by Epoch AI running the evaluation itself.
Scored models span November 2019 to April 2026. The best score recorded is 0.85, measured as average_score. Models come from Anthropic, Google DeepMind, OpenAI, xAI, Moonshot, DeepSeek, Alibaba.
| 01 | claude-mythos-preview-early | Anthropic | 0.85 |
| 02 | claude-opus-4-6_unknown | Anthropic | 0.79 |
| 03 | gemini-3.1-pro-preview | Google DeepMind | 0.77 |
| 04 | gpt-5.2-2025-12-11_high | OpenAI | 0.75 |
| 05 | claude-opus-4-5-20251101_16K | Anthropic | 0.75 |
| 06 | gpt-5.3-codex | OpenAI | 0.75 |
| 07 | gpt-5.4-2026-03-05_unknown | OpenAI | 0.74 |
| 08 | gpt-5.4-2026-03-05_xhigh | OpenAI | 0.74 |
| 09 | claude-opus-4-5-20251101 | Anthropic | 0.73 |
| 10 | gpt-5.1-codex-max | OpenAI | 0.72 |
| 11 | gemini-3-pro-preview | Google DeepMind | 0.71 |
| 12 | gpt-5-2025-08-07_medium | OpenAI | 0.7 |
| 13 | gpt-5-2025-08-07_high | OpenAI | 0.69 |
| 14 | claude-sonnet-4-5-20250929_16K | Anthropic | 0.67 |
| 15 | claude-opus-4-1-20250805_16K | Anthropic | 0.67 |
| 16 | grok-4-0709 | xAI | 0.67 |
| 17 | o3-2025-04-16_medium | OpenAI | 0.65 |
| 18 | claude-opus-4-20250514_16K | Anthropic | 0.64 |
| 19 | o4-mini-2025-04-16_medium | OpenAI | 0.64 |
| 20 | o3-2025-04-16_unknown | OpenAI | 0.64 |
| 21 | claude-sonnet-4-20250514_16K | Anthropic | 0.62 |
| 22 | claude-opus-4-1-20250805 | Anthropic | 0.62 |
| 23 | claude-opus-4-20250514_unknown | Anthropic | 0.62 |
| 24 | claude-3-7-sonnet-20250219_16K | Anthropic | 0.6 |
| 25 | kimi-k2-thinking | Moonshot | 0.59 |
| 26 | gpt-oss-120b | OpenAI | 0.57 |
| 27 | o1-2024-12-17_medium | OpenAI | 0.56 |
| 28 | claude-3-7-sonnet-20250219 | Anthropic | 0.56 |
| 29 | gemini-2.5-pro-preview-06-05 | Google DeepMind | 0.55 |
| 30 | DeepSeek-R1-0528 | DeepSeek | 0.54 |
| 31 | claude-3-5-sonnet-20241022 | Anthropic | 0.53 |
| 32 | DeepSeek-R1 | DeepSeek | 0.52 |
| 33 | DeepSeek-V3-0324 | DeepSeek | 0.5 |
| 34 | o1-preview-2024-09-12 | OpenAI | 0.49 |
| 35 | claude-3-5-sonnet-20240620 | Anthropic | 0.48 |
| 36 | DeepSeek-V3 | DeepSeek | 0.47 |
| 37 | gpt-4o-2024-11-20 | OpenAI | 0.41 |
| 38 | gpt-4-1106-preview | OpenAI | 0.4 |
| 39 | claude-3-opus-20240229 | Anthropic | 0.38 |
| 40 | gpt-4-turbo-2024-04-09 | OpenAI | 0.37 |
| 41 | gpt-4-0314 | OpenAI | 0.36 |
| 42 | qwen2.5-72b-instruct | Alibaba | 0.36 |
| 43 | gpt-4-0125-preview | OpenAI | 0.35 |
| 44 | gpt-4o-2024-08-06 | OpenAI | 0.34 |
| 45 | qwen2-72b-instruct | Alibaba | 0.3 |
| 46 | gpt-4-0613 | OpenAI | 0.29 |
| 47 | gpt-4-turbo | OpenAI | 0.27 |
| 48 | gpt-3.5-turbo-instruct | OpenAI | 0.21 |
| 49 | davinci-002 | OpenAI | 0.16 |
| 50 | gpt2-xl | OpenAI | 0.1 |