Live
Benchmarks

Humanity's Last Exam

Models scored
51
Best score
0.46
Metric
Accuracy

Humanity's Last Exam is an AI evaluation tracked by Epoch AI, with 51 scored model versions on record. The scores here are reported by third parties rather than produced by Epoch AI running the evaluation itself.

Scored models span September 2024 to April 2026. The best score recorded is 0.46, measured as Accuracy. Models come from Google DeepMind, OpenAI, Meta AI, Anthropic, Moonshot, Google, Z.ai (Zhipu AI),Tsinghua University, Google DeepMind,Google and others.

Full record
Score metric
Accuracy
Models scored
51
Best score recorded
0.46
Earliest model scored
Sep 24, 2024
Most recent model scored
Apr 16, 2026
Third-party reported
Yes
Leaderboard
01gemini-3.1-pro-previewGoogle DeepMind0.46
02gpt-5.4-pro-2026-03-05_unknownOpenAI0.44
03muse-sparkMeta AI0.41
04gemini-3-pro-previewGoogle DeepMind0.38
05gpt-5.4-2026-03-05_xhighOpenAI0.36
06claude-opus-4-7_unknownAnthropic0.36
07claude-opus-4-6_maxAnthropic0.34
08gpt-5-pro-2025-10-06_unknownOpenAI0.32
09gpt-5.2-2025-12-11_unknownOpenAI0.28
10gpt-5-2025-08-07_highOpenAI0.25
11gpt-5-2025-08-07_unknownOpenAI0.25
12claude-opus-4-5-20251101_unknownAnthropic0.25
13kimi-k2.5Moonshot0.24
14gpt-5.1-2025-11-13_unknownOpenAI0.24
15gemini-2.5-pro-preview-06-05Google DeepMind0.22
16o3-2025-04-16_highOpenAI0.2
17gpt-5-mini-2025-08-07_unknownOpenAI0.19
18o3-2025-04-16_mediumOpenAI0.19
19claude-opus-4-6Anthropic0.19
20gemini-2.5-pro-exp-03-25Google DeepMind0.18
21o4-mini-2025-04-16_highOpenAI0.18
22gemini-2.5-pro-preview-05-06Google DeepMind0.18
23o4-mini-2025-04-16_mediumOpenAI0.14
24claude-sonnet-4-5-20250929_unknownAnthropic0.14
25gemini-2.5-flash-preview-04-17Google DeepMind0.12
26claude-opus-4-1-20250805_unknownAnthropic0.12
27gemini-2.5-flash-preview-05-20Google DeepMind0.11
28claude-opus-4-20250514_unknownAnthropic0.11
29gemini-3.1-flash-liteGoogle0.09
30glm-4.5Z.ai (Zhipu AI),Tsinghua University0.08
31GLM-4.5-AirZ.ai (Zhipu AI),Tsinghua University0.08
32o1-pro-2025-03-19OpenAI0.08
33claude-3-7-sonnet-20250219_unknownAnthropic0.08
34o1-2024-12-17_unknownOpenAI0.08
35claude-sonnet-4-20250514_unknownAnthropic0.08
36gpt-5.1-2025-11-13_noneOpenAI0.07
37gemini-2.0-flash-thinking-exp-01-21Google DeepMind,Google0.07
38Llama-4-Maverick-17B-128E-InstructMeta AI0.06
39gpt-4.5-preview-2025-02-27OpenAI0.05
40gpt-4.1-2025-04-14OpenAI0.05
41gemini-1.5-pro-002Google DeepMind0.05
42mistral-medium-2505Mistral AI0.05
43amazon.nova-pro-v1:0Amazon0.04
44claude-3-5-sonnet-20241022Anthropic0.04
45amazon.nova-lite-v1:0Amazon0.04
46gpt-4o-2024-11-20OpenAI0.03
More benchmarks
SourceEpoch AI, 'AI Benchmarking Hub'. Published online at epoch.ai. Retrieved 2026-07-29 from https://epoch.ai/benchmarks. Licensed under CC BY 4.0.
← All benchmarks