Live
Benchmarks

Enigma Eval

Models scored
42
Best score
0.24
Metric
Accuracy

Enigma Eval is an AI evaluation tracked by Epoch AI, with 42 scored model versions on record. The scores here are reported by third parties rather than produced by Epoch AI running the evaluation itself.

Scored models span February 2024 to March 2026. The best score recorded is 0.24, measured as Accuracy. Models come from OpenAI, Google DeepMind, Anthropic, Moonshot, Google, Google DeepMind,Google, Mistral AI, Meta AI.

Full record
Score metric
Accuracy
Models scored
42
Best score recorded
0.24
Earliest model scored
Feb 29, 2024
Most recent model scored
Mar 5, 2026
Third-party reported
Yes
Leaderboard
01gpt-5.4-pro-2026-03-05_unknownOpenAI0.24
02gemini-3.1-pro-previewGoogle DeepMind0.2
03gpt-5-pro-2025-10-06_unknownOpenAI0.19
04gemini-3-pro-previewGoogle DeepMind0.18
05gpt-5.4-2026-03-05_xhighOpenAI0.16
06o3-2025-04-16_mediumOpenAI0.13
07o3-2025-04-16_highOpenAI0.12
08claude-opus-4-5-20251101_unknownAnthropic0.12
09gpt-5.1-2025-11-13_unknownOpenAI0.11
10gpt-5-2025-08-07_unknownOpenAI0.1
11gpt-5.2-2025-12-11_unknownOpenAI0.1
12o4-mini-2025-04-16_highOpenAI0.09
13gpt-5-mini-2025-08-07_unknownOpenAI0.08
14claude-opus-4-6_maxAnthropic0.08
15claude-opus-4-1-20250805_unknownAnthropic0.07
16claude-opus-4-6Anthropic0.07
17o4-mini-2025-04-16_mediumOpenAI0.07
18o1-pro-2025-03-19OpenAI0.06
19claude-sonnet-4-5-20250929_unknownAnthropic0.06
20o1-2024-12-17_unknownOpenAI0.06
21gemini-2.5-pro-preview-06-05Google DeepMind0.06
22claude-opus-4-20250514_unknownAnthropic0.06
23claude-3-7-sonnet-20250219_unknownAnthropic0.04
24gemini-2.5-pro-exp-03-25Google DeepMind0.04
25kimi-k2.5Moonshot0.03
26gpt-4.5-preview-2025-02-27OpenAI0.03
27claude-sonnet-4-20250514_unknownAnthropic0.03
28gemini-3.1-flash-liteGoogle0.03
29gemini-2.5-flash-preview-05-20Google DeepMind0.03
30gemini-2.5-pro-preview-05-06Google DeepMind0.02
31claude-3-7-sonnet-20250219Anthropic0.02
32gpt-4.1-2025-04-14OpenAI0.02
33gpt-5.1-2025-11-13_noneOpenAI0.02
34gemini-2.0-flash-thinking-exp-01-21Google DeepMind,Google0.01
35claude-3-5-sonnet-20241022Anthropic0.01
36pixtral-large-2411Mistral AI0.01
37claude-3-opus-20240229Anthropic0.01
38gpt-4o-2024-11-20OpenAI0.01
39gemini-2.0-pro-exp-02-05Google DeepMind0.01
40gemini-2.0-flash-02-05Google DeepMind,Google0.01
41Llama-4-Maverick-17B-128E-InstructMeta AI0.01
42Llama-3.2-90B-Vision-InstructMeta AI0
More benchmarks
SourceEpoch AI, 'AI Benchmarking Hub'. Published online at epoch.ai. Retrieved 2026-07-29 from https://epoch.ai/benchmarks. Licensed under CC BY 4.0.
← All benchmarks