Live
Benchmarks

Terminal-Bench

Models scored
203
Best score
0.9
Metric
Accuracy mean

Terminal-Bench is an AI evaluation tracked by Epoch AI, with 203 scored model versions on record. The scores here are reported by third parties rather than produced by Epoch AI running the evaluation itself.

Scored models span June 2025 to April 2026. The best score recorded is 0.9, measured as Accuracy mean. Models come from Anthropic, OpenAI, Google DeepMind, xAI, Z.ai (Zhipu AI), MiniMax, Moonshot, DeepSeek and others.

Full record
Score metric
Accuracy mean
Models scored
203
Best score recorded
0.9
Earliest model scored
Jun 17, 2025
Most recent model scored
Apr 23, 2026
Third-party reported
Yes
Leaderboard
01claude-opus-4-7_unknownAnthropic0.9
02gpt-5.5_unknownOpenAI0.85
03gpt-5.4-2026-03-05_unknownOpenAI0.82
04gemini-3.1-pro-previewGoogle DeepMind0.8
05claude-opus-4-6_unknownAnthropic0.8
06gpt-5.3-codexOpenAI0.78
07claude-opus-4-6Anthropic0.7
08gemini-3-pro-previewGoogle DeepMind0.69
09gpt-5.2-codexOpenAI0.67
10gpt-5.2-2025-12-11_unknownOpenAI0.65
11gpt-5.2-2025-12-11_mediumOpenAI0.65
12gemini-3-flash-previewGoogle DeepMind0.64
13claude-opus-4-5-20251101Anthropic0.63
14claude-opus-4-5-20251101_unknownAnthropic0.63
15gpt-5.1-codex-miniOpenAI0.62
16gpt-5.1-codex-maxOpenAI0.6
17claude-opus-4-5-20251101_128KAnthropic0.59
18gpt-5.1-codexOpenAI0.58
19grok-4-20xAI0.57
More benchmarks
SourceEpoch AI, 'AI Benchmarking Hub'. Published online at epoch.ai. Retrieved 2026-07-29 from https://epoch.ai/benchmarks. Licensed under CC BY 4.0.
← All benchmarks