Live
Benchmarks

WebDev Arena

Models scored
82
Best score
1653.9
Metric
Arena Score

WebDev Arena is an AI evaluation tracked by Epoch AI, with 82 scored model versions on record. The scores here are reported by third parties rather than produced by Epoch AI running the evaluation itself.

Scored models span June 2025 to June 2026. The best score recorded is 1653.93, measured as Arena Score. Models come from Anthropic, Z.ai (Zhipu AI), Alibaba, MiniMax, Moonshot, Meta AI, Google, OpenAI and others.

Full record
Score metric
Arena Score
Models scored
82
Best score recorded
1653.9
Earliest model scored
Jun 17, 2025
Most recent model scored
Jun 16, 2026
Third-party reported
Yes
Leaderboard
01claude-fable-5_unknownAnthropic1653.9
02glm-5.2_maxZ.ai (Zhipu AI)1593.3
03claude-opus-4-7_unknownAnthropic1566.8
04claude-opus-4-7Anthropic1562.4
05claude-opus-4-6_unknownAnthropic1556.3
06claude-opus-4-6Anthropic1555.3
07claude-opus-4-8_unknownAnthropic1552.2
08claude-opus-4-8_noneAnthropic1545
09qwen3.7-maxAlibaba1540.8
10glm-5.1Z.ai (Zhipu AI)1534
11MiniMax-M3MiniMax1527.8
12kimi-k2.6Moonshot1526
13claude-sonnet-4-6Anthropic1522.9
14muse-sparkMeta AI1512.5
15claude-opus-4-5-20251101_32KAnthropic1512
16gemini-3.5-flash_unknownGoogle1506.4
17gpt-5.5_xhighOpenAI1504.7
18qwen3.6-max-previewAlibaba1485.6
19gpt-5.2-2025-12-11_highOpenAI1480
20kimi-k2.7-codeMoonshot1479.2
21claude-opus-4-5-20251101Anthropic1479
22gpt-5.5_highOpenAI1478.9
23mimo-v2.5-proXiaomi Corp1471.3
24gemini-3-pro-previewGoogle DeepMind1471
25deepseek-v4-pro_unknownDeepSeek1463.6
26gemini-3.1-pro-previewGoogle DeepMind1461.5
27qwen3.6-plusAlibaba1460.4
28gpt-5.4-2026-03-05_highOpenAI1457.2
29gemini-3-flash-previewGoogle DeepMind1454
30glm-5Z.ai (Zhipu AI)1447.3
31gpt-5.5_unknownOpenAI1444.3
32glm-4.7Z.ai (Zhipu AI)1441
33gpt-5.4-2026-03-05_mediumOpenAI1437.3
34mimo-v2-proXiaomi Corp1432.2
35mimo-v2.5Xiaomi Corp1432.1
36kimi-k2.5Moonshot1430.6
37kimi-k2.5_noneMoonshot1408
38gpt-5.3-codexOpenAI1406.7
39gpt-5.2-2025-12-11_unknownOpenAI1404.4
40gpt-5.4-mini-2026-03-17_highOpenAI1402.2
41MiniMax-M2.7MiniMax1400.5
42grok-4-20xAI1395.2
43gpt-5-2025-08-07_mediumOpenAI1395
44gpt-5.2-2025-12-11_mediumOpenAI1394
45qwen3.5-plusAlibaba1393.2
46MiniMax-M2.1MiniMax1391.6
47claude-sonnet-4-5-20250929_32KAnthropic1391
48gpt-5.4-2026-03-05_unknownOpenAI1388.3
49gpt-5.1-2025-11-13_mediumOpenAI1387
50claude-sonnet-4-5-20250929Anthropic1387
51claude-opus-4-1-20250805Anthropic1386
52claude-opus-4-1-20250805_unknownAnthropic1385.8
53MiniMax-M2.5MiniMax1382.1
54gemma-4-31b-itGoogle DeepMind1379.5
55grok-4-3xAI1376.6
56DeepSeek-V3.2-Exp_thinkingDeepSeek1367
57glm-4.6Z.ai (Zhipu AI),Tsinghua University1366
58gemma-4-26b-a4bGoogle DeepMind1359.3
59gpt-5.1-2025-11-13_lowOpenAI1359
60qwen3.5-27BAlibaba1356.9
More benchmarks
SourceEpoch AI, 'AI Benchmarking Hub'. Published online at epoch.ai. Retrieved 2026-07-29 from https://epoch.ai/benchmarks. Licensed under CC BY 4.0.
← All benchmarks