En vivo
Benchmarks

Fictionlivebench

Models scored
42
Best score
1
Metric
120k token score

Fictionlivebench is an AI evaluation tracked by Epoch AI, with 42 scored model versions on record. The scores here are reported by third parties rather than produced by Epoch AI running the evaluation itself.

Scored models span December 2024 to January 2026. The best score recorded is 1, measured as 120k token score. Models come from Meta AI, Alibaba, Anthropic, DeepSeek, Google DeepMind,Google, Google DeepMind, OpenAI, xAI and others.

Full record
Score metric
120k token score
Models scored
42
Best score recorded
1
Earliest model scored
Dec 17, 2024
Most recent model scored
Jan 27, 2026
Third-party reported
Yes
Leaderboard
01o3-2025-04-16_mediumOpenAI1
02grok-4-0709xAI0.97
03gpt-5-2025-08-07_mediumOpenAI0.97
04gemini-2.5-pro-exp-03-25Google DeepMind0.91
05o3-pro-2025-06-10_mediumOpenAI0.89
06gemini-2.5-pro-preview-06-05Google DeepMind0.88
07kimi-k2.5Moonshot0.78
08grok-4-fastxAI0.75
09gemini-2.5-pro-preview-05-06Google DeepMind0.72
10gemini-2.5-pro-preview-03-25Google DeepMind0.72
11chutes/Qwen3-235B-A22B-Thinking-2507Alibaba0.69
12gemini-2.5-flash-preview-05-20Google DeepMind0.69
13grok-3-mini-beta_mediumxAI0.66
14chatgpt-4o-01-29-2025OpenAI0.66
15gpt-4.5-preview-2025-02-27OpenAI0.64
16gpt-4.1-2025-04-14OpenAI0.63
17gemini-2.0-flash-001Google DeepMind,Google0.63
18o4-mini-2025-04-16_mediumOpenAI0.63
19gpt-5-mini-2025-08-07_mediumOpenAI0.63
20deepinfra/Qwen3-Next-80B-A3B-Instruct0.63
21MiniMax-M1-80kMiniMax0.59
22grok-3-betaxAI0.58
23claude-3-7-sonnet-20250219_8KAnthropic0.53
24gemini-2.5-flash-preview-04-17Google DeepMind0.53
25o1-2024-12-17_mediumOpenAI0.53
26DeepSeek-V3.1DeepSeek0.53
27chutes/Qwen3-Next-80B-A3B-Instruct0.47
28gpt-4.1-mini-2025-04-14OpenAI0.47
29parasail-qwen3-235b-a22b-instruct-2507Alibaba0.44
30o3-mini-2025-01-31_mediumOpenAI0.44
31fireworks/Kimi-K2-Instruct-0905Moonshot0.41
32claude-opus-4-20250514Anthropic0.38
33gemini-2.0-pro-exp-02-05Google DeepMind0.38
34gemini-2.0-flash-thinking-exp-01-21Google DeepMind,Google0.38
35chutes/Llama-4-Maverick-17B-128E-InstructMeta AI0.36
36claude-sonnet-4-20250514Anthropic0.36
37claude-3-7-sonnet-20250219Anthropic0.34
38DeepSeek-R1DeepSeek0.33
39chutes/Llama-4-Scout-17B-16E InstructMeta AI0.27
40gemini-2.5-flash-lite-preview-06-17-thinkingGoogle DeepMind0.22
41gpt-5-nano-2025-08-07_mediumOpenAI0.22
42gpt-4.1-nano-2025-04-14OpenAI0.19
More benchmarks
SourceEpoch AI, 'AI Benchmarking Hub'. Published online at epoch.ai. Retrieved 2026-07-29 from https://epoch.ai/benchmarks. Licensed under CC BY 4.0.
← All benchmarks