Fictionlivebench is an AI evaluation tracked by Epoch AI, with 42 scored model versions on record. The scores here are reported by third parties rather than produced by Epoch AI running the evaluation itself.
Scored models span December 2024 to January 2026. The best score recorded is 1, measured as 120k token score. Models come from Meta AI, Alibaba, Anthropic, DeepSeek, Google DeepMind,Google, Google DeepMind, OpenAI, xAI and others.
| 01 | o3-2025-04-16_medium | OpenAI | 1 |
| 02 | grok-4-0709 | xAI | 0.97 |
| 03 | gpt-5-2025-08-07_medium | OpenAI | 0.97 |
| 04 | gemini-2.5-pro-exp-03-25 | Google DeepMind | 0.91 |
| 05 | o3-pro-2025-06-10_medium | OpenAI | 0.89 |
| 06 | gemini-2.5-pro-preview-06-05 | Google DeepMind | 0.88 |
| 07 | kimi-k2.5 | Moonshot | 0.78 |
| 08 | grok-4-fast | xAI | 0.75 |
| 09 | gemini-2.5-pro-preview-05-06 | Google DeepMind | 0.72 |
| 10 | gemini-2.5-pro-preview-03-25 | Google DeepMind | 0.72 |
| 11 | chutes/Qwen3-235B-A22B-Thinking-2507 | Alibaba | 0.69 |
| 12 | gemini-2.5-flash-preview-05-20 | Google DeepMind | 0.69 |
| 13 | grok-3-mini-beta_medium | xAI | 0.66 |
| 14 | chatgpt-4o-01-29-2025 | OpenAI | 0.66 |
| 15 | gpt-4.5-preview-2025-02-27 | OpenAI | 0.64 |
| 16 | gpt-4.1-2025-04-14 | OpenAI | 0.63 |
| 17 | gemini-2.0-flash-001 | Google DeepMind,Google | 0.63 |
| 18 | o4-mini-2025-04-16_medium | OpenAI | 0.63 |
| 19 | gpt-5-mini-2025-08-07_medium | OpenAI | 0.63 |
| 20 | deepinfra/Qwen3-Next-80B-A3B-Instruct | 0.63 | |
| 21 | MiniMax-M1-80k | MiniMax | 0.59 |
| 22 | grok-3-beta | xAI | 0.58 |
| 23 | claude-3-7-sonnet-20250219_8K | Anthropic | 0.53 |
| 24 | gemini-2.5-flash-preview-04-17 | Google DeepMind | 0.53 |
| 25 | o1-2024-12-17_medium | OpenAI | 0.53 |
| 26 | DeepSeek-V3.1 | DeepSeek | 0.53 |
| 27 | chutes/Qwen3-Next-80B-A3B-Instruct | 0.47 | |
| 28 | gpt-4.1-mini-2025-04-14 | OpenAI | 0.47 |
| 29 | parasail-qwen3-235b-a22b-instruct-2507 | Alibaba | 0.44 |
| 30 | o3-mini-2025-01-31_medium | OpenAI | 0.44 |
| 31 | fireworks/Kimi-K2-Instruct-0905 | Moonshot | 0.41 |
| 32 | claude-opus-4-20250514 | Anthropic | 0.38 |
| 33 | gemini-2.0-pro-exp-02-05 | Google DeepMind | 0.38 |
| 34 | gemini-2.0-flash-thinking-exp-01-21 | Google DeepMind,Google | 0.38 |
| 35 | chutes/Llama-4-Maverick-17B-128E-Instruct | Meta AI | 0.36 |
| 36 | claude-sonnet-4-20250514 | Anthropic | 0.36 |
| 37 | claude-3-7-sonnet-20250219 | Anthropic | 0.34 |
| 38 | DeepSeek-R1 | DeepSeek | 0.33 |
| 39 | chutes/Llama-4-Scout-17B-16E Instruct | Meta AI | 0.27 |
| 40 | gemini-2.5-flash-lite-preview-06-17-thinking | Google DeepMind | 0.22 |
| 41 | gpt-5-nano-2025-08-07_medium | OpenAI | 0.22 |
| 42 | gpt-4.1-nano-2025-04-14 | OpenAI | 0.19 |