The length of responses generated by language models to benchmark questions has increased over time for both reasoning and non-reasoning models. According to our internal benchmarks, reasoning models’ responses are growing considerably faster (5x per year) than those from non-reasoning models (2.2x per year). Reasoning models also exhibit longer response lengths overall – currently, around 8x more tokens on average, compared to non-reasoning models.
| Model | Identifier | Release Date | Benchmark | Best score (across scorers) | Output tokens per question | Reasoning model? | Decimal year |
|---|---|---|---|---|---|---|---|
| Tulu 3 (Tülu 3) 70B | Llama-3.1-Tulu-3-70B-DPO | 2024-11-21 | GPQA diamond | 0.46 | 619.02 | N | 2024.89 |
| Tulu 3 (Tülu 3) 70B | Llama-3.1-Tulu-3-70B-DPO | 2024-11-21 | OTIS Mock AIME 2024-2025 | 0.04 | 970.87 | N | 2024.89 |
| Tulu 3 (Tülu 3) 70B | Llama-3.1-Tulu-3-70B-DPO | 2024-11-21 | MATH level 5 | 0.43 | 753.57 | N | 2024.89 |
| Claude 2 | claude-2.0 | 2023-07-11 | OTIS Mock AIME 2024-2025 | 0.03 | 363.67 | N | 2023.53 |
| Claude 2 | claude-2.0 | 2023-07-11 | MATH level 5 | 0.12 | 258.77 | N | 2023.53 |
| Claude 2 | claude-2.0 | 2023-07-11 | GPQA diamond | 0.35 | 199.86 | N | 2023.53 |
| Claude 2.1 | claude-2.1 | 2023-11-21 | OTIS Mock AIME 2024-2025 | 0.02 | 366.27 | N | 2023.89 |
| Claude 2.1 | claude-2.1 | 2023-11-21 | GPQA diamond | 0.33 | 220.49 | N | 2023.89 |
| Claude 3 Haiku | claude-3-haiku-20240307 | 2024-03-07 | MATH level 5 | 0.15 | 401.02 | N | 2024.18 |
| Claude 3 Haiku | claude-3-haiku-20240307 | 2024-03-07 | GPQA diamond | 0.36 | 345.75 | N | 2024.18 |
| Claude 3 Haiku | claude-3-haiku-20240307 | 2024-03-07 | OTIS Mock AIME 2024-2025 | 0.02 | 566.71 | N | 2024.18 |
| Claude 3 Opus | claude-3-opus-20240229 | 2024-02-29 | MATH level 5 | 0.37 | 493.40 | N | 2024.16 |
| Claude 3 Opus | claude-3-opus-20240229 | 2024-02-29 | GPQA diamond | 0.47 | 432.05 | N | 2024.16 |
| Claude 3 Opus | claude-3-opus-20240229 | 2024-02-29 | OTIS Mock AIME 2024-2025 | 0.05 | 581.47 | N | 2024.16 |
| Claude 3 Sonnet | claude-3-sonnet-20240229 | 2024-02-29 | OTIS Mock AIME 2024-2025 | 0.03 | 592.98 | N | 2024.16 |
| Claude 3 Sonnet | claude-3-sonnet-20240229 | 2024-02-29 | MATH level 5 | 0.18 | 491.72 | N | 2024.16 |
| Claude 3 Sonnet | claude-3-sonnet-20240229 | 2024-02-29 | GPQA diamond | 0.41 | 467.96 | N | 2024.16 |
| Claude 3.5 Haiku | claude-3-5-haiku-20241022 | 2024-10-22 | MATH level 5 | 0.46 | 427.48 | N | 2024.81 |
| Claude 3.5 Haiku | claude-3-5-haiku-20241022 | 2024-10-22 | GPQA diamond | 0.38 | 295.93 | N | 2024.81 |
| Claude 3.5 Haiku | claude-3-5-haiku-20241022 | 2024-10-22 | OTIS Mock AIME 2024-2025 | 0.04 | 561.04 | N | 2024.81 |
| Claude 3.5 Sonnet | claude-3-5-sonnet-20240620 | 2024-06-20 | OTIS Mock AIME 2024-2025 | 0.07 | 555.56 | N | 2024.47 |
| Claude 3.5 Sonnet | claude-3-5-sonnet-20240620 | 2024-06-20 | GPQA diamond | 0.54 | 420.55 | N | 2024.47 |
| Claude 3.5 Sonnet | claude-3-5-sonnet-20240620 | 2024-06-20 | MATH level 5 | 0.52 | 439.62 | N | 2024.47 |
| Claude 3.5 Sonnet | claude-3-5-sonnet-20241022 | 2024-10-22 | MATH level 5 | 0.57 | 450.57 | N | 2024.81 |
| Claude 3.5 Sonnet | claude-3-5-sonnet-20241022 | 2024-10-22 | GPQA diamond | 0.55 | 353.90 | N | 2024.81 |
| Claude 3.5 Sonnet | claude-3-5-sonnet-20241022 | 2024-10-22 | OTIS Mock AIME 2024-2025 | 0.08 | 593.11 | N | 2024.81 |
| Claude 3.7 Sonnet | claude-3-7-sonnet-20250219 | 2025-02-24 | MATH level 5 | 0.68 | 823.41 | N | 2025.15 |
| Claude 3.7 Sonnet | claude-3-7-sonnet-20250219 | 2025-02-24 | OTIS Mock AIME 2024-2025 | 0.22 | 1,435.64 | N | 2025.15 |
| Claude 3.7 Sonnet | claude-3-7-sonnet-20250219 | 2025-02-24 | GPQA diamond | 0.66 | 591.49 | N | 2025.15 |
| DBRX | dbrx-instruct | 2024-03-27 | MATH level 5 | 0.12 | 639.17 | N | 2024.24 |
| DBRX | dbrx-instruct | 2024-03-27 | GPQA diamond | 0.33 | 378.77 | N | 2024.24 |
| DeepSeek LLM 67B | deepseek-llm-67b-chat | 2023-11-29 | GPQA diamond | 0.25 | 371.28 | N | 2023.91 |
| DeepSeek LLM 67B | deepseek-llm-67b-chat | 2023-11-29 | MATH level 5 | 0.06 | 444.98 | N | 2023.91 |
| DeepSeek-V3 | DeepSeek-V3 | 2024-12-26 | OTIS Mock AIME 2024-2025 | 0.16 | 1,865.82 | N | 2024.99 |
| DeepSeek-V3 | DeepSeek-V3 | 2024-12-26 | GPQA diamond | 0.57 | 610.99 | N | 2024.99 |
| DeepSeek-V3 | DeepSeek-V3 | 2024-12-26 | MATH level 5 | 0.65 | 1,047.41 | N | 2024.99 |
| DeepSeek-V3 | DeepSeek-V3-0324 | 2025-03-24 | GPQA diamond | 0.68 | 1,162.77 | N | 2025.23 |
| DeepSeek-V3 | DeepSeek-V3-0324 | 2025-03-24 | OTIS Mock AIME 2024-2025 | 0.38 | 3,179.00 | N | 2025.23 |
| DeepSeek-V3 | DeepSeek-V3-0324 | 2025-03-24 | MATH level 5 | 0.76 | 1,499.00 | N | 2025.23 |
| GPT-3.5 Turbo | gpt-3.5-turbo-0125 | 2024-01-25 | MATH level 5 | 0.12 | 301.13 | N | 2024.07 |
| GPT-3.5 Turbo | gpt-3.5-turbo-0125 | 2024-01-25 | GPQA diamond | 0.27 | 108.64 | N | 2024.07 |
| GPT-3.5 Turbo | gpt-3.5-turbo-1106 | 2023-11-06 | MATH level 5 | 0.16 | 325.70 | N | 2023.85 |
| GPT-3.5 Turbo | gpt-3.5-turbo-1106 | 2023-11-06 | GPQA diamond | 0.28 | 97.97 | N | 2023.85 |
| GPT-4 | gpt-4-0125-preview | 2024-01-25 | GPQA diamond | 0.42 | 582.91 | N | 2024.07 |
| GPT-4 | gpt-4-0125-preview | 2024-01-25 | MATH level 5 | 0.35 | 832.09 | N | 2024.07 |
| GPT-4 | gpt-4-0613 | 2023-06-13 | MATH level 5 | 0.23 | 348.89 | N | 2023.45 |
| GPT-4 | gpt-4-0613 | 2023-06-13 | GPQA diamond | 0.31 | 216.47 | N | 2023.45 |
| GPT-4 | gpt-4-1106-preview | 2023-11-06 | GPQA diamond | 0.42 | 531.77 | N | 2023.85 |
| GPT-4 | gpt-4-1106-preview | 2023-11-06 | MATH level 5 | 0.40 | 765.00 | N | 2023.85 |
| GPT-4 Turbo | gpt-4-turbo-2024-04-09 | 2024-04-09 | MATH level 5 | 0.47 | 614.73 | N | 2024.27 |
| GPT-4 Turbo | gpt-4-turbo-2024-04-09 | 2024-04-09 | OTIS Mock AIME 2024-2025 | 0.07 | 751.78 | N | 2024.27 |
| GPT-4 Turbo | gpt-4-turbo-2024-04-09 | 2024-04-09 | GPQA diamond | 0.47 | 565.02 | N | 2024.27 |
| GPT-4.1 | gpt-4.1-2025-04-14 | 2025-04-14 | GPQA diamond | 0.67 | 797.35 | N | 2025.28 |
| GPT-4.1 | gpt-4.1-2025-04-14 | 2025-04-14 | OTIS Mock AIME 2024-2025 | 0.38 | 3,812.11 | N | 2025.28 |
| GPT-4.1 | gpt-4.1-2025-04-14 | 2025-04-14 | MATH level 5 | 0.83 | 1,299.56 | N | 2025.28 |
| GPT-4.1 mini | gpt-4.1-mini-2025-04-14 | 2025-04-14 | MATH level 5 | 0.87 | 1,572.94 | N | 2025.28 |
| GPT-4.1 mini | gpt-4.1-mini-2025-04-14 | 2025-04-14 | OTIS Mock AIME 2024-2025 | 0.45 | 5,239.13 | N | 2025.28 |
| GPT-4.1 mini | gpt-4.1-mini-2025-04-14 | 2025-04-14 | GPQA diamond | 0.66 | 1,002.67 | N | 2025.28 |
| GPT-4.1 nano | gpt-4.1-nano-2025-04-14 | 2025-04-14 | OTIS Mock AIME 2024-2025 | 0.29 | 3,399.27 | N | 2025.28 |
| GPT-4.1 nano | gpt-4.1-nano-2025-04-14 | 2025-04-14 | MATH level 5 | 0.70 | 1,582.87 | N | 2025.28 |
| GPT-4.1 nano | gpt-4.1-nano-2025-04-14 | 2025-04-14 | GPQA diamond | 0.49 | 790.87 | N | 2025.28 |
| GPT-4.5 | gpt-4.5-preview-2025-02-27 | 2025-02-27 | OTIS Mock AIME 2024-2025 | 0.38 | 1,608.87 | N | 2025.16 |
| GPT-4.5 | gpt-4.5-preview-2025-02-27 | 2025-02-27 | GPQA diamond | 0.69 | 919.35 | N | 2025.16 |
| GPT-4.5 | gpt-4.5-preview-2025-02-27 | 2025-02-27 | MATH level 5 | 0.79 | 850.35 | N | 2025.16 |
| GPT-4o | gpt-4o-2024-05-13 | 2024-05-13 | OTIS Mock AIME 2024-2025 | 0.06 | 735.67 | N | 2024.37 |
| GPT-4o | gpt-4o-2024-05-13 | 2024-05-13 | MATH level 5 | 0.51 | 671.02 | N | 2024.37 |
| GPT-4o | gpt-4o-2024-05-13 | 2024-05-13 | GPQA diamond | 0.49 | 588.37 | N | 2024.37 |
| GPT-4o | gpt-4o-2024-08-06 | 2024-08-06 | MATH level 5 | 0.53 | 701.83 | N | 2024.60 |
| GPT-4o | gpt-4o-2024-08-06 | 2024-08-06 | GPQA diamond | 0.49 | 588.98 | N | 2024.60 |
| GPT-4o | gpt-4o-2024-08-06 | 2024-08-06 | OTIS Mock AIME 2024-2025 | 0.06 | 835.67 | N | 2024.60 |
| GPT-4o | gpt-4o-2024-11-20 | 2024-11-20 | MATH level 5 | 0.50 | 791.10 | N | 2024.89 |
| GPT-4o | gpt-4o-2024-11-20 | 2024-11-20 | OTIS Mock AIME 2024-2025 | 0.06 | 990.82 | N | 2024.89 |
| GPT-4o | gpt-4o-2024-11-20 | 2024-11-20 | GPQA diamond | 0.48 | 725.63 | N | 2024.89 |
| GPT-4o mini | gpt-4o-mini-2024-07-18 | 2024-07-18 | MATH level 5 | 0.53 | 814.70 | N | 2024.55 |
| GPT-4o mini | gpt-4o-mini-2024-07-18 | 2024-07-18 | GPQA diamond | 0.38 | 563.88 | N | 2024.55 |
| Gemini 1.0 Pro | gemini-1.0-pro-001 | 2024-02-15 | OTIS Mock AIME 2024-2025 | 0.01 | 545.47 | N | 2024.13 |
| Gemini 1.0 Pro | gemini-1.0-pro-001 | 2024-02-15 | MATH level 5 | 0.11 | 310.84 | N | 2024.13 |
| Gemini 1.0 Pro | gemini-1.0-pro-001 | 2024-02-15 | GPQA diamond | 0.34 | 211.21 | N | 2024.13 |
| Gemini 1.5 Flash | gemini-1.5-flash-001 | 2024-05-23 | MATH level 5 | 0.25 | 445.25 | N | 2024.39 |
| Gemini 1.5 Flash | gemini-1.5-flash-001 | 2024-05-23 | GPQA diamond | 0.40 | 355.59 | N | 2024.39 |
| Gemini 1.5 Flash | gemini-1.5-flash-001 | 2024-05-23 | OTIS Mock AIME 2024-2025 | 0.04 | 1,005.71 | N | 2024.39 |
| Gemini 1.5 Flash | gemini-1.5-flash-002 | 2024-09-24 | GPQA diamond | 0.47 | 427.64 | N | 2024.73 |
| Gemini 1.5 Flash | gemini-1.5-flash-002 | 2024-09-24 | OTIS Mock AIME 2024-2025 | 0.16 | 907.44 | N | 2024.73 |
| Gemini 1.5 Flash | gemini-1.5-flash-002 | 2024-09-24 | MATH level 5 | 0.62 | 581.86 | N | 2024.73 |
| Gemini 1.5 Flash 8B | gemini-1.5-flash-8b-001 | 2024-10-03 | GPQA diamond | 0.33 | 468.93 | N | 2024.76 |
| Gemini 1.5 Flash 8B | gemini-1.5-flash-8b-001 | 2024-10-03 | OTIS Mock AIME 2024-2025 | 0.05 | 900.09 | N | 2024.76 |
| Gemini 1.5 Pro | gemini-1.5-pro-001 | 2024-05-24 | OTIS Mock AIME 2024-2025 | 0.07 | 811.09 | N | 2024.40 |
| Gemini 1.5 Pro | gemini-1.5-pro-001 | 2024-05-24 | GPQA diamond | 0.46 | 357.44 | N | 2024.40 |
| Gemini 1.5 Pro | gemini-1.5-pro-001 | 2024-05-24 | MATH level 5 | 0.41 | 445.27 | N | 2024.40 |
| Gemini 1.5 Pro | gemini-1.5-pro-002 | 2024-09-24 | GPQA diamond | 0.57 | 441.29 | N | 2024.73 |
| Gemini 1.5 Pro | gemini-1.5-pro-002 | 2024-09-24 | MATH level 5 | 0.70 | 571.37 | N | 2024.73 |
| Gemini 1.5 Pro | gemini-1.5-pro-002 | 2024-09-24 | OTIS Mock AIME 2024-2025 | 0.23 | 826.67 | N | 2024.73 |
| Gemini 2.0 Flash | gemini-2.0-flash-001 | 2025-02-05 | MATH level 5 | 0.82 | 908.88 | N | 2025.10 |
| Gemini 2.0 Flash | gemini-2.0-flash-001 | 2025-02-05 | OTIS Mock AIME 2024-2025 | 0.31 | 1,566.00 | N | 2025.10 |
| Gemini 2.0 Flash | gemini-2.0-flash-001 | 2025-02-05 | GPQA diamond | 0.64 | 605.83 | N | 2025.10 |
| Gemini 2.0 Pro | gemini-2.0-pro-exp-02-05 | 2025-02-05 | MATH level 5 | 0.83 | 964.44 | N | 2025.10 |
| Gemini 2.0 Pro | gemini-2.0-pro-exp-02-05 | 2025-02-05 | GPQA diamond | 0.66 | 625.05 | N | 2025.10 |
| Gemma 2 27B | gemma-2-27b-it | 2024-06-24 | MATH level 5 | 0.28 | 468.84 | N | 2024.48 |
| Gemma 2 27B | gemma-2-27b-it | 2024-06-24 | GPQA diamond | 0.36 | 330.40 | N | 2024.48 |
| Gemma 2 27B | gemma-2-27b-it | 2024-06-24 | OTIS Mock AIME 2024-2025 | 0.01 | 707.38 | N | 2024.48 |
| Gemma 2 9B | gemma-2-9b-it | 2024-06-24 | MATH level 5 | 0.21 | 434.91 | N | 2024.48 |
| Gemma 2 9B | gemma-2-9b-it | 2024-06-24 | OTIS Mock AIME 2024-2025 | 0.01 | 567.60 | N | 2024.48 |
| Gemma 2 9B | gemma-2-9b-it | 2024-06-24 | GPQA diamond | 0.27 | 317.89 | N | 2024.48 |
| Gemma 3 27B | gemma-3-27b-it | 2025-03-12 | OTIS Mock AIME 2024-2025 | 0.20 | 3,147.29 | N | 2025.19 |
| Gemma 3 27B | gemma-3-27b-it | 2025-03-12 | GPQA diamond | 0.49 | 830.12 | N | 2025.19 |
| Gemma 3 27B | gemma-3-27b-it | 2025-03-12 | MATH level 5 | 0.74 | 1,226.91 | N | 2025.19 |
| Grok-2 | grok-2-1212 | 2024-12-12 | GPQA diamond | 0.54 | 639.79 | N | 2024.95 |
| Grok-2 | grok-2-1212 | 2024-12-12 | MATH level 5 | 0.64 | 1,048.21 | N | 2024.95 |
| Grok-2 | grok-2-1212 | 2024-12-12 | OTIS Mock AIME 2024-2025 | 0.12 | 1,631.33 | N | 2024.95 |
| Grok-3 | grok-3-beta | 2025-04-09 | OTIS Mock AIME 2024-2025 | 0.56 | 5,544.80 | N | 2025.27 |
| Grok-3 | grok-3-beta | 2025-04-09 | GPQA diamond | 0.76 | 2,524.33 | N | 2025.27 |
| Grok-3 | grok-3-beta | 2025-04-09 | MATH level 5 | 0.89 | 2,813.72 | N | 2025.27 |
| Hermes 2 Theta Llama-3 70B | Hermes-2-Theta-Llama-3-70B | 2024-06-20 | OTIS Mock AIME 2024-2025 | 0.03 | 700.78 | N | 2024.47 |
| Hermes 2 Theta Llama-3 70B | Hermes-2-Theta-Llama-3-70B | 2024-06-20 | GPQA diamond | 0.37 | 286.57 | N | 2024.47 |
| Hermes 2 Theta Llama-3 70B | Hermes-2-Theta-Llama-3-70B | 2024-06-20 | MATH level 5 | 0.23 | 343.75 | N | 2024.47 |
| Llama 2-70B | Llama-2-70b-chat-hf | 2023-07-18 | MATH level 5 | 0.03 | 433.10 | N | 2023.55 |
| Llama 2-70B | Llama-2-70b-chat-hf | 2023-07-18 | OTIS Mock AIME 2024-2025 | 0.00 | 711.47 | N | 2023.55 |
| Llama 2-70B | Llama-2-70b-chat-hf | 2023-07-18 | GPQA diamond | 0.26 | 445.91 | N | 2023.55 |
| Llama 3-70B | Meta-Llama-3-70B-Instruct | 2024-04-18 | OTIS Mock AIME 2024-2025 | 0.04 | 705.27 | N | 2024.30 |
| Llama 3-70B | Meta-Llama-3-70B-Instruct | 2024-04-18 | MATH level 5 | 0.23 | 343.61 | N | 2024.30 |
| Llama 3-70B | Meta-Llama-3-70B-Instruct | 2024-04-18 | GPQA diamond | 0.41 | 306.38 | N | 2024.30 |
| Llama 3-8B | Meta-Llama-3-8B-Instruct | 2024-04-18 | OTIS Mock AIME 2024-2025 | 0.01 | 645.11 | N | 2024.30 |
| Llama 3-8B | Meta-Llama-3-8B-Instruct | 2024-04-18 | MATH level 5 | 0.06 | 417.63 | N | 2024.30 |
| Llama 3-8B | Meta-Llama-3-8B-Instruct | 2024-04-18 | GPQA diamond | 0.26 | 378.92 | N | 2024.30 |
| Llama 3.1-405B | Llama-3.1-405B-Instruct | 2024-07-23 | GPQA diamond | 0.51 | 619.81 | N | 2024.56 |
| Llama 3.1-405B | Llama-3.1-405B-Instruct | 2024-07-23 | MATH level 5 | 0.50 | 897.79 | N | 2024.56 |
| Llama 3.1-70B | Llama-3.1-70B-Instruct | 2024-07-23 | MATH level 5 | 0.37 | 730.79 | N | 2024.56 |
| Llama 3.1-70B | Llama-3.1-70B-Instruct | 2024-07-23 | GPQA diamond | 0.44 | 677.24 | N | 2024.56 |
| Llama 3.1-8B | Llama-3.1-8B-Instruct | 2024-07-23 | GPQA diamond | 0.26 | 1,043.45 | N | 2024.56 |
| Llama 3.1-8B | Llama-3.1-8B-Instruct | 2024-07-23 | MATH level 5 | 0.23 | 1,309.31 | N | 2024.56 |
| Llama 3.2 90B | Llama-3.2-90B-Vision-Instruct | 2024-09-24 | GPQA diamond | 0.41 | 648.12 | N | 2024.73 |
| Llama 3.2 90B | Llama-3.2-90B-Vision-Instruct | 2024-09-24 | OTIS Mock AIME 2024-2025 | 0.03 | 1,155.20 | N | 2024.73 |
| Llama 3.2 90B | Llama-3.2-90B-Vision-Instruct | 2024-09-24 | MATH level 5 | 0.39 | 824.58 | N | 2024.73 |
| Llama 3.3 | Llama-3.3-70B-Instruct | 2024-12-06 | MATH level 5 | 0.42 | 946.56 | N | 2024.93 |
| Llama 3.3 | Llama-3.3-70B-Instruct | 2024-12-06 | GPQA diamond | 0.47 | 806.83 | N | 2024.93 |
| Llama 3.3 | Llama-3.3-70B-Instruct | 2024-12-06 | OTIS Mock AIME 2024-2025 | 0.05 | 1,157.04 | N | 2024.93 |
| Llama 4 Maverick | Llama-4-Maverick-17B-128E-Instruct-FP8 | 2025-04-05 | OTIS Mock AIME 2024-2025 | 0.21 | 1,312.67 | N | 2025.26 |
| Llama 4 Maverick | Llama-4-Maverick-17B-128E-Instruct-FP8 | 2025-04-05 | MATH level 5 | 0.73 | 888.53 | N | 2025.26 |
| Llama 4 Maverick | Llama-4-Maverick-17B-128E-Instruct-FP8 | 2025-04-05 | GPQA diamond | 0.67 | 885.43 | N | 2025.26 |
| Llama 4 Scout | Llama-4-Scout-17B-16E-Instruct | 2025-04-05 | GPQA diamond | 0.52 | 927.35 | N | 2025.26 |
| Llama 4 Scout | Llama-4-Scout-17B-16E-Instruct | 2025-04-05 | OTIS Mock AIME 2024-2025 | 0.08 | 1,435.47 | N | 2025.26 |
| Llama 4 Scout | Llama-4-Scout-17B-16E-Instruct | 2025-04-05 | MATH level 5 | 0.62 | 1,117.69 | N | 2025.26 |
| Ministral 3B | ministral-3b-2410 | 2024-10-16 | MATH level 5 | 0.14 | 655.16 | N | 2024.79 |
| Ministral 3B | ministral-3b-2410 | 2024-10-16 | GPQA diamond | 0.25 | 461.68 | N | 2024.79 |
| Ministral 8B | ministral-8b-2410 | 2024-10-16 | GPQA diamond | 0.27 | 506.76 | N | 2024.79 |
| Ministral 8B | ministral-8b-2410 | 2024-10-16 | MATH level 5 | 0.15 | 618.10 | N | 2024.79 |
| Mistral 7B | Mistral-7B-Instruct-v0.3 | 2024-05-27 | MATH level 5 | 0.04 | 650.42 | N | 2024.41 |
| Mistral 7B | Mistral-7B-Instruct-v0.3 | 2024-05-27 | GPQA diamond | 0.15 | 481.31 | N | 2024.41 |
| Mistral 7B | open-mistral-7b | 2023-09-27 | GPQA diamond | 0.13 | 456.83 | N | 2023.74 |
| Mistral 7B | open-mistral-7b | 2023-09-27 | MATH level 5 | 0.04 | 615.83 | N | 2023.74 |
| Mistral Large | mistral-large-2402 | 2024-02-26 | OTIS Mock AIME 2024-2025 | 0.02 | 703.89 | N | 2024.16 |
| Mistral Large | mistral-large-2402 | 2024-02-26 | GPQA diamond | 0.39 | 366.66 | N | 2024.16 |
| Mistral Large | mistral-large-2402 | 2024-02-26 | MATH level 5 | 0.24 | 539.95 | N | 2024.16 |
| Mistral Large 2 | mistral-large-2407 | 2024-07-24 | GPQA diamond | 0.49 | 475.47 | N | 2024.56 |
| Mistral Large 2 | mistral-large-2407 | 2024-07-24 | OTIS Mock AIME 2024-2025 | 0.08 | 894.56 | N | 2024.56 |
| Mistral Large 2 | mistral-large-2407 | 2024-07-24 | MATH level 5 | 0.45 | 567.50 | N | 2024.56 |
| Mistral Large 2 | mistral-large-2411 | 2024-11-18 | MATH level 5 | 0.50 | 651.97 | N | 2024.88 |
| Mistral Large 2 | mistral-large-2411 | 2024-11-18 | OTIS Mock AIME 2024-2025 | 0.08 | 938.04 | N | 2024.88 |
| Mistral Large 2 | mistral-large-2411 | 2024-11-18 | GPQA diamond | 0.51 | 582.11 | N | 2024.88 |
| Mistral NeMo | open-mistral-nemo-2407 | 2024-07-18 | MATH level 5 | 0.11 | 521.99 | N | 2024.55 |
| Mistral NeMo | open-mistral-nemo-2407 | 2024-07-18 | GPQA diamond | 0.30 | 392.60 | N | 2024.55 |
| Mistral Small 3 | mistral-small-2501 | 2025-01-25 | MATH level 5 | 0.45 | 619.93 | N | 2025.07 |
| Mistral Small 3 | mistral-small-2501 | 2025-01-25 | OTIS Mock AIME 2024-2025 | 0.05 | 883.18 | N | 2025.07 |
| Mistral Small 3 | mistral-small-2501 | 2025-01-25 | GPQA diamond | 0.45 | 532.44 | N | 2025.07 |
| Mistral Small 3.1 | mistral-small-2503 | 2025-03-17 | OTIS Mock AIME 2024-2025 | 0.06 | 854.49 | N | 2025.21 |
| Mistral Small 3.1 | mistral-small-2503 | 2025-03-17 | MATH level 5 | 0.47 | 659.29 | N | 2025.21 |
| Mistral Small 3.1 | mistral-small-2503 | 2025-03-17 | GPQA diamond | 0.47 | 495.42 | N | 2025.21 |
| Mixtral 8x22B | open-mixtral-8x22b | 2024-04-17 | MATH level 5 | 0.24 | 689.31 | N | 2024.30 |
| Mixtral 8x22B | open-mixtral-8x22b | 2024-04-17 | GPQA diamond | 0.34 | 544.07 | N | 2024.30 |
| Mixtral 8x7B | Mixtral-8x7B-Instruct-v0.1 | 2023-12-11 | MATH level 5 | 0.09 | 512.56 | N | 2023.95 |
| Mixtral 8x7B | Mixtral-8x7B-Instruct-v0.1 | 2023-12-11 | GPQA diamond | 0.31 | 467.73 | N | 2023.95 |
| Mixtral 8x7B | open-mixtral-8x7b | 2023-12-11 | MATH level 5 | 0.10 | 595.26 | N | 2023.95 |
| Mixtral 8x7B | open-mixtral-8x7b | 2023-12-11 | GPQA diamond | 0.30 | 510.93 | N | 2023.95 |
| Phi-4 | phi-4 | 2024-12-12 | OTIS Mock AIME 2024-2025 | 0.14 | 1,243.98 | N | 2024.95 |
| Phi-4 | phi-4 | 2024-12-12 | MATH level 5 | 0.65 | 866.20 | N | 2024.95 |
| Phi-4 | phi-4 | 2024-12-12 | GPQA diamond | 0.56 | 668.53 | N | 2024.95 |
| Qwen Plus | qwen-plus-2025-01-25 | 2025-01-25 | OTIS Mock AIME 2024-2025 | 0.18 | 1,259.71 | N | 2025.07 |
| Qwen Plus | qwen-plus-2025-01-25 | 2025-01-25 | MATH level 5 | 0.65 | 910.23 | N | 2025.07 |
| Qwen Plus | qwen-plus-2025-01-25 | 2025-01-25 | GPQA diamond | 0.48 | 343.88 | N | 2025.07 |
| Qwen Turbo | qwen-turbo-2024-11-01 | 2024-11-01 | GPQA diamond | 0.42 | 616.63 | N | 2024.84 |
| Qwen Turbo | qwen-turbo-2024-11-01 | 2024-11-01 | OTIS Mock AIME 2024-2025 | 0.06 | 1,044.33 | N | 2024.84 |
| Qwen Turbo | qwen-turbo-2024-11-01 | 2024-11-01 | MATH level 5 | 0.56 | 714.74 | N | 2024.84 |
| Qwen1.5-32B | qwen1.5-32b-chat | 2024-04-03 | GPQA diamond | 0.31 | 408.82 | N | 2024.26 |
| Qwen1.5-72B | qwen1.5-72b-chat | 2024-02-04 | GPQA diamond | 0.29 | 397.13 | N | 2024.10 |
| Qwen2-72B | qwen2-72b-instruct | 2024-06-07 | MATH level 5 | 0.39 | 536.61 | N | 2024.44 |
| Qwen2-72B | qwen2-72b-instruct | 2024-06-07 | GPQA diamond | 0.41 | 335.07 | N | 2024.44 |
| Qwen2.5-32B | qwen2.5-32b-instruct | 2024-09-17 | OTIS Mock AIME 2024-2025 | 0.07 | 841.76 | N | 2024.72 |
| Qwen2.5-32B | qwen2.5-32b-instruct | 2024-09-17 | MATH level 5 | 0.56 | 666.16 | N | 2024.72 |
| Qwen2.5-32B | qwen2.5-32b-instruct | 2024-09-17 | GPQA diamond | 0.46 | 560.42 | N | 2024.72 |
| Qwen2.5-72B | qwen2.5-72b-instruct | 2024-09-19 | OTIS Mock AIME 2024-2025 | 0.08 | 992.27 | N | 2024.72 |
| Qwen2.5-72B | qwen2.5-72b-instruct | 2024-09-19 | GPQA diamond | 0.49 | 713.77 | N | 2024.72 |
| Qwen2.5-72B | qwen2.5-72b-instruct | 2024-09-19 | MATH level 5 | 0.63 | 920.14 | N | 2024.72 |
| Qwen2.5-Max | qwen-max-2025-01-25 | 2025-01-25 | GPQA diamond | 0.56 | 612.65 | N | 2025.07 |
| Qwen2.5-Max | qwen-max-2025-01-25 | 2025-01-25 | MATH level 5 | 0.67 | 957.59 | N | 2025.07 |
| Qwen2.5-Max | qwen-max-2025-01-25 | 2025-01-25 | OTIS Mock AIME 2024-2025 | 0.16 | 1,332.07 | N | 2025.07 |
| WizardLM-2 8x22B | WizardLM-2-8x22B | 2024-04-15 | MATH level 5 | 0.26 | 1,017.79 | N | 2024.29 |
| WizardLM-2 8x22B | WizardLM-2-8x22B | 2024-04-15 | GPQA diamond | 0.43 | 1,025.64 | N | 2024.29 |
| Yi-1.5-34B | Yi-1.5-34B-Chat | 2024-05-13 | GPQA diamond | 0.32 | 732.07 | N | 2024.37 |
| Yi-1.5-34B | Yi-1.5-34B-Chat | 2024-05-13 | MATH level 5 | 0.25 | 656.89 | N | 2024.37 |
| Yi-34B | Yi-34B-Chat | 2023-11-22 | GPQA diamond | 0.15 | 331.37 | N | 2023.89 |
| Yi-34B | Yi-34B-Chat | 2023-11-22 | MATH level 5 | 0.05 | 695.79 | N | 2023.89 |
| phi-3-medium 14B | Phi-3-medium-128k-instruct | 2024-04-23 | GPQA diamond | 0.28 | 502.44 | N | 2024.31 |
| phi-3-medium 14B | Phi-3-medium-128k-instruct | 2024-04-23 | MATH level 5 | 0.18 | 520.40 | N | 2024.31 |
| Claude 3.7 Sonnet | claude-3-7-sonnet-20250219_64K | 2025-02-24 | GPQA diamond | 0.77 | 13,013.49 | Y | 2025.15 |
| Claude 3.7 Sonnet | claude-3-7-sonnet-20250219_64K | 2025-02-24 | MATH level 5 | 0.91 | 13,666.91 | Y | 2025.15 |
| Claude 3.7 Sonnet | claude-3-7-sonnet-20250219_64K | 2025-02-24 | OTIS Mock AIME 2024-2025 | 0.58 | 26,990.13 | Y | 2025.15 |
| DeepSeek-R1 | DeepSeek-R1 | 2025-01-20 | GPQA diamond | 0.72 | 7,594.73 | Y | 2025.05 |
| DeepSeek-R1 | DeepSeek-R1 | 2025-01-20 | MATH level 5 | 0.93 | 4,792.57 | Y | 2025.05 |
| DeepSeek-R1 | DeepSeek-R1 | 2025-01-20 | OTIS Mock AIME 2024-2025 | 0.53 | 10,790.42 | Y | 2025.05 |
| DeepSeek-R1-Distill-Llama-70B | DeepSeek-R1-Distill-Llama-70B | 2025-01-20 | GPQA diamond | 0.56 | 10,937.89 | Y | 2025.05 |
| DeepSeek-R1-Distill-Llama-70B | DeepSeek-R1-Distill-Llama-70B | 2025-01-20 | MATH level 5 | 0.90 | 4,288.81 | Y | 2025.05 |
| DeepSeek-R1-Distill-Llama-70B | DeepSeek-R1-Distill-Llama-70B | 2025-01-20 | OTIS Mock AIME 2024-2025 | 0.51 | 16,154.73 | Y | 2025.05 |
| Eurus-2-7B-PRIME | Eurus-2-7B-PRIME | 2024-12-31 | GPQA diamond | 0.34 | 1,002.71 | Y | 2025.00 |
| Grok-3 mini | grok-3-mini-beta_high | 2025-04-09 | GPQA diamond | 0.74 | 7,766.38 | Y | 2025.27 |
| Grok-3 mini | grok-3-mini-beta_high | 2025-04-09 | MATH level 5 | 0.88 | 6,443.50 | Y | 2025.27 |
| Grok-3 mini | grok-3-mini-beta_high | 2025-04-09 | OTIS Mock AIME 2024-2025 | 0.78 | 20,232.49 | Y | 2025.27 |
| QWQ-Plus | qwq-plus | 2025-04-08 | GPQA diamond | 0.65 | 8,802.37 | Y | 2025.27 |
| o1 | o1-2024-12-17_high | 2024-12-17 | GPQA diamond | 0.77 | 6,357.84 | Y | 2024.96 |
| o1 | o1-2024-12-17_high | 2024-12-17 | MATH level 5 | 0.95 | 4,133.01 | Y | 2024.96 |
| o1 | o1-2024-12-17_medium | 2024-12-17 | OTIS Mock AIME 2024-2025 | 0.73 | 10,844.87 | Y | 2024.96 |
| o1-mini | o1-mini-2024-09-12_high | 2024-09-12 | GPQA diamond | 0.62 | 1,856.87 | Y | 2024.70 |
| o1-mini | o1-mini-2024-09-12_high | 2024-09-12 | MATH level 5 | 0.89 | 1,851.54 | Y | 2024.70 |
| o1-mini | o1-mini-2024-09-12_high | 2024-09-12 | OTIS Mock AIME 2024-2025 | 0.47 | 8,013.36 | Y | 2024.70 |
| o1-preview | o1-preview-2024-09-12 | 2024-09-12 | GPQA diamond | 0.50 | 2,990.07 | Y | 2024.70 |
| o1-preview | o1-preview-2024-09-12 | 2024-09-12 | MATH level 5 | 0.82 | 3,639.79 | Y | 2024.70 |
| o1-preview | o1-preview-2024-09-12 | 2024-09-12 | OTIS Mock AIME 2024-2025 | 0.31 | 8,307.64 | Y | 2024.70 |
| o3 | o3-2025-04-16_high | 2025-04-16 | GPQA diamond | 0.82 | 7,606.86 | Y | 2025.29 |
| o3 | o3-2025-04-16_high | 2025-04-16 | MATH level 5 | 0.98 | 3,218.75 | Y | 2025.29 |
| o3 | o3-2025-04-16_high | 2025-04-16 | OTIS Mock AIME 2024-2025 | 0.84 | 13,525.18 | Y | 2025.29 |
| o3-mini | o3-mini-2025-01-31_high | 2025-01-31 | GPQA diamond | 0.77 | 7,717.72 | Y | 2025.08 |
| o3-mini | o3-mini-2025-01-31_high | 2025-01-31 | MATH level 5 | 0.96 | 2,955.50 | Y | 2025.08 |
| o3-mini | o3-mini-2025-01-31_high | 2025-01-31 | OTIS Mock AIME 2024-2025 | 0.77 | 12,818.80 | Y | 2025.08 |
| o4-mini | o4-mini-2025-04-16_high | 2025-04-16 | GPQA diamond | 0.80 | 7,855.01 | Y | 2025.29 |
| o4-mini | o4-mini-2025-04-16_high | 2025-04-16 | MATH level 5 | 0.98 | 3,281.37 | Y | 2025.29 |
| o4-mini | o4-mini-2025-04-16_high | 2025-04-16 | OTIS Mock AIME 2024-2025 | 0.82 | 14,084.20 | Y | 2025.29 |
Reasoning models have been shown to produce more reasoning tokens as the amount of RL training is scaled up. The explanation for longer responses from non-reasoning models is less clear, but it may reflect trends toward extended context lengths, judges’ preferences for longer responses when generating RLHF data, or a growing use of context distillation from Chain of Thought prompting. Finally, while today’s models are cleanly separable into reasoning vs. non-reasoning, there are indications that future models (like GPT-5) may blur this line.
Epoch's work is free to use, distribute, and reproduce provided the source and authors are credited under the Creative Commons BY license.
Learn more about this graph
Using data from Epoch’s Benchmarking Hub, we identify the average length of model responses across GPQA Diamond, MATH Level 5, and OTIS Mock AIME 2024-2025, and plot the trend over time. We observe that output lengths from reasoning models have grown significantly faster than their non-reasoning counterparts (5x per year, vs 2.2x). Unsurprisingly, we also find that reasoning models use far more tokens than non-reasoning models.
Code for our analysis is available here.
Data
Our data comes from Epoch’s Benchmarking Hub. We focus on model responses to GPQA Diamond, MATH level 5 benchmarks, and OTIS Mock AIME 2024-2025, since these have the most coverage and elicit similar response lengths. Across these benchmarks, we have data on 77 unique models, evaluated a total of 235 times. Of these models, 11 are reasoning models, 65 are non-reasoning models, and 1 (Claude 3.7 Sonnet) is evaluated both with and without extended reasoning. For reasoning models, we include thinking tokens in the total token count.
Some reasoning models are offered with varying levels of “effort”. For these models, we used only benchmark runs with the highest level of reasoning effort each model is capable of. Across OpenAI’s reasoning models, moving from “medium” to “high” effort resulted in a 1.6x increase in output tokens.
Analysis
We perform log-linear regressions of token output length on time, with separate models for reasoning and non-reasoning models. To generate confidence intervals, we bootstrap sample with replacement (n=500), then identify the 5th and 95th percentile slopes and predictions across samples. Our results were as follows, with 90% confidence intervals in parentheses:
| GPQA Diamond | MATH level 5 | OTIS Mock AIME 2024-2025 | Combined | |
|---|---|---|---|---|
| Non-reasoning models | 1.9x per year (1.6 - 2.3) | 1.9x per year (1.7 - 2.2) | 2.9x per year (2.3 - 3.9) | 2.2x per year (2.0 - 2.6) |
| Reasoning models | 10x per year (4 - 24) | 3x per year (1 - 9) | 4x per year (2 - 6) | 5x per year (2 - 13) |
While results for our non-reasoning model subset are quite stable, the slope for non-reasoning models is quite sensitive. Omission of individual models can shift the overall trend by significant amounts.
Assumptions
- We assume that exponential growth is an appropriate model for the trend in output response length. To test this, we compared against a linear model, and found that for both reasoning and non-reasoning models, the exponential fit was weakly (but not statistically significantly) preferred to the linear fit.
- We assume that trends in output length for the three benchmarks we focused on are indicative of trends among other benchmarks. We intend to examine results for other internal benchmark evaluations as they become available.




