Across major language model providers, the models that achieve higher accuracy on benchmarks also take longer to run. Along the accuracy-runtime trade-off frontier, cutting the error rate in half typically slows the model by roughly 2x to 6x, depending on the task.
| ID | Release date | Runtime | Accuracy | Benchmark | Provider | Pareto optimal | Model | Version release date | Display name | Organization |
|---|---|---|---|---|---|---|---|---|---|---|
| gpt-4-0613 | 2023-06-13 | 8.55 | 0.31 | GPQA Diamond | OpenAI | FALSE | GPT-4 | 2023-06-13 | GPT-4 (Jun 2023) | OpenAI |
| claude-2.0 | 2023-07-11 | 10.47 | 0.35 | GPQA Diamond | Anthropic | FALSE | Claude 2 | 2023-07-11 | Anthropic | |
| Llama-2-70b-chat-hf | 2023-07-18 | 24.13 | 0.26 | GPQA Diamond | Meta | FALSE | Llama 2-70B | 2023-07-18 | Meta AI | |
| gpt-4-1106-preview | 2023-11-06 | 16.43 | 0.42 | GPQA Diamond | OpenAI | FALSE | GPT-4 | 2023-11-06 | GPT-4 Preview (Nov 2023) | OpenAI |
| gpt-3.5-turbo-1106 | 2023-11-06 | 1.14 | 0.28 | GPQA Diamond | OpenAI | TRUE | GPT-3.5 Turbo | 2023-11-06 | GPT-3.5 Turbo (Nov 2023) | OpenAI |
| claude-2.1 | 2023-11-21 | 18.80 | 0.33 | GPQA Diamond | Anthropic | FALSE | Claude 2.1 | 2023-11-21 | Anthropic | |
| Mixtral-8x7B-Instruct-v0.1 | 2023-12-11 | 18.78 | 0.31 | GPQA Diamond | Mistral | FALSE | Mixtral 8x7B | 2023-12-11 | Mistral AI | |
| open-mixtral-8x7b | 2023-12-11 | 6.40 | 0.30 | GPQA Diamond | Mistral | FALSE | Mixtral 8x7B | 2023-12-11 | Mistral AI | |
| gpt-4-0125-preview | 2024-01-25 | 18.78 | 0.42 | GPQA Diamond | OpenAI | FALSE | GPT-4 | 2024-01-25 | OpenAI | |
| gpt-3.5-turbo-0125 | 2024-01-25 | 1.25 | 0.27 | GPQA Diamond | OpenAI | FALSE | GPT-3.5 Turbo | 2024-01-25 | OpenAI | |
| qwen1.5-72b-chat | 2024-02-04 | 24.69 | 0.29 | GPQA Diamond | Alibaba | FALSE | Qwen1.5-72B | 2024-02-04 | Alibaba | |
| gemini-1.0-pro-001 | 2024-02-15 | 3.32 | 0.34 | GPQA Diamond | FALSE | Gemini 1.0 Pro | 2024-02-15 | Google DeepMind | ||
| mistral-large-2402 | 2024-02-26 | 9.66 | 0.39 | GPQA Diamond | Mistral | FALSE | Mistral Large | 2024-02-26 | Mistral AI | |
| claude-3-opus-20240229 | 2024-02-29 | 18.70 | 0.47 | GPQA Diamond | Anthropic | FALSE | Claude 3 Opus | 2024-02-29 | Anthropic | |
| claude-3-sonnet-20240229 | 2024-02-29 | 9.97 | 0.41 | GPQA Diamond | Anthropic | FALSE | Claude 3 Sonnet | 2024-02-29 | Anthropic | |
| claude-3-haiku-20240307 | 2024-03-07 | 2.65 | 0.36 | GPQA Diamond | Anthropic | FALSE | Claude 3 Haiku | 2024-03-07 | ||
| dbrx-instruct | 2024-03-27 | 187.07 | 0.33 | GPQA Diamond | Other | FALSE | DBRX | 2024-03-27 | Databricks | |
| qwen1.5-32b-chat | 2024-04-03 | 29.06 | 0.31 | GPQA Diamond | Alibaba | FALSE | Qwen1.5-32B | 2024-04-03 | Alibaba | |
| gpt-4-turbo-2024-04-09 | 2024-04-09 | 30.84 | 0.47 | GPQA Diamond | OpenAI | FALSE | GPT-4 Turbo | 2024-04-09 | OpenAI | |
| WizardLM-2-8x22B | 2024-04-15 | 32.27 | 0.43 | GPQA Diamond | Other | FALSE | WizardLM-2 8x22B | 2024-04-15 | Microsoft | |
| open-mixtral-8x22b | 2024-04-17 | 9.45 | 0.34 | GPQA Diamond | Mistral | FALSE | Mixtral 8x22B | 2024-04-17 | Mistral AI | |
| Meta-Llama-3-70B-Instruct | 2024-04-18 | 16.13 | 0.41 | GPQA Diamond | Meta | FALSE | Llama 3-70B | 2024-04-18 | Meta AI | |
| Meta-Llama-3-8B-Instruct | 2024-04-18 | 11.28 | 0.26 | GPQA Diamond | Meta | FALSE | Llama 3-8B | 2024-04-18 | ||
| Yi-1.5-34B-Chat | 2024-05-13 | 30.66 | 0.32 | GPQA Diamond | Other | FALSE | Yi-1.5-34B | 2024-05-13 | 01.AI | |
| gpt-4o-2024-05-13 | 2024-05-13 | 10.01 | 0.49 | GPQA Diamond | OpenAI | FALSE | GPT-4o | 2024-05-13 | GPT-4o (May 2024) | OpenAI |
| gemini-1.5-flash-001 | 2024-05-23 | 2.33 | 0.40 | GPQA Diamond | TRUE | Gemini 1.5 Flash | 2024-05-23 | Gemini 1.5 Flash (May 2024) | Google DeepMind | |
| gemini-1.5-pro-001 | 2024-05-24 | 7.41 | 0.46 | GPQA Diamond | FALSE | Gemini 1.5 Pro | 2024-05-24 | Google DeepMind | ||
| qwen2-72b-instruct | 2024-06-07 | 42.08 | 0.41 | GPQA Diamond | Alibaba | FALSE | Qwen2-72B | 2024-06-07 | Alibaba | |
| Hermes-2-Theta-Llama-3-70B | 2024-06-20 | 15.11 | 0.38 | GPQA Diamond | Other | FALSE | Hermes 2 Theta Llama-3 70B | 2024-06-20 | Nous Research,Arcee AI | |
| claude-3-5-sonnet-20240620 | 2024-06-20 | 10.39 | 0.54 | GPQA Diamond | Anthropic | FALSE | Claude 3.5 Sonnet | 2024-06-20 | Claude 3.5 Sonnet (Jun 2024) | Anthropic |
| gemma-2-27b-it | 2024-06-24 | 24.28 | 0.37 | GPQA Diamond | FALSE | Gemma 2 27B | 2024-06-24 | Google DeepMind | ||
| gemma-2-9b-it | 2024-06-24 | 2.72 | 0.28 | GPQA Diamond | FALSE | Gemma 2 9B | 2024-06-24 | Google DeepMind | ||
| gpt-4o-mini-2024-07-18 | 2024-07-18 | 9.31 | 0.38 | GPQA Diamond | OpenAI | FALSE | GPT-4o mini | 2024-07-18 | OpenAI | |
| open-mistral-nemo-2407 | 2024-07-18 | 4.90 | 0.30 | GPQA Diamond | Mistral | FALSE | Mistral NeMo | 2024-07-18 | Mistral AI | |
| Llama-3.1-405B-Instruct | 2024-07-23 | 67.52 | 0.51 | GPQA Diamond | Meta | FALSE | Llama 3.1-405B | 2024-07-23 | Meta AI | |
| Llama-3.1-70B-Instruct | 2024-07-23 | 35.75 | 0.44 | GPQA Diamond | Meta | FALSE | Llama 3.1-70B | 2024-07-23 | ||
| Llama-3.1-8B-Instruct | 2024-07-23 | 12.71 | 0.26 | GPQA Diamond | Meta | FALSE | Llama 3.1-8B | 2024-07-23 | ||
| mistral-large-2407 | 2024-07-24 | 14.08 | 0.49 | GPQA Diamond | Mistral | FALSE | Mistral Large 2 | 2024-07-24 | Mistral AI | |
| gpt-4o-2024-08-06 | 2024-08-06 | 12.69 | 0.49 | GPQA Diamond | OpenAI | FALSE | GPT-4o | 2024-08-06 | GPT-4o (Aug 2024) | OpenAI |
| o1-preview-2024-09-12 | 2024-09-12 | 33.47 | 0.50 | GPQA Diamond | OpenAI | FALSE | o1-preview | 2024-09-12 | o1-preview | OpenAI |
| o1-mini-2024-09-12_high | 2024-09-12 | 15.61 | 0.62 | GPQA Diamond | OpenAI | FALSE | o1-mini | 2024-09-12 | o1-mini (high) | OpenAI |
| o1-mini-2024-09-12_medium | 2024-09-12 | 12.11 | 0.60 | GPQA Diamond | OpenAI | FALSE | o1-mini | 2024-09-12 | o1-mini (medium) | OpenAI |
| qwen2.5-32b-instruct | 2024-09-17 | 20.77 | 0.46 | GPQA Diamond | Alibaba | FALSE | Qwen2.5-32B | 2024-09-17 | Alibaba | |
| qwen2.5-72b-instruct | 2024-09-19 | 43.84 | 0.49 | GPQA Diamond | Alibaba | FALSE | Qwen2.5-72B | 2024-09-19 | Alibaba | |
| Llama-3.2-90B-Vision-Instruct | 2024-09-24 | 38.23 | 0.41 | GPQA Diamond | Meta | FALSE | Llama 3.2 90B | 2024-09-24 | Meta AI | |
| gemini-1.5-pro-002 | 2024-09-24 | 9.06 | 0.57 | GPQA Diamond | FALSE | Gemini 1.5 Pro | 2024-09-24 | Google DeepMind | ||
| gemini-1.5-flash-002 | 2024-09-24 | 3.18 | 0.47 | GPQA Diamond | TRUE | Gemini 1.5 Flash | 2024-09-24 | Google DeepMind | ||
| gemini-1.5-flash-8b-001 | 2024-10-03 | 3.79 | 0.33 | GPQA Diamond | FALSE | Gemini 1.5 Flash 8B | 2024-10-03 | Google DeepMind | ||
| ministral-8b-2410 | 2024-10-16 | 5.22 | 0.27 | GPQA Diamond | Mistral | FALSE | Ministral 8B | 2024-10-16 | Mistral AI | |
| ministral-3b-2410 | 2024-10-16 | 3.40 | 0.25 | GPQA Diamond | Mistral | FALSE | Ministral 3B | 2024-10-16 | Mistral AI | |
| claude-3-5-sonnet-20241022 | 2024-10-22 | 9.34 | 0.55 | GPQA Diamond | Anthropic | FALSE | Claude 3.5 Sonnet | 2024-10-22 | Claude 3.5 Sonnet (Oct 2024) | Anthropic |
| claude-3-5-haiku-20241022 | 2024-10-22 | 5.89 | 0.38 | GPQA Diamond | Anthropic | FALSE | Claude 3.5 Haiku | 2024-10-22 | Claude 3.5 Haiku (Oct 2024) | Anthropic |
| qwen-turbo-2024-11-01 | 2024-11-01 | 6.73 | 0.42 | GPQA Diamond | Alibaba | FALSE | Qwen Turbo | 2024-11-01 | Alibaba | |
| mistral-large-2411 | 2024-11-18 | 12.59 | 0.51 | GPQA Diamond | Mistral | FALSE | Mistral Large 2 | 2024-11-18 | Mistral AI | |
| gpt-4o-2024-11-20 | 2024-11-20 | 18.44 | 0.48 | GPQA Diamond | OpenAI | FALSE | GPT-4o | 2024-11-20 | GPT-4o (Nov 2024) | OpenAI |
| Llama-3.1-Tulu-3-70B-DPO | 2024-11-21 | 38.31 | 0.46 | GPQA Diamond | Other | FALSE | Tulu 3 (Tülu 3) 70B | 2024-11-21 | Allen Institute for AI,University of Washington | |
| Llama-3.3-70B-Instruct | 2024-12-06 | 20.36 | 0.47 | GPQA Diamond | Meta | FALSE | Llama 3.3 70B | 2024-12-06 | Meta AI | |
| grok-2-1212 | 2024-12-12 | 17.19 | 0.54 | GPQA Diamond | xAI | FALSE | Grok-2 | 2024-12-12 | xAI | |
| phi-4 | 2024-12-12 | 15.38 | 0.56 | GPQA Diamond | Other | FALSE | Phi-4 | 2024-12-12 | Microsoft Research | |
| o1-2024-12-17_high | 2024-12-17 | 69.64 | 0.77 | GPQA Diamond | OpenAI | FALSE | o1 | 2024-12-17 | o1 (high) | OpenAI |
| o1-2024-12-17_medium | 2024-12-17 | 52.89 | 0.76 | GPQA Diamond | OpenAI | FALSE | o1 | 2024-12-17 | o1 (medium) | OpenAI |
| DeepSeek-V3 | 2024-12-26 | 59.23 | 0.57 | GPQA Diamond | DeepSeek | FALSE | DeepSeek-V3 | 2024-12-26 | DeepSeek | |
| Eurus-2-7B-PRIME | 2024-12-31 | 19.36 | 0.34 | GPQA Diamond | Other | FALSE | Eurus-2-7B-PRIME | 2024-12-31 | Tsinghua University,University of Illinois Urbana-Champaign (UIUC),Shanghai AI Lab,Peking University,Shanghai Jiao Tong University,CUHK Shenzhen Research Institute | |
| DeepSeek-R1 | 2025-01-20 | 279.14 | 0.72 | GPQA Diamond | DeepSeek | FALSE | DeepSeek-R1 | 2025-01-20 | DeepSeek | |
| DeepSeek-R1-Distill-Qwen-14B | 2025-01-20 | 164.33 | 0.45 | GPQA Diamond | DeepSeek | FALSE | 2025-01-20 | |||
| DeepSeek-R1-Distill-Llama-70B | 2025-01-20 | 146.01 | 0.56 | GPQA Diamond | DeepSeek | FALSE | DeepSeek-R1-Distill-Llama-70B | 2025-01-20 | DeepSeek | |
| gemini-2.0-flash-thinking-exp-01-21 | 2025-01-21 | 25.04 | 0.57 | GPQA Diamond | FALSE | Gemini 2.0 Flash Thinking | 2025-01-21 | Gemini 2.0 Flash Thinking Exp | Google DeepMind,Google | |
| qwen-max-2025-01-25 | 2025-01-25 | 18.01 | 0.56 | GPQA Diamond | Alibaba | FALSE | Qwen2.5-Max | 2025-01-25 | Alibaba | |
| qwen-plus-2025-01-25 | 2025-01-25 | 9.11 | 0.48 | GPQA Diamond | Alibaba | FALSE | Qwen Plus | 2025-01-25 | Alibaba | |
| mistral-small-2501 | 2025-01-25 | 3.91 | 0.45 | GPQA Diamond | Mistral | FALSE | Mistral Small 3 | 2025-01-25 | Mistral AI | |
| o3-mini-2025-01-31_high | 2025-01-31 | 64.15 | 0.77 | GPQA Diamond | OpenAI | FALSE | o3-mini | 2025-01-31 | o3-mini (high) | OpenAI |
| o3-mini-2025-01-31_medium | 2025-01-31 | 18.51 | 0.74 | GPQA Diamond | OpenAI | TRUE | o3-mini | 2025-01-31 | o3-mini (medium) | OpenAI |
| gemini-2.0-pro-exp-02-05 | 2025-02-05 | 7.57 | 0.66 | GPQA Diamond | TRUE | Gemini 2.0 Pro | 2025-02-05 | Gemini 2.0 Pro Exp (Feb 2025) | Google DeepMind,Google | |
| gemini-2.0-flash-001 | 2025-02-05 | 6.13 | 0.64 | GPQA Diamond | TRUE | Gemini 2.0 Flash | 2025-02-05 | Gemini 2.0 Flash (Feb 2025) | Google DeepMind,Google | |
| claude-3-7-sonnet-20250219_64K | 2025-02-24 | 163.73 | 0.77 | GPQA Diamond | Anthropic | FALSE | Claude 3.7 Sonnet | 2025-02-24 | Claude 3.7 Sonnet (64k thinking) | Anthropic |
| claude-3-7-sonnet-20250219_32K | 2025-02-24 | 153.47 | 0.77 | GPQA Diamond | Anthropic | FALSE | Claude 3.7 Sonnet | 2025-02-24 | Claude 3.7 Sonnet (32k thinking) | Anthropic |
| claude-3-7-sonnet-20250219_16K | 2025-02-24 | 112.63 | 0.77 | GPQA Diamond | Anthropic | FALSE | Claude 3.7 Sonnet | 2025-02-24 | Claude 3.7 Sonnet (16k thinking) | Anthropic |
| claude-3-7-sonnet-20250219 | 2025-02-24 | 13.04 | 0.66 | GPQA Diamond | Anthropic | FALSE | Claude 3.7 Sonnet | 2025-02-24 | Anthropic | |
| gpt-4.5-preview-2025-02-27 | 2025-02-27 | 54.39 | 0.69 | GPQA Diamond | OpenAI | FALSE | GPT-4.5 | 2025-02-27 | GPT-4.5 Preview (Feb 2025) | OpenAI |
| gemma-3-27b-it | 2025-03-12 | 15.43 | 0.49 | GPQA Diamond | FALSE | Gemma 3 27B | 2025-03-12 | Google DeepMind | ||
| mistral-small-2503 | 2025-03-17 | 6.02 | 0.48 | GPQA Diamond | Mistral | FALSE | Mistral Small 3.1 | 2025-03-17 | Mistral AI | |
| DeepSeek-V3-0324 | 2025-03-24 | 39.95 | 0.68 | GPQA Diamond | DeepSeek | FALSE | DeepSeek-V3 | 2025-03-24 | DeepSeek-V3 (Mar 2025) | DeepSeek |
| gemini-2.5-pro-exp-03-25 | 2025-03-25 | 61.20 | 0.84 | GPQA Diamond | TRUE | Gemini 2.5 Pro | 2025-03-25 | Gemini 2.5 Pro Exp (Mar 2025) | Google DeepMind | |
| Llama-4-Scout-17B-16E-Instruct | 2025-04-05 | 17.46 | 0.52 | GPQA Diamond | Meta | FALSE | Llama 4 Scout | 2025-04-05 | Meta AI | |
| Llama-4-Maverick-17B-128E-Instruct-FP8 | 2025-04-05 | 11.51 | 0.67 | GPQA Diamond | Meta | TRUE | Llama 4 Maverick | 2025-04-05 | Llama 4 Maverick (FP8) | Meta AI |
| qwq-plus | 2025-04-08 | 219.18 | 0.65 | GPQA Diamond | Alibaba | FALSE | QWQ-Plus | 2025-04-08 | Alibaba | |
| grok-3-mini-beta_high | 2025-04-09 | 56.01 | 0.74 | GPQA Diamond | xAI | FALSE | Grok-3 mini | 2025-04-09 | xAI | |
| grok-3-beta | 2025-04-09 | 29.53 | 0.76 | GPQA Diamond | xAI | FALSE | Grok-3 | 2025-04-09 | xAI | |
| grok-3-mini-beta_low | 2025-04-09 | 23.63 | 0.76 | GPQA Diamond | xAI | TRUE | Grok-3 mini | 2025-04-09 | xAI | |
| gpt-4.1-2025-04-14 | 2025-04-14 | 10.13 | 0.67 | GPQA Diamond | OpenAI | TRUE | GPT-4.1 | 2025-04-14 | GPT-4.1 | OpenAI |
| gpt-4.1-mini-2025-04-14 | 2025-04-14 | 8.74 | 0.66 | GPQA Diamond | OpenAI | TRUE | GPT-4.1 mini | 2025-04-14 | GPT-4.1 mini | OpenAI |
| gpt-4.1-nano-2025-04-14 | 2025-04-14 | 5.58 | 0.49 | GPQA Diamond | OpenAI | TRUE | GPT-4.1 nano | 2025-04-14 | GPT-4.1 nano | OpenAI |
| o4-mini-2025-04-16_high | 2025-04-16 | 93.84 | 0.80 | GPQA Diamond | OpenAI | FALSE | o4-mini | 2025-04-16 | o4-mini (high) | OpenAI |
| o3-2025-04-16_high | 2025-04-16 | 91.54 | 0.82 | GPQA Diamond | OpenAI | FALSE | o3 | 2025-04-16 | o3 (high) | OpenAI |
| mistral-medium-2505 | 2025-05-07 | 17.39 | 0.60 | GPQA Diamond | Mistral | FALSE | Mistral Medium 3 | 2025-05-07 | Mistral AI | |
| gpt-4-0613 | 2023-06-13 | 12.42 | 0.23 | MATH Level 5 | OpenAI | FALSE | GPT-4 | 2023-06-13 | GPT-4 (Jun 2023) | OpenAI |
| claude-2.0 | 2023-07-11 | 10.80 | 0.12 | MATH Level 5 | Anthropic | FALSE | Claude 2 | 2023-07-11 | Anthropic | |
| gpt-3.5-turbo-1106 | 2023-11-06 | 3.00 | 0.16 | MATH Level 5 | OpenAI | FALSE | GPT-3.5 Turbo | 2023-11-06 | GPT-3.5 Turbo (Nov 2023) | OpenAI |
| gpt-4-1106-preview | 2023-11-06 | 21.95 | 0.40 | MATH Level 5 | OpenAI | FALSE | GPT-4 | 2023-11-06 | GPT-4 Preview (Nov 2023) | OpenAI |
| open-mixtral-8x7b | 2023-12-11 | 8.23 | 0.10 | MATH Level 5 | Mistral | FALSE | Mixtral 8x7B | 2023-12-11 | Mistral AI | |
| gpt-4-0125-preview | 2024-01-25 | 28.72 | 0.35 | MATH Level 5 | OpenAI | FALSE | GPT-4 | 2024-01-25 | OpenAI | |
| gpt-3.5-turbo-0125 | 2024-01-25 | 2.81 | 0.12 | MATH Level 5 | OpenAI | FALSE | GPT-3.5 Turbo | 2024-01-25 | OpenAI | |
| gemini-1.0-pro-001 | 2024-02-15 | 4.55 | 0.11 | MATH Level 5 | FALSE | Gemini 1.0 Pro | 2024-02-15 | Google DeepMind | ||
| mistral-large-2402 | 2024-02-26 | 15.55 | 0.25 | MATH Level 5 | Mistral | FALSE | Mistral Large | 2024-02-26 | Mistral AI | |
| claude-3-sonnet-20240229 | 2024-02-29 | 13.19 | 0.18 | MATH Level 5 | Anthropic | FALSE | Claude 3 Sonnet | 2024-02-29 | Anthropic | |
| claude-3-opus-20240229 | 2024-02-29 | 24.70 | 0.38 | MATH Level 5 | Anthropic | FALSE | Claude 3 Opus | 2024-02-29 | Anthropic | |
| claude-3-haiku-20240307 | 2024-03-07 | 10.89 | 0.15 | MATH Level 5 | Anthropic | FALSE | Claude 3 Haiku | 2024-03-07 | ||
| dbrx-instruct | 2024-03-27 | 143.23 | 0.12 | MATH Level 5 | Other | FALSE | DBRX | 2024-03-27 | Databricks | |
| gpt-4-turbo-2024-04-09 | 2024-04-09 | 29.79 | 0.47 | MATH Level 5 | OpenAI | FALSE | GPT-4 Turbo | 2024-04-09 | OpenAI | |
| WizardLM-2-8x22B | 2024-04-15 | 24.81 | 0.26 | MATH Level 5 | Other | FALSE | WizardLM-2 8x22B | 2024-04-15 | Microsoft | |
| open-mixtral-8x22b | 2024-04-17 | 11.27 | 0.24 | MATH Level 5 | Mistral | FALSE | Mixtral 8x22B | 2024-04-17 | Mistral AI | |
| Meta-Llama-3-70B-Instruct | 2024-04-18 | 22.82 | 0.23 | MATH Level 5 | Meta | FALSE | Llama 3-70B | 2024-04-18 | Meta AI | |
| Yi-1.5-34B-Chat | 2024-05-13 | 37.17 | 0.26 | MATH Level 5 | Other | FALSE | Yi-1.5-34B | 2024-05-13 | 01.AI | |
| gpt-4o-2024-05-13 | 2024-05-13 | 9.48 | 0.51 | MATH Level 5 | OpenAI | FALSE | GPT-4o | 2024-05-13 | GPT-4o (May 2024) | OpenAI |
| gemini-1.5-flash-001 | 2024-05-23 | 2.07 | 0.25 | MATH Level 5 | TRUE | Gemini 1.5 Flash | 2024-05-23 | Gemini 1.5 Flash (May 2024) | Google DeepMind | |
| gemini-1.5-pro-001 | 2024-05-24 | 8.75 | 0.41 | MATH Level 5 | FALSE | Gemini 1.5 Pro | 2024-05-24 | Google DeepMind | ||
| qwen2-72b-instruct | 2024-06-07 | 34.21 | 0.39 | MATH Level 5 | Alibaba | FALSE | Qwen2-72B | 2024-06-07 | Alibaba | |
| Hermes-2-Theta-Llama-3-70B | 2024-06-20 | 20.51 | 0.23 | MATH Level 5 | Other | FALSE | Hermes 2 Theta Llama-3 70B | 2024-06-20 | Nous Research,Arcee AI | |
| claude-3-5-sonnet-20240620 | 2024-06-20 | 12.94 | 0.52 | MATH Level 5 | Anthropic | FALSE | Claude 3.5 Sonnet | 2024-06-20 | Claude 3.5 Sonnet (Jun 2024) | Anthropic |
| gemma-2-9b-it | 2024-06-24 | 12.45 | 0.21 | MATH Level 5 | FALSE | Gemma 2 9B | 2024-06-24 | Google DeepMind | ||
| gemma-2-27b-it | 2024-06-24 | 17.05 | 0.28 | MATH Level 5 | FALSE | Gemma 2 27B | 2024-06-24 | Google DeepMind | ||
| open-mistral-nemo-2407 | 2024-07-18 | 5.34 | 0.11 | MATH Level 5 | Mistral | FALSE | Mistral NeMo | 2024-07-18 | Mistral AI | |
| gpt-4o-mini-2024-07-18 | 2024-07-18 | 14.64 | 0.53 | MATH Level 5 | OpenAI | FALSE | GPT-4o mini | 2024-07-18 | OpenAI | |
| Llama-3.1-405B-Instruct | 2024-07-23 | 23.42 | 0.50 | MATH Level 5 | Meta | FALSE | Llama 3.1-405B | 2024-07-23 | Meta AI | |
| Llama-3.1-70B-Instruct | 2024-07-23 | 194.69 | 0.37 | MATH Level 5 | Meta | FALSE | Llama 3.1-70B | 2024-07-23 | ||
| Llama-3.1-8B-Instruct | 2024-07-23 | 16.47 | 0.23 | MATH Level 5 | Meta | FALSE | Llama 3.1-8B | 2024-07-23 | ||
| mistral-large-2407 | 2024-07-24 | 17.75 | 0.45 | MATH Level 5 | Mistral | FALSE | Mistral Large 2 | 2024-07-24 | Mistral AI | |
| gpt-4o-2024-08-06 | 2024-08-06 | 15.65 | 0.53 | MATH Level 5 | OpenAI | FALSE | GPT-4o | 2024-08-06 | GPT-4o (Aug 2024) | OpenAI |
| o1-mini-2024-09-12_high | 2024-09-12 | 15.18 | 0.89 | MATH Level 5 | OpenAI | FALSE | o1-mini | 2024-09-12 | o1-mini (high) | OpenAI |
| o1-mini-2024-09-12_medium | 2024-09-12 | 10.76 | 0.84 | MATH Level 5 | OpenAI | TRUE | o1-mini | 2024-09-12 | o1-mini (medium) | OpenAI |
| o1-preview-2024-09-12 | 2024-09-12 | 42.64 | 0.82 | MATH Level 5 | OpenAI | FALSE | o1-preview | 2024-09-12 | o1-preview | OpenAI |
| qwen2.5-32b-instruct | 2024-09-17 | 24.57 | 0.56 | MATH Level 5 | Alibaba | FALSE | Qwen2.5-32B | 2024-09-17 | Alibaba | |
| qwen2.5-72b-instruct | 2024-09-19 | 40.02 | 0.63 | MATH Level 5 | Alibaba | FALSE | Qwen2.5-72B | 2024-09-19 | Alibaba | |
| gemini-1.5-pro-002 | 2024-09-24 | 11.55 | 0.70 | MATH Level 5 | FALSE | Gemini 1.5 Pro | 2024-09-24 | Google DeepMind | ||
| Llama-3.2-90B-Vision-Instruct | 2024-09-24 | 34.07 | 0.39 | MATH Level 5 | Meta | FALSE | Llama 3.2 90B | 2024-09-24 | Meta AI | |
| gemini-1.5-flash-002 | 2024-09-24 | 4.27 | 0.62 | MATH Level 5 | TRUE | Gemini 1.5 Flash | 2024-09-24 | Google DeepMind | ||
| ministral-8b-2410 | 2024-10-16 | 5.02 | 0.15 | MATH Level 5 | Mistral | FALSE | Ministral 8B | 2024-10-16 | Mistral AI | |
| ministral-3b-2410 | 2024-10-16 | 4.13 | 0.14 | MATH Level 5 | Mistral | FALSE | Ministral 3B | 2024-10-16 | Mistral AI | |
| claude-3-5-haiku-20241022 | 2024-10-22 | 6.90 | 0.46 | MATH Level 5 | Anthropic | FALSE | Claude 3.5 Haiku | 2024-10-22 | Claude 3.5 Haiku (Oct 2024) | Anthropic |
| claude-3-5-sonnet-20241022 | 2024-10-22 | 14.22 | 0.57 | MATH Level 5 | Anthropic | FALSE | Claude 3.5 Sonnet | 2024-10-22 | Claude 3.5 Sonnet (Oct 2024) | Anthropic |
| qwen-turbo-2024-11-01 | 2024-11-01 | 7.30 | 0.56 | MATH Level 5 | Alibaba | FALSE | Qwen Turbo | 2024-11-01 | Alibaba | |
| mistral-large-2411 | 2024-11-18 | 14.18 | 0.50 | MATH Level 5 | Mistral | FALSE | Mistral Large 2 | 2024-11-18 | Mistral AI | |
| gpt-4o-2024-11-20 | 2024-11-20 | 19.00 | 0.50 | MATH Level 5 | OpenAI | FALSE | GPT-4o | 2024-11-20 | GPT-4o (Nov 2024) | OpenAI |
| Llama-3.1-Tulu-3-70B-DPO | 2024-11-21 | 25.41 | 0.43 | MATH Level 5 | Other | FALSE | Tulu 3 (Tülu 3) 70B | 2024-11-21 | Allen Institute for AI,University of Washington | |
| Llama-3.3-70B-Instruct | 2024-12-06 | 24.58 | 0.42 | MATH Level 5 | Meta | FALSE | Llama 3.3 70B | 2024-12-06 | Meta AI | |
| phi-4 | 2024-12-12 | 21.98 | 0.65 | MATH Level 5 | Other | FALSE | Phi-4 | 2024-12-12 | Microsoft Research | |
| grok-2-1212 | 2024-12-12 | 47.80 | 0.64 | MATH Level 5 | xAI | FALSE | Grok-2 | 2024-12-12 | xAI | |
| o1-2024-12-17_medium | 2024-12-17 | 39.05 | 0.94 | MATH Level 5 | OpenAI | FALSE | o1 | 2024-12-17 | o1 (medium) | OpenAI |
| o1-2024-12-17_high | 2024-12-17 | 47.93 | 0.95 | MATH Level 5 | OpenAI | FALSE | o1 | 2024-12-17 | o1 (high) | OpenAI |
| DeepSeek-V3 | 2024-12-26 | 104.88 | 0.65 | MATH Level 5 | DeepSeek | FALSE | DeepSeek-V3 | 2024-12-26 | DeepSeek | |
| DeepSeek-R1-Distill-Qwen-14B | 2025-01-20 | 55.65 | 0.87 | MATH Level 5 | DeepSeek | FALSE | 2025-01-20 | |||
| DeepSeek-R1 | 2025-01-20 | 132.60 | 0.93 | MATH Level 5 | DeepSeek | FALSE | DeepSeek-R1 | 2025-01-20 | DeepSeek | |
| DeepSeek-R1-Distill-Llama-70B | 2025-01-20 | 68.77 | 0.90 | MATH Level 5 | DeepSeek | FALSE | DeepSeek-R1-Distill-Llama-70B | 2025-01-20 | DeepSeek | |
| qwen-plus-2025-01-25 | 2025-01-25 | 24.14 | 0.65 | MATH Level 5 | Alibaba | FALSE | Qwen Plus | 2025-01-25 | Alibaba | |
| qwen-max-2025-01-25 | 2025-01-25 | 29.36 | 0.67 | MATH Level 5 | Alibaba | FALSE | Qwen2.5-Max | 2025-01-25 | Alibaba | |
| mistral-small-2501 | 2025-01-25 | 4.65 | 0.45 | MATH Level 5 | Mistral | FALSE | Mistral Small 3 | 2025-01-25 | Mistral AI | |
| o3-mini-2025-01-31_high | 2025-01-31 | 25.00 | 0.97 | MATH Level 5 | OpenAI | TRUE | o3-mini | 2025-01-31 | o3-mini (high) | OpenAI |
| o3-mini-2025-01-31_medium | 2025-01-31 | 11.11 | 0.95 | MATH Level 5 | OpenAI | TRUE | o3-mini | 2025-01-31 | o3-mini (medium) | OpenAI |
| gemini-2.0-flash-001 | 2025-02-05 | 6.53 | 0.82 | MATH Level 5 | TRUE | Gemini 2.0 Flash | 2025-02-05 | Gemini 2.0 Flash (Feb 2025) | Google DeepMind,Google | |
| gemini-2.0-pro-exp-02-05 | 2025-02-05 | 9.00 | 0.84 | MATH Level 5 | TRUE | Gemini 2.0 Pro | 2025-02-05 | Gemini 2.0 Pro Exp (Feb 2025) | Google DeepMind,Google | |
| claude-3-7-sonnet-20250219_32K | 2025-02-24 | 140.26 | 0.90 | MATH Level 5 | Anthropic | FALSE | Claude 3.7 Sonnet | 2025-02-24 | Claude 3.7 Sonnet (32k thinking) | Anthropic |
| claude-3-7-sonnet-20250219_64K | 2025-02-24 | 152.58 | 0.91 | MATH Level 5 | Anthropic | FALSE | Claude 3.7 Sonnet | 2025-02-24 | Claude 3.7 Sonnet (64k thinking) | Anthropic |
| claude-3-7-sonnet-20250219 | 2025-02-24 | 15.83 | 0.68 | MATH Level 5 | Anthropic | FALSE | Claude 3.7 Sonnet | 2025-02-24 | Anthropic | |
| claude-3-7-sonnet-20250219_16K | 2025-02-24 | 109.73 | 0.86 | MATH Level 5 | Anthropic | FALSE | Claude 3.7 Sonnet | 2025-02-24 | Claude 3.7 Sonnet (16k thinking) | Anthropic |
| gpt-4.5-preview-2025-02-27 | 2025-02-27 | 74.19 | 0.79 | MATH Level 5 | OpenAI | FALSE | GPT-4.5 | 2025-02-27 | GPT-4.5 Preview (Feb 2025) | OpenAI |
| gemma-3-27b-it | 2025-03-12 | 23.46 | 0.74 | MATH Level 5 | FALSE | Gemma 3 27B | 2025-03-12 | Google DeepMind | ||
| mistral-small-2503 | 2025-03-17 | 7.16 | 0.47 | MATH Level 5 | Mistral | FALSE | Mistral Small 3.1 | 2025-03-17 | Mistral AI | |
| DeepSeek-V3-0324 | 2025-03-24 | 46.81 | 0.76 | MATH Level 5 | DeepSeek | FALSE | DeepSeek-V3 | 2025-03-24 | DeepSeek-V3 (Mar 2025) | DeepSeek |
| Llama-4-Scout-17B-16E-Instruct | 2025-04-05 | 24.90 | 0.62 | MATH Level 5 | Meta | FALSE | Llama 4 Scout | 2025-04-05 | Meta AI | |
| Llama-4-Maverick-17B-128E-Instruct-FP8 | 2025-04-05 | 11.39 | 0.73 | MATH Level 5 | Meta | FALSE | Llama 4 Maverick | 2025-04-05 | Llama 4 Maverick (FP8) | Meta AI |
| grok-3-beta | 2025-04-09 | 26.87 | 0.89 | MATH Level 5 | xAI | FALSE | Grok-3 | 2025-04-09 | xAI | |
| grok-3-mini-beta_low | 2025-04-09 | 20.47 | 0.91 | MATH Level 5 | xAI | FALSE | Grok-3 mini | 2025-04-09 | xAI | |
| grok-3-mini-beta_high | 2025-04-09 | 40.23 | 0.88 | MATH Level 5 | xAI | FALSE | Grok-3 mini | 2025-04-09 | xAI | |
| gpt-4.1-2025-04-14 | 2025-04-14 | 14.67 | 0.83 | MATH Level 5 | OpenAI | FALSE | GPT-4.1 | 2025-04-14 | GPT-4.1 | OpenAI |
| gpt-4.1-mini-2025-04-14 | 2025-04-14 | 13.41 | 0.87 | MATH Level 5 | OpenAI | FALSE | GPT-4.1 mini | 2025-04-14 | GPT-4.1 mini | OpenAI |
| gpt-4.1-nano-2025-04-14 | 2025-04-14 | 9.15 | 0.70 | MATH Level 5 | OpenAI | FALSE | GPT-4.1 nano | 2025-04-14 | GPT-4.1 nano | OpenAI |
| o4-mini-2025-04-16_high | 2025-04-16 | 37.48 | 0.98 | MATH Level 5 | OpenAI | FALSE | o4-mini | 2025-04-16 | o4-mini (high) | OpenAI |
| o3-2025-04-16_high | 2025-04-16 | 34.08 | 0.98 | MATH Level 5 | OpenAI | TRUE | o3 | 2025-04-16 | o3 (high) | OpenAI |
| gemini-2.5-pro-preview-05-06 | 2025-05-06 | 87.22 | 0.96 | MATH Level 5 | FALSE | Gemini 2.5 Pro | 2025-05-06 | Google DeepMind | ||
| mistral-medium-2505 | 2025-05-07 | 30.19 | 0.82 | MATH Level 5 | Mistral | FALSE | Mistral Medium 3 | 2025-05-07 | Mistral AI | |
| o4-mini-2025-04-16_high | 2025-04-16 | 144.47 | 0.82 | OTIS Mock AIME 2024-2025 | OpenAI | TRUE | o4-mini | 2025-04-16 | o4-mini (high) | OpenAI |
| qwen-max-2025-01-25 | 2025-01-25 | 39.62 | 0.16 | OTIS Mock AIME 2024-2025 | Alibaba | FALSE | Qwen2.5-Max | 2025-01-25 | Alibaba | |
| qwen-plus-2025-01-25 | 2025-01-25 | 32.60 | 0.18 | OTIS Mock AIME 2024-2025 | Alibaba | FALSE | Qwen Plus | 2025-01-25 | Alibaba | |
| grok-3-mini-beta_low | 2025-04-09 | 52.00 | 0.62 | OTIS Mock AIME 2024-2025 | xAI | TRUE | Grok-3 mini | 2025-04-09 | xAI | |
| mistral-medium-2505 | 2025-05-07 | 92.04 | 0.32 | OTIS Mock AIME 2024-2025 | Mistral | FALSE | Mistral Medium 3 | 2025-05-07 | Mistral AI | |
| DeepSeek-V3-0324 | 2025-03-24 | 94.29 | 0.38 | OTIS Mock AIME 2024-2025 | DeepSeek | FALSE | DeepSeek-V3 | 2025-03-24 | DeepSeek-V3 (Mar 2025) | DeepSeek |
| gpt-4.1-nano-2025-04-14 | 2025-04-14 | 19.49 | 0.29 | OTIS Mock AIME 2024-2025 | OpenAI | TRUE | GPT-4.1 nano | 2025-04-14 | GPT-4.1 nano | OpenAI |
| o1-mini-2024-09-12_medium | 2024-09-12 | 72.33 | 0.45 | OTIS Mock AIME 2024-2025 | OpenAI | FALSE | o1-mini | 2024-09-12 | o1-mini (medium) | OpenAI |
| gpt-4.5-preview-2025-02-27 | 2025-02-27 | 95.96 | 0.38 | OTIS Mock AIME 2024-2025 | OpenAI | FALSE | GPT-4.5 | 2025-02-27 | GPT-4.5 Preview (Feb 2025) | OpenAI |
| gemini-2.0-flash-001 | 2025-02-05 | 106.82 | 0.31 | OTIS Mock AIME 2024-2025 | FALSE | Gemini 2.0 Flash | 2025-02-05 | Gemini 2.0 Flash (Feb 2025) | Google DeepMind,Google | |
| DeepSeek-V3 | 2024-12-26 | 89.87 | 0.16 | OTIS Mock AIME 2024-2025 | DeepSeek | FALSE | DeepSeek-V3 | 2024-12-26 | DeepSeek | |
| claude-3-7-sonnet-20250219_32K | 2025-02-24 | 277.13 | 0.53 | OTIS Mock AIME 2024-2025 | Anthropic | FALSE | Claude 3.7 Sonnet | 2025-02-24 | Claude 3.7 Sonnet (32k thinking) | Anthropic |
| grok-2-1212 | 2024-12-12 | 115.44 | 0.12 | OTIS Mock AIME 2024-2025 | xAI | FALSE | Grok-2 | 2024-12-12 | xAI | |
| o3-mini-2025-01-31_medium | 2025-01-31 | 78.20 | 0.64 | OTIS Mock AIME 2024-2025 | OpenAI | TRUE | o3-mini | 2025-01-31 | o3-mini (medium) | OpenAI |
| o3-mini-2025-01-31_high | 2025-01-31 | 123.91 | 0.77 | OTIS Mock AIME 2024-2025 | OpenAI | TRUE | o3-mini | 2025-01-31 | o3-mini (high) | OpenAI |
| o1-2024-12-17_medium | 2024-12-17 | 118.64 | 0.73 | OTIS Mock AIME 2024-2025 | OpenAI | TRUE | o1 | 2024-12-17 | o1 (medium) | OpenAI |
| o1-preview-2024-09-12 | 2024-09-12 | 79.20 | 0.31 | OTIS Mock AIME 2024-2025 | OpenAI | FALSE | o1-preview | 2024-09-12 | o1-preview | OpenAI |
| gemini-1.5-pro-002 | 2024-09-24 | 125.53 | 0.23 | OTIS Mock AIME 2024-2025 | FALSE | Gemini 1.5 Pro | 2024-09-24 | Google DeepMind | ||
| phi-4 | 2024-12-12 | 33.02 | 0.14 | OTIS Mock AIME 2024-2025 | Other | FALSE | Phi-4 | 2024-12-12 | Microsoft Research | |
| o1-mini-2024-09-12_high | 2024-09-12 | 68.44 | 0.47 | OTIS Mock AIME 2024-2025 | OpenAI | FALSE | o1-mini | 2024-09-12 | o1-mini (high) | OpenAI |
| gemini-2.5-flash-preview-04-17 | 2025-04-17 | 127.29 | 0.73 | OTIS Mock AIME 2024-2025 | FALSE | Gemini 2.5 Flash | 2025-04-17 | Gemini 2.5 Flash Preview (Apr 2025) | Google DeepMind | |
| grok-3-mini-beta_high | 2025-04-09 | 137.31 | 0.78 | OTIS Mock AIME 2024-2025 | xAI | TRUE | Grok-3 mini | 2025-04-09 | xAI | |
| gpt-4.1-2025-04-14 | 2025-04-14 | 44.22 | 0.38 | OTIS Mock AIME 2024-2025 | OpenAI | FALSE | GPT-4.1 | 2025-04-14 | GPT-4.1 | OpenAI |
| claude-3-7-sonnet-20250219_64K | 2025-02-24 | 313.11 | 0.58 | OTIS Mock AIME 2024-2025 | Anthropic | FALSE | Claude 3.7 Sonnet | 2025-02-24 | Claude 3.7 Sonnet (64k thinking) | Anthropic |
| grok-3-beta | 2025-04-09 | 55.58 | 0.56 | OTIS Mock AIME 2024-2025 | xAI | FALSE | Grok-3 | 2025-04-09 | xAI | |
| gemini-2.0-flash-thinking-exp-01-21 | 2025-01-21 | 58.73 | 0.58 | OTIS Mock AIME 2024-2025 | FALSE | Gemini 2.0 Flash Thinking | 2025-01-21 | Gemini 2.0 Flash Thinking Exp | Google DeepMind,Google | |
| claude-3-7-sonnet-20250219_16K | 2025-02-24 | 185.67 | 0.47 | OTIS Mock AIME 2024-2025 | Anthropic | FALSE | Claude 3.7 Sonnet | 2025-02-24 | Claude 3.7 Sonnet (16k thinking) | Anthropic |
| claude-3-7-sonnet-20250219 | 2025-02-24 | 38.04 | 0.22 | OTIS Mock AIME 2024-2025 | Anthropic | FALSE | Claude 3.7 Sonnet | 2025-02-24 | Anthropic | |
| o3-2025-04-16_high | 2025-04-16 | 147.84 | 0.84 | OTIS Mock AIME 2024-2025 | OpenAI | TRUE | o3 | 2025-04-16 | o3 (high) | OpenAI |
| Llama-4-Maverick-17B-128E-Instruct-FP8 | 2025-04-05 | 16.22 | 0.21 | OTIS Mock AIME 2024-2025 | Meta | TRUE | Llama 4 Maverick | 2025-04-05 | Llama 4 Maverick (FP8) | Meta AI |
| DeepSeek-R1-Distill-Llama-70B | 2025-01-20 | 245.16 | 0.51 | OTIS Mock AIME 2024-2025 | DeepSeek | FALSE | DeepSeek-R1-Distill-Llama-70B | 2025-01-20 | DeepSeek | |
| gemma-3-27b-it | 2025-03-12 | 54.73 | 0.20 | OTIS Mock AIME 2024-2025 | FALSE | Gemma 3 27B | 2025-03-12 | Google DeepMind | ||
| gpt-4.1-mini-2025-04-14 | 2025-04-14 | 38.64 | 0.45 | OTIS Mock AIME 2024-2025 | OpenAI | TRUE | GPT-4.1 mini | 2025-04-14 | GPT-4.1 mini | OpenAI |
| gemini-1.5-flash-002 | 2024-09-24 | 56.82 | 0.16 | OTIS Mock AIME 2024-2025 | FALSE | Gemini 1.5 Flash | 2024-09-24 | Google DeepMind | ||
| DeepSeek-R1 | 2025-01-20 | 225.96 | 0.53 | OTIS Mock AIME 2024-2025 | DeepSeek | FALSE | DeepSeek-R1 | 2025-01-20 | DeepSeek | |
| claude-opus-4-20250514 | 2025-05-22 | 24.88 | 0.85 | MATH Level 5 | Anthropic | FALSE | Claude Opus 4 | 2025-05-22 | Anthropic | |
| claude-sonnet-4-20250514 | 2025-05-22 | 22.84 | 0.29 | OTIS Mock AIME 2024-2025 | Anthropic | FALSE | Claude Sonnet 4 | 2025-05-22 | Anthropic | |
| qwen3-235b-a22b | 2025-04-29 | 186.21 | 0.71 | GPQA Diamond | Alibaba | FALSE | Qwen3-235B-A22B | 2025-04-29 | Alibaba | |
| claude-sonnet-4-20250514_16K | 2025-05-22 | 165.18 | 0.53 | OTIS Mock AIME 2024-2025 | Anthropic | FALSE | Claude Sonnet 4 | 2025-05-22 | Anthropic | |
| claude-sonnet-4-20250514 | 2025-05-22 | 12.40 | 0.67 | GPQA Diamond | Anthropic | FALSE | Claude Sonnet 4 | 2025-05-22 | Anthropic | |
| claude-sonnet-4-20250514 | 2025-05-22 | 13.13 | 0.84 | MATH Level 5 | Anthropic | FALSE | Claude Sonnet 4 | 2025-05-22 | Anthropic | |
| claude-sonnet-4-20250514_32K | 2025-05-22 | 235.56 | 0.71 | OTIS Mock AIME 2024-2025 | Anthropic | FALSE | Claude Sonnet 4 | 2025-05-22 | Anthropic | |
| claude-opus-4-20250514_27K | 2025-05-22 | 337.82 | 0.64 | OTIS Mock AIME 2024-2025 | Anthropic | FALSE | Claude Opus 4 | 2025-05-22 | Anthropic | |
| DeepSeek-R1-0528 | 2025-05-28 | 367.73 | 0.66 | OTIS Mock AIME 2024-2025 | DeepSeek | FALSE | DeepSeek-R1 | 2025-05-28 | DeepSeek | |
| claude-sonnet-4-20250514_59K | 2025-05-22 | 134.78 | 0.79 | GPQA Diamond | Anthropic | FALSE | Claude Sonnet 4 | 2025-05-22 | Anthropic | |
| claude-opus-4-20250514 | 2025-05-22 | 21.68 | 0.69 | GPQA Diamond | Anthropic | FALSE | Claude Opus 4 | 2025-05-22 | Anthropic | |
| DeepSeek-R1-0528 | 2025-05-28 | 152.70 | 0.76 | GPQA Diamond | DeepSeek | FALSE | DeepSeek-R1 | 2025-05-28 | DeepSeek | |
| claude-sonnet-4-20250514_59K | 2025-05-22 | 340.31 | 0.69 | OTIS Mock AIME 2024-2025 | Anthropic | FALSE | Claude Sonnet 4 | 2025-05-22 | Anthropic | |
| DeepSeek-R1-0528 | 2025-05-28 | 163.48 | 0.97 | MATH Level 5 | DeepSeek | FALSE | DeepSeek-R1 | 2025-05-28 | DeepSeek | |
| qwen3-235b-a22b | 2025-04-29 | 147.64 | 0.69 | MATH Level 5 | Alibaba | FALSE | Qwen3-235B-A22B | 2025-04-29 | Alibaba | |
| claude-opus-4-20250514_16K | 2025-05-22 | 48.84 | 0.76 | GPQA Diamond | Anthropic | FALSE | Claude Opus 4 | 2025-05-22 | Anthropic | |
| claude-opus-4-20250514_16K | 2025-05-22 | 222.18 | 0.60 | OTIS Mock AIME 2024-2025 | Anthropic | FALSE | Claude Opus 4 | 2025-05-22 | Anthropic | |
| claude-sonnet-4-20250514_16K | 2025-05-22 | 44.43 | 0.76 | GPQA Diamond | Anthropic | FALSE | Claude Sonnet 4 | 2025-05-22 | Anthropic | |
| claude-opus-4-20250514 | 2025-05-22 | 37.22 | 0.42 | OTIS Mock AIME 2024-2025 | Anthropic | TRUE | Claude Opus 4 | 2025-05-22 | Anthropic | |
| claude-sonnet-4-20250514_32K | 2025-05-22 | 78.37 | 0.78 | GPQA Diamond | Anthropic | FALSE | Claude Sonnet 4 | 2025-05-22 | Anthropic |
| ID | Release date | Runtime | Accuracy | Benchmark | Provider | Pareto optimal | Model | Version release date | Display name | Organization |
|---|---|---|---|---|---|---|---|---|---|---|
| gpt-4-0613 | 2023-06-13 | 8.55 | 0.31 | GPQA Diamond | OpenAI | FALSE | GPT-4 | 2023-06-13 | GPT-4 (Jun 2023) | OpenAI |
| claude-2.0 | 2023-07-11 | 10.47 | 0.35 | GPQA Diamond | Anthropic | FALSE | Claude 2 | 2023-07-11 | Anthropic | |
| Llama-2-70b-chat-hf | 2023-07-18 | 24.13 | 0.26 | GPQA Diamond | Meta | FALSE | Llama 2-70B | 2023-07-18 | Meta AI | |
| gpt-4-1106-preview | 2023-11-06 | 16.43 | 0.42 | GPQA Diamond | OpenAI | FALSE | GPT-4 | 2023-11-06 | GPT-4 Preview (Nov 2023) | OpenAI |
| gpt-3.5-turbo-1106 | 2023-11-06 | 1.14 | 0.28 | GPQA Diamond | OpenAI | TRUE | GPT-3.5 Turbo | 2023-11-06 | GPT-3.5 Turbo (Nov 2023) | OpenAI |
| claude-2.1 | 2023-11-21 | 18.80 | 0.33 | GPQA Diamond | Anthropic | FALSE | Claude 2.1 | 2023-11-21 | Anthropic | |
| Mixtral-8x7B-Instruct-v0.1 | 2023-12-11 | 18.78 | 0.31 | GPQA Diamond | Mistral | FALSE | Mixtral 8x7B | 2023-12-11 | Mistral AI | |
| open-mixtral-8x7b | 2023-12-11 | 6.40 | 0.30 | GPQA Diamond | Mistral | FALSE | Mixtral 8x7B | 2023-12-11 | Mistral AI | |
| gpt-4-0125-preview | 2024-01-25 | 18.78 | 0.42 | GPQA Diamond | OpenAI | FALSE | GPT-4 | 2024-01-25 | OpenAI | |
| gpt-3.5-turbo-0125 | 2024-01-25 | 1.25 | 0.27 | GPQA Diamond | OpenAI | FALSE | GPT-3.5 Turbo | 2024-01-25 | OpenAI | |
| qwen1.5-72b-chat | 2024-02-04 | 24.69 | 0.29 | GPQA Diamond | Alibaba | FALSE | Qwen1.5-72B | 2024-02-04 | Alibaba | |
| gemini-1.0-pro-001 | 2024-02-15 | 3.32 | 0.34 | GPQA Diamond | FALSE | Gemini 1.0 Pro | 2024-02-15 | Google DeepMind | ||
| mistral-large-2402 | 2024-02-26 | 9.66 | 0.39 | GPQA Diamond | Mistral | FALSE | Mistral Large | 2024-02-26 | Mistral AI | |
| claude-3-opus-20240229 | 2024-02-29 | 18.70 | 0.47 | GPQA Diamond | Anthropic | FALSE | Claude 3 Opus | 2024-02-29 | Anthropic | |
| claude-3-sonnet-20240229 | 2024-02-29 | 9.97 | 0.41 | GPQA Diamond | Anthropic | FALSE | Claude 3 Sonnet | 2024-02-29 | Anthropic | |
| claude-3-haiku-20240307 | 2024-03-07 | 2.65 | 0.36 | GPQA Diamond | Anthropic | FALSE | Claude 3 Haiku | 2024-03-07 | ||
| dbrx-instruct | 2024-03-27 | 187.07 | 0.33 | GPQA Diamond | Other | FALSE | DBRX | 2024-03-27 | Databricks | |
| qwen1.5-32b-chat | 2024-04-03 | 29.06 | 0.31 | GPQA Diamond | Alibaba | FALSE | Qwen1.5-32B | 2024-04-03 | Alibaba | |
| gpt-4-turbo-2024-04-09 | 2024-04-09 | 30.84 | 0.47 | GPQA Diamond | OpenAI | FALSE | GPT-4 Turbo | 2024-04-09 | OpenAI | |
| WizardLM-2-8x22B | 2024-04-15 | 32.27 | 0.43 | GPQA Diamond | Other | FALSE | WizardLM-2 8x22B | 2024-04-15 | Microsoft | |
| open-mixtral-8x22b | 2024-04-17 | 9.45 | 0.34 | GPQA Diamond | Mistral | FALSE | Mixtral 8x22B | 2024-04-17 | Mistral AI | |
| Meta-Llama-3-70B-Instruct | 2024-04-18 | 16.13 | 0.41 | GPQA Diamond | Meta | FALSE | Llama 3-70B | 2024-04-18 | Meta AI | |
| Meta-Llama-3-8B-Instruct | 2024-04-18 | 11.28 | 0.26 | GPQA Diamond | Meta | FALSE | Llama 3-8B | 2024-04-18 | ||
| Yi-1.5-34B-Chat | 2024-05-13 | 30.66 | 0.32 | GPQA Diamond | Other | FALSE | Yi-1.5-34B | 2024-05-13 | 01.AI | |
| gpt-4o-2024-05-13 | 2024-05-13 | 10.01 | 0.49 | GPQA Diamond | OpenAI | FALSE | GPT-4o | 2024-05-13 | GPT-4o (May 2024) | OpenAI |
| gemini-1.5-flash-001 | 2024-05-23 | 2.33 | 0.40 | GPQA Diamond | TRUE | Gemini 1.5 Flash | 2024-05-23 | Gemini 1.5 Flash (May 2024) | Google DeepMind | |
| gemini-1.5-pro-001 | 2024-05-24 | 7.41 | 0.46 | GPQA Diamond | FALSE | Gemini 1.5 Pro | 2024-05-24 | Google DeepMind | ||
| qwen2-72b-instruct | 2024-06-07 | 42.08 | 0.41 | GPQA Diamond | Alibaba | FALSE | Qwen2-72B | 2024-06-07 | Alibaba | |
| Hermes-2-Theta-Llama-3-70B | 2024-06-20 | 15.11 | 0.38 | GPQA Diamond | Other | FALSE | Hermes 2 Theta Llama-3 70B | 2024-06-20 | Nous Research,Arcee AI | |
| claude-3-5-sonnet-20240620 | 2024-06-20 | 10.39 | 0.54 | GPQA Diamond | Anthropic | FALSE | Claude 3.5 Sonnet | 2024-06-20 | Claude 3.5 Sonnet (Jun 2024) | Anthropic |
| gemma-2-27b-it | 2024-06-24 | 24.28 | 0.37 | GPQA Diamond | FALSE | Gemma 2 27B | 2024-06-24 | Google DeepMind | ||
| gemma-2-9b-it | 2024-06-24 | 2.72 | 0.28 | GPQA Diamond | FALSE | Gemma 2 9B | 2024-06-24 | Google DeepMind | ||
| gpt-4o-mini-2024-07-18 | 2024-07-18 | 9.31 | 0.38 | GPQA Diamond | OpenAI | FALSE | GPT-4o mini | 2024-07-18 | OpenAI | |
| open-mistral-nemo-2407 | 2024-07-18 | 4.90 | 0.30 | GPQA Diamond | Mistral | FALSE | Mistral NeMo | 2024-07-18 | Mistral AI | |
| Llama-3.1-405B-Instruct | 2024-07-23 | 67.52 | 0.51 | GPQA Diamond | Meta | FALSE | Llama 3.1-405B | 2024-07-23 | Meta AI | |
| Llama-3.1-70B-Instruct | 2024-07-23 | 35.75 | 0.44 | GPQA Diamond | Meta | FALSE | Llama 3.1-70B | 2024-07-23 | ||
| Llama-3.1-8B-Instruct | 2024-07-23 | 12.71 | 0.26 | GPQA Diamond | Meta | FALSE | Llama 3.1-8B | 2024-07-23 | ||
| mistral-large-2407 | 2024-07-24 | 14.08 | 0.49 | GPQA Diamond | Mistral | FALSE | Mistral Large 2 | 2024-07-24 | Mistral AI | |
| gpt-4o-2024-08-06 | 2024-08-06 | 12.69 | 0.49 | GPQA Diamond | OpenAI | FALSE | GPT-4o | 2024-08-06 | GPT-4o (Aug 2024) | OpenAI |
| o1-preview-2024-09-12 | 2024-09-12 | 33.47 | 0.50 | GPQA Diamond | OpenAI | FALSE | o1-preview | 2024-09-12 | o1-preview | OpenAI |
| o1-mini-2024-09-12_high | 2024-09-12 | 15.61 | 0.62 | GPQA Diamond | OpenAI | FALSE | o1-mini | 2024-09-12 | o1-mini (high) | OpenAI |
| o1-mini-2024-09-12_medium | 2024-09-12 | 12.11 | 0.60 | GPQA Diamond | OpenAI | FALSE | o1-mini | 2024-09-12 | o1-mini (medium) | OpenAI |
| qwen2.5-32b-instruct | 2024-09-17 | 20.77 | 0.46 | GPQA Diamond | Alibaba | FALSE | Qwen2.5-32B | 2024-09-17 | Alibaba | |
| qwen2.5-72b-instruct | 2024-09-19 | 43.84 | 0.49 | GPQA Diamond | Alibaba | FALSE | Qwen2.5-72B | 2024-09-19 | Alibaba | |
| Llama-3.2-90B-Vision-Instruct | 2024-09-24 | 38.23 | 0.41 | GPQA Diamond | Meta | FALSE | Llama 3.2 90B | 2024-09-24 | Meta AI | |
| gemini-1.5-pro-002 | 2024-09-24 | 9.06 | 0.57 | GPQA Diamond | FALSE | Gemini 1.5 Pro | 2024-09-24 | Google DeepMind | ||
| gemini-1.5-flash-002 | 2024-09-24 | 3.18 | 0.47 | GPQA Diamond | TRUE | Gemini 1.5 Flash | 2024-09-24 | Google DeepMind | ||
| gemini-1.5-flash-8b-001 | 2024-10-03 | 3.79 | 0.33 | GPQA Diamond | FALSE | Gemini 1.5 Flash 8B | 2024-10-03 | Google DeepMind | ||
| ministral-8b-2410 | 2024-10-16 | 5.22 | 0.27 | GPQA Diamond | Mistral | FALSE | Ministral 8B | 2024-10-16 | Mistral AI | |
| ministral-3b-2410 | 2024-10-16 | 3.40 | 0.25 | GPQA Diamond | Mistral | FALSE | Ministral 3B | 2024-10-16 | Mistral AI | |
| claude-3-5-sonnet-20241022 | 2024-10-22 | 9.34 | 0.55 | GPQA Diamond | Anthropic | FALSE | Claude 3.5 Sonnet | 2024-10-22 | Claude 3.5 Sonnet (Oct 2024) | Anthropic |
| claude-3-5-haiku-20241022 | 2024-10-22 | 5.89 | 0.38 | GPQA Diamond | Anthropic | FALSE | Claude 3.5 Haiku | 2024-10-22 | Claude 3.5 Haiku (Oct 2024) | Anthropic |
| qwen-turbo-2024-11-01 | 2024-11-01 | 6.73 | 0.42 | GPQA Diamond | Alibaba | FALSE | Qwen Turbo | 2024-11-01 | Alibaba | |
| mistral-large-2411 | 2024-11-18 | 12.59 | 0.51 | GPQA Diamond | Mistral | FALSE | Mistral Large 2 | 2024-11-18 | Mistral AI | |
| gpt-4o-2024-11-20 | 2024-11-20 | 18.44 | 0.48 | GPQA Diamond | OpenAI | FALSE | GPT-4o | 2024-11-20 | GPT-4o (Nov 2024) | OpenAI |
| Llama-3.1-Tulu-3-70B-DPO | 2024-11-21 | 38.31 | 0.46 | GPQA Diamond | Other | FALSE | Tulu 3 (Tülu 3) 70B | 2024-11-21 | Allen Institute for AI,University of Washington | |
| Llama-3.3-70B-Instruct | 2024-12-06 | 20.36 | 0.47 | GPQA Diamond | Meta | FALSE | Llama 3.3 70B | 2024-12-06 | Meta AI | |
| grok-2-1212 | 2024-12-12 | 17.19 | 0.54 | GPQA Diamond | xAI | FALSE | Grok-2 | 2024-12-12 | xAI | |
| phi-4 | 2024-12-12 | 15.38 | 0.56 | GPQA Diamond | Other | FALSE | Phi-4 | 2024-12-12 | Microsoft Research | |
| o1-2024-12-17_high | 2024-12-17 | 69.64 | 0.77 | GPQA Diamond | OpenAI | FALSE | o1 | 2024-12-17 | o1 (high) | OpenAI |
| o1-2024-12-17_medium | 2024-12-17 | 52.89 | 0.76 | GPQA Diamond | OpenAI | FALSE | o1 | 2024-12-17 | o1 (medium) | OpenAI |
| DeepSeek-V3 | 2024-12-26 | 59.23 | 0.57 | GPQA Diamond | DeepSeek | FALSE | DeepSeek-V3 | 2024-12-26 | DeepSeek | |
| Eurus-2-7B-PRIME | 2024-12-31 | 19.36 | 0.34 | GPQA Diamond | Other | FALSE | Eurus-2-7B-PRIME | 2024-12-31 | Tsinghua University,University of Illinois Urbana-Champaign (UIUC),Shanghai AI Lab,Peking University,Shanghai Jiao Tong University,CUHK Shenzhen Research Institute | |
| DeepSeek-R1 | 2025-01-20 | 279.14 | 0.72 | GPQA Diamond | DeepSeek | FALSE | DeepSeek-R1 | 2025-01-20 | DeepSeek | |
| DeepSeek-R1-Distill-Qwen-14B | 2025-01-20 | 164.33 | 0.45 | GPQA Diamond | DeepSeek | FALSE | 2025-01-20 | |||
| DeepSeek-R1-Distill-Llama-70B | 2025-01-20 | 146.01 | 0.56 | GPQA Diamond | DeepSeek | FALSE | DeepSeek-R1-Distill-Llama-70B | 2025-01-20 | DeepSeek | |
| gemini-2.0-flash-thinking-exp-01-21 | 2025-01-21 | 25.04 | 0.57 | GPQA Diamond | FALSE | Gemini 2.0 Flash Thinking | 2025-01-21 | Gemini 2.0 Flash Thinking Exp | Google DeepMind,Google | |
| qwen-max-2025-01-25 | 2025-01-25 | 18.01 | 0.56 | GPQA Diamond | Alibaba | FALSE | Qwen2.5-Max | 2025-01-25 | Alibaba | |
| qwen-plus-2025-01-25 | 2025-01-25 | 9.11 | 0.48 | GPQA Diamond | Alibaba | FALSE | Qwen Plus | 2025-01-25 | Alibaba | |
| mistral-small-2501 | 2025-01-25 | 3.91 | 0.45 | GPQA Diamond | Mistral | FALSE | Mistral Small 3 | 2025-01-25 | Mistral AI | |
| o3-mini-2025-01-31_high | 2025-01-31 | 64.15 | 0.77 | GPQA Diamond | OpenAI | FALSE | o3-mini | 2025-01-31 | o3-mini (high) | OpenAI |
| o3-mini-2025-01-31_medium | 2025-01-31 | 18.51 | 0.74 | GPQA Diamond | OpenAI | TRUE | o3-mini | 2025-01-31 | o3-mini (medium) | OpenAI |
| gemini-2.0-pro-exp-02-05 | 2025-02-05 | 7.57 | 0.66 | GPQA Diamond | TRUE | Gemini 2.0 Pro | 2025-02-05 | Gemini 2.0 Pro Exp (Feb 2025) | Google DeepMind,Google | |
| gemini-2.0-flash-001 | 2025-02-05 | 6.13 | 0.64 | GPQA Diamond | TRUE | Gemini 2.0 Flash | 2025-02-05 | Gemini 2.0 Flash (Feb 2025) | Google DeepMind,Google | |
| claude-3-7-sonnet-20250219_64K | 2025-02-24 | 163.73 | 0.77 | GPQA Diamond | Anthropic | FALSE | Claude 3.7 Sonnet | 2025-02-24 | Claude 3.7 Sonnet (64k thinking) | Anthropic |
| claude-3-7-sonnet-20250219_32K | 2025-02-24 | 153.47 | 0.77 | GPQA Diamond | Anthropic | FALSE | Claude 3.7 Sonnet | 2025-02-24 | Claude 3.7 Sonnet (32k thinking) | Anthropic |
| claude-3-7-sonnet-20250219_16K | 2025-02-24 | 112.63 | 0.77 | GPQA Diamond | Anthropic | FALSE | Claude 3.7 Sonnet | 2025-02-24 | Claude 3.7 Sonnet (16k thinking) | Anthropic |
| claude-3-7-sonnet-20250219 | 2025-02-24 | 13.04 | 0.66 | GPQA Diamond | Anthropic | FALSE | Claude 3.7 Sonnet | 2025-02-24 | Anthropic | |
| gpt-4.5-preview-2025-02-27 | 2025-02-27 | 54.39 | 0.69 | GPQA Diamond | OpenAI | FALSE | GPT-4.5 | 2025-02-27 | GPT-4.5 Preview (Feb 2025) | OpenAI |
| gemma-3-27b-it | 2025-03-12 | 15.43 | 0.49 | GPQA Diamond | FALSE | Gemma 3 27B | 2025-03-12 | Google DeepMind | ||
| mistral-small-2503 | 2025-03-17 | 6.02 | 0.48 | GPQA Diamond | Mistral | FALSE | Mistral Small 3.1 | 2025-03-17 | Mistral AI | |
| DeepSeek-V3-0324 | 2025-03-24 | 39.95 | 0.68 | GPQA Diamond | DeepSeek | FALSE | DeepSeek-V3 | 2025-03-24 | DeepSeek-V3 (Mar 2025) | DeepSeek |
| gemini-2.5-pro-exp-03-25 | 2025-03-25 | 61.20 | 0.84 | GPQA Diamond | TRUE | Gemini 2.5 Pro | 2025-03-25 | Gemini 2.5 Pro Exp (Mar 2025) | Google DeepMind | |
| Llama-4-Scout-17B-16E-Instruct | 2025-04-05 | 17.46 | 0.52 | GPQA Diamond | Meta | FALSE | Llama 4 Scout | 2025-04-05 | Meta AI | |
| Llama-4-Maverick-17B-128E-Instruct-FP8 | 2025-04-05 | 11.51 | 0.67 | GPQA Diamond | Meta | TRUE | Llama 4 Maverick | 2025-04-05 | Llama 4 Maverick (FP8) | Meta AI |
| qwq-plus | 2025-04-08 | 219.18 | 0.65 | GPQA Diamond | Alibaba | FALSE | QWQ-Plus | 2025-04-08 | Alibaba | |
| grok-3-mini-beta_high | 2025-04-09 | 56.01 | 0.74 | GPQA Diamond | xAI | FALSE | Grok-3 mini | 2025-04-09 | xAI | |
| grok-3-beta | 2025-04-09 | 29.53 | 0.76 | GPQA Diamond | xAI | FALSE | Grok-3 | 2025-04-09 | xAI | |
| grok-3-mini-beta_low | 2025-04-09 | 23.63 | 0.76 | GPQA Diamond | xAI | TRUE | Grok-3 mini | 2025-04-09 | xAI | |
| gpt-4.1-2025-04-14 | 2025-04-14 | 10.13 | 0.67 | GPQA Diamond | OpenAI | TRUE | GPT-4.1 | 2025-04-14 | GPT-4.1 | OpenAI |
| gpt-4.1-mini-2025-04-14 | 2025-04-14 | 8.74 | 0.66 | GPQA Diamond | OpenAI | TRUE | GPT-4.1 mini | 2025-04-14 | GPT-4.1 mini | OpenAI |
| gpt-4.1-nano-2025-04-14 | 2025-04-14 | 5.58 | 0.49 | GPQA Diamond | OpenAI | TRUE | GPT-4.1 nano | 2025-04-14 | GPT-4.1 nano | OpenAI |
| o4-mini-2025-04-16_high | 2025-04-16 | 93.84 | 0.80 | GPQA Diamond | OpenAI | FALSE | o4-mini | 2025-04-16 | o4-mini (high) | OpenAI |
| o3-2025-04-16_high | 2025-04-16 | 91.54 | 0.82 | GPQA Diamond | OpenAI | FALSE | o3 | 2025-04-16 | o3 (high) | OpenAI |
| mistral-medium-2505 | 2025-05-07 | 17.39 | 0.60 | GPQA Diamond | Mistral | FALSE | Mistral Medium 3 | 2025-05-07 | Mistral AI | |
| gpt-4-0613 | 2023-06-13 | 12.42 | 0.23 | MATH Level 5 | OpenAI | FALSE | GPT-4 | 2023-06-13 | GPT-4 (Jun 2023) | OpenAI |
| claude-2.0 | 2023-07-11 | 10.80 | 0.12 | MATH Level 5 | Anthropic | FALSE | Claude 2 | 2023-07-11 | Anthropic | |
| gpt-3.5-turbo-1106 | 2023-11-06 | 3.00 | 0.16 | MATH Level 5 | OpenAI | FALSE | GPT-3.5 Turbo | 2023-11-06 | GPT-3.5 Turbo (Nov 2023) | OpenAI |
| gpt-4-1106-preview | 2023-11-06 | 21.95 | 0.40 | MATH Level 5 | OpenAI | FALSE | GPT-4 | 2023-11-06 | GPT-4 Preview (Nov 2023) | OpenAI |
| open-mixtral-8x7b | 2023-12-11 | 8.23 | 0.10 | MATH Level 5 | Mistral | FALSE | Mixtral 8x7B | 2023-12-11 | Mistral AI | |
| gpt-4-0125-preview | 2024-01-25 | 28.72 | 0.35 | MATH Level 5 | OpenAI | FALSE | GPT-4 | 2024-01-25 | OpenAI | |
| gpt-3.5-turbo-0125 | 2024-01-25 | 2.81 | 0.12 | MATH Level 5 | OpenAI | FALSE | GPT-3.5 Turbo | 2024-01-25 | OpenAI | |
| gemini-1.0-pro-001 | 2024-02-15 | 4.55 | 0.11 | MATH Level 5 | FALSE | Gemini 1.0 Pro | 2024-02-15 | Google DeepMind | ||
| mistral-large-2402 | 2024-02-26 | 15.55 | 0.25 | MATH Level 5 | Mistral | FALSE | Mistral Large | 2024-02-26 | Mistral AI | |
| claude-3-sonnet-20240229 | 2024-02-29 | 13.19 | 0.18 | MATH Level 5 | Anthropic | FALSE | Claude 3 Sonnet | 2024-02-29 | Anthropic | |
| claude-3-opus-20240229 | 2024-02-29 | 24.70 | 0.38 | MATH Level 5 | Anthropic | FALSE | Claude 3 Opus | 2024-02-29 | Anthropic | |
| claude-3-haiku-20240307 | 2024-03-07 | 10.89 | 0.15 | MATH Level 5 | Anthropic | FALSE | Claude 3 Haiku | 2024-03-07 | ||
| dbrx-instruct | 2024-03-27 | 143.23 | 0.12 | MATH Level 5 | Other | FALSE | DBRX | 2024-03-27 | Databricks | |
| gpt-4-turbo-2024-04-09 | 2024-04-09 | 29.79 | 0.47 | MATH Level 5 | OpenAI | FALSE | GPT-4 Turbo | 2024-04-09 | OpenAI | |
| WizardLM-2-8x22B | 2024-04-15 | 24.81 | 0.26 | MATH Level 5 | Other | FALSE | WizardLM-2 8x22B | 2024-04-15 | Microsoft | |
| open-mixtral-8x22b | 2024-04-17 | 11.27 | 0.24 | MATH Level 5 | Mistral | FALSE | Mixtral 8x22B | 2024-04-17 | Mistral AI | |
| Meta-Llama-3-70B-Instruct | 2024-04-18 | 22.82 | 0.23 | MATH Level 5 | Meta | FALSE | Llama 3-70B | 2024-04-18 | Meta AI | |
| Yi-1.5-34B-Chat | 2024-05-13 | 37.17 | 0.26 | MATH Level 5 | Other | FALSE | Yi-1.5-34B | 2024-05-13 | 01.AI | |
| gpt-4o-2024-05-13 | 2024-05-13 | 9.48 | 0.51 | MATH Level 5 | OpenAI | FALSE | GPT-4o | 2024-05-13 | GPT-4o (May 2024) | OpenAI |
| gemini-1.5-flash-001 | 2024-05-23 | 2.07 | 0.25 | MATH Level 5 | TRUE | Gemini 1.5 Flash | 2024-05-23 | Gemini 1.5 Flash (May 2024) | Google DeepMind | |
| gemini-1.5-pro-001 | 2024-05-24 | 8.75 | 0.41 | MATH Level 5 | FALSE | Gemini 1.5 Pro | 2024-05-24 | Google DeepMind | ||
| qwen2-72b-instruct | 2024-06-07 | 34.21 | 0.39 | MATH Level 5 | Alibaba | FALSE | Qwen2-72B | 2024-06-07 | Alibaba | |
| Hermes-2-Theta-Llama-3-70B | 2024-06-20 | 20.51 | 0.23 | MATH Level 5 | Other | FALSE | Hermes 2 Theta Llama-3 70B | 2024-06-20 | Nous Research,Arcee AI | |
| claude-3-5-sonnet-20240620 | 2024-06-20 | 12.94 | 0.52 | MATH Level 5 | Anthropic | FALSE | Claude 3.5 Sonnet | 2024-06-20 | Claude 3.5 Sonnet (Jun 2024) | Anthropic |
| gemma-2-9b-it | 2024-06-24 | 12.45 | 0.21 | MATH Level 5 | FALSE | Gemma 2 9B | 2024-06-24 | Google DeepMind | ||
| gemma-2-27b-it | 2024-06-24 | 17.05 | 0.28 | MATH Level 5 | FALSE | Gemma 2 27B | 2024-06-24 | Google DeepMind | ||
| open-mistral-nemo-2407 | 2024-07-18 | 5.34 | 0.11 | MATH Level 5 | Mistral | FALSE | Mistral NeMo | 2024-07-18 | Mistral AI | |
| gpt-4o-mini-2024-07-18 | 2024-07-18 | 14.64 | 0.53 | MATH Level 5 | OpenAI | FALSE | GPT-4o mini | 2024-07-18 | OpenAI | |
| Llama-3.1-405B-Instruct | 2024-07-23 | 23.42 | 0.50 | MATH Level 5 | Meta | FALSE | Llama 3.1-405B | 2024-07-23 | Meta AI | |
| Llama-3.1-70B-Instruct | 2024-07-23 | 194.69 | 0.37 | MATH Level 5 | Meta | FALSE | Llama 3.1-70B | 2024-07-23 | ||
| Llama-3.1-8B-Instruct | 2024-07-23 | 16.47 | 0.23 | MATH Level 5 | Meta | FALSE | Llama 3.1-8B | 2024-07-23 | ||
| mistral-large-2407 | 2024-07-24 | 17.75 | 0.45 | MATH Level 5 | Mistral | FALSE | Mistral Large 2 | 2024-07-24 | Mistral AI | |
| gpt-4o-2024-08-06 | 2024-08-06 | 15.65 | 0.53 | MATH Level 5 | OpenAI | FALSE | GPT-4o | 2024-08-06 | GPT-4o (Aug 2024) | OpenAI |
| o1-mini-2024-09-12_high | 2024-09-12 | 15.18 | 0.89 | MATH Level 5 | OpenAI | FALSE | o1-mini | 2024-09-12 | o1-mini (high) | OpenAI |
| o1-mini-2024-09-12_medium | 2024-09-12 | 10.76 | 0.84 | MATH Level 5 | OpenAI | TRUE | o1-mini | 2024-09-12 | o1-mini (medium) | OpenAI |
| o1-preview-2024-09-12 | 2024-09-12 | 42.64 | 0.82 | MATH Level 5 | OpenAI | FALSE | o1-preview | 2024-09-12 | o1-preview | OpenAI |
| qwen2.5-32b-instruct | 2024-09-17 | 24.57 | 0.56 | MATH Level 5 | Alibaba | FALSE | Qwen2.5-32B | 2024-09-17 | Alibaba | |
| qwen2.5-72b-instruct | 2024-09-19 | 40.02 | 0.63 | MATH Level 5 | Alibaba | FALSE | Qwen2.5-72B | 2024-09-19 | Alibaba | |
| gemini-1.5-pro-002 | 2024-09-24 | 11.55 | 0.70 | MATH Level 5 | FALSE | Gemini 1.5 Pro | 2024-09-24 | Google DeepMind | ||
| Llama-3.2-90B-Vision-Instruct | 2024-09-24 | 34.07 | 0.39 | MATH Level 5 | Meta | FALSE | Llama 3.2 90B | 2024-09-24 | Meta AI | |
| gemini-1.5-flash-002 | 2024-09-24 | 4.27 | 0.62 | MATH Level 5 | TRUE | Gemini 1.5 Flash | 2024-09-24 | Google DeepMind | ||
| ministral-8b-2410 | 2024-10-16 | 5.02 | 0.15 | MATH Level 5 | Mistral | FALSE | Ministral 8B | 2024-10-16 | Mistral AI | |
| ministral-3b-2410 | 2024-10-16 | 4.13 | 0.14 | MATH Level 5 | Mistral | FALSE | Ministral 3B | 2024-10-16 | Mistral AI | |
| claude-3-5-haiku-20241022 | 2024-10-22 | 6.90 | 0.46 | MATH Level 5 | Anthropic | FALSE | Claude 3.5 Haiku | 2024-10-22 | Claude 3.5 Haiku (Oct 2024) | Anthropic |
| claude-3-5-sonnet-20241022 | 2024-10-22 | 14.22 | 0.57 | MATH Level 5 | Anthropic | FALSE | Claude 3.5 Sonnet | 2024-10-22 | Claude 3.5 Sonnet (Oct 2024) | Anthropic |
| qwen-turbo-2024-11-01 | 2024-11-01 | 7.30 | 0.56 | MATH Level 5 | Alibaba | FALSE | Qwen Turbo | 2024-11-01 | Alibaba | |
| mistral-large-2411 | 2024-11-18 | 14.18 | 0.50 | MATH Level 5 | Mistral | FALSE | Mistral Large 2 | 2024-11-18 | Mistral AI | |
| gpt-4o-2024-11-20 | 2024-11-20 | 19.00 | 0.50 | MATH Level 5 | OpenAI | FALSE | GPT-4o | 2024-11-20 | GPT-4o (Nov 2024) | OpenAI |
| Llama-3.1-Tulu-3-70B-DPO | 2024-11-21 | 25.41 | 0.43 | MATH Level 5 | Other | FALSE | Tulu 3 (Tülu 3) 70B | 2024-11-21 | Allen Institute for AI,University of Washington | |
| Llama-3.3-70B-Instruct | 2024-12-06 | 24.58 | 0.42 | MATH Level 5 | Meta | FALSE | Llama 3.3 70B | 2024-12-06 | Meta AI | |
| phi-4 | 2024-12-12 | 21.98 | 0.65 | MATH Level 5 | Other | FALSE | Phi-4 | 2024-12-12 | Microsoft Research | |
| grok-2-1212 | 2024-12-12 | 47.80 | 0.64 | MATH Level 5 | xAI | FALSE | Grok-2 | 2024-12-12 | xAI | |
| o1-2024-12-17_medium | 2024-12-17 | 39.05 | 0.94 | MATH Level 5 | OpenAI | FALSE | o1 | 2024-12-17 | o1 (medium) | OpenAI |
| o1-2024-12-17_high | 2024-12-17 | 47.93 | 0.95 | MATH Level 5 | OpenAI | FALSE | o1 | 2024-12-17 | o1 (high) | OpenAI |
| DeepSeek-V3 | 2024-12-26 | 104.88 | 0.65 | MATH Level 5 | DeepSeek | FALSE | DeepSeek-V3 | 2024-12-26 | DeepSeek | |
| DeepSeek-R1-Distill-Qwen-14B | 2025-01-20 | 55.65 | 0.87 | MATH Level 5 | DeepSeek | FALSE | 2025-01-20 | |||
| DeepSeek-R1 | 2025-01-20 | 132.60 | 0.93 | MATH Level 5 | DeepSeek | FALSE | DeepSeek-R1 | 2025-01-20 | DeepSeek | |
| DeepSeek-R1-Distill-Llama-70B | 2025-01-20 | 68.77 | 0.90 | MATH Level 5 | DeepSeek | FALSE | DeepSeek-R1-Distill-Llama-70B | 2025-01-20 | DeepSeek | |
| qwen-plus-2025-01-25 | 2025-01-25 | 24.14 | 0.65 | MATH Level 5 | Alibaba | FALSE | Qwen Plus | 2025-01-25 | Alibaba | |
| qwen-max-2025-01-25 | 2025-01-25 | 29.36 | 0.67 | MATH Level 5 | Alibaba | FALSE | Qwen2.5-Max | 2025-01-25 | Alibaba | |
| mistral-small-2501 | 2025-01-25 | 4.65 | 0.45 | MATH Level 5 | Mistral | FALSE | Mistral Small 3 | 2025-01-25 | Mistral AI | |
| o3-mini-2025-01-31_high | 2025-01-31 | 25.00 | 0.97 | MATH Level 5 | OpenAI | TRUE | o3-mini | 2025-01-31 | o3-mini (high) | OpenAI |
| o3-mini-2025-01-31_medium | 2025-01-31 | 11.11 | 0.95 | MATH Level 5 | OpenAI | TRUE | o3-mini | 2025-01-31 | o3-mini (medium) | OpenAI |
| gemini-2.0-flash-001 | 2025-02-05 | 6.53 | 0.82 | MATH Level 5 | TRUE | Gemini 2.0 Flash | 2025-02-05 | Gemini 2.0 Flash (Feb 2025) | Google DeepMind,Google | |
| gemini-2.0-pro-exp-02-05 | 2025-02-05 | 9.00 | 0.84 | MATH Level 5 | TRUE | Gemini 2.0 Pro | 2025-02-05 | Gemini 2.0 Pro Exp (Feb 2025) | Google DeepMind,Google | |
| claude-3-7-sonnet-20250219_32K | 2025-02-24 | 140.26 | 0.90 | MATH Level 5 | Anthropic | FALSE | Claude 3.7 Sonnet | 2025-02-24 | Claude 3.7 Sonnet (32k thinking) | Anthropic |
| claude-3-7-sonnet-20250219_64K | 2025-02-24 | 152.58 | 0.91 | MATH Level 5 | Anthropic | FALSE | Claude 3.7 Sonnet | 2025-02-24 | Claude 3.7 Sonnet (64k thinking) | Anthropic |
| claude-3-7-sonnet-20250219 | 2025-02-24 | 15.83 | 0.68 | MATH Level 5 | Anthropic | FALSE | Claude 3.7 Sonnet | 2025-02-24 | Anthropic | |
| claude-3-7-sonnet-20250219_16K | 2025-02-24 | 109.73 | 0.86 | MATH Level 5 | Anthropic | FALSE | Claude 3.7 Sonnet | 2025-02-24 | Claude 3.7 Sonnet (16k thinking) | Anthropic |
| gpt-4.5-preview-2025-02-27 | 2025-02-27 | 74.19 | 0.79 | MATH Level 5 | OpenAI | FALSE | GPT-4.5 | 2025-02-27 | GPT-4.5 Preview (Feb 2025) | OpenAI |
| gemma-3-27b-it | 2025-03-12 | 23.46 | 0.74 | MATH Level 5 | FALSE | Gemma 3 27B | 2025-03-12 | Google DeepMind | ||
| mistral-small-2503 | 2025-03-17 | 7.16 | 0.47 | MATH Level 5 | Mistral | FALSE | Mistral Small 3.1 | 2025-03-17 | Mistral AI | |
| DeepSeek-V3-0324 | 2025-03-24 | 46.81 | 0.76 | MATH Level 5 | DeepSeek | FALSE | DeepSeek-V3 | 2025-03-24 | DeepSeek-V3 (Mar 2025) | DeepSeek |
| Llama-4-Scout-17B-16E-Instruct | 2025-04-05 | 24.90 | 0.62 | MATH Level 5 | Meta | FALSE | Llama 4 Scout | 2025-04-05 | Meta AI | |
| Llama-4-Maverick-17B-128E-Instruct-FP8 | 2025-04-05 | 11.39 | 0.73 | MATH Level 5 | Meta | FALSE | Llama 4 Maverick | 2025-04-05 | Llama 4 Maverick (FP8) | Meta AI |
| grok-3-beta | 2025-04-09 | 26.87 | 0.89 | MATH Level 5 | xAI | FALSE | Grok-3 | 2025-04-09 | xAI | |
| grok-3-mini-beta_low | 2025-04-09 | 20.47 | 0.91 | MATH Level 5 | xAI | FALSE | Grok-3 mini | 2025-04-09 | xAI | |
| grok-3-mini-beta_high | 2025-04-09 | 40.23 | 0.88 | MATH Level 5 | xAI | FALSE | Grok-3 mini | 2025-04-09 | xAI | |
| gpt-4.1-2025-04-14 | 2025-04-14 | 14.67 | 0.83 | MATH Level 5 | OpenAI | FALSE | GPT-4.1 | 2025-04-14 | GPT-4.1 | OpenAI |
| gpt-4.1-mini-2025-04-14 | 2025-04-14 | 13.41 | 0.87 | MATH Level 5 | OpenAI | FALSE | GPT-4.1 mini | 2025-04-14 | GPT-4.1 mini | OpenAI |
| gpt-4.1-nano-2025-04-14 | 2025-04-14 | 9.15 | 0.70 | MATH Level 5 | OpenAI | FALSE | GPT-4.1 nano | 2025-04-14 | GPT-4.1 nano | OpenAI |
| o4-mini-2025-04-16_high | 2025-04-16 | 37.48 | 0.98 | MATH Level 5 | OpenAI | FALSE | o4-mini | 2025-04-16 | o4-mini (high) | OpenAI |
| o3-2025-04-16_high | 2025-04-16 | 34.08 | 0.98 | MATH Level 5 | OpenAI | TRUE | o3 | 2025-04-16 | o3 (high) | OpenAI |
| gemini-2.5-pro-preview-05-06 | 2025-05-06 | 87.22 | 0.96 | MATH Level 5 | FALSE | Gemini 2.5 Pro | 2025-05-06 | Google DeepMind | ||
| mistral-medium-2505 | 2025-05-07 | 30.19 | 0.82 | MATH Level 5 | Mistral | FALSE | Mistral Medium 3 | 2025-05-07 | Mistral AI | |
| o4-mini-2025-04-16_high | 2025-04-16 | 144.47 | 0.82 | OTIS Mock AIME 2024-2025 | OpenAI | TRUE | o4-mini | 2025-04-16 | o4-mini (high) | OpenAI |
| qwen-max-2025-01-25 | 2025-01-25 | 39.62 | 0.16 | OTIS Mock AIME 2024-2025 | Alibaba | FALSE | Qwen2.5-Max | 2025-01-25 | Alibaba | |
| qwen-plus-2025-01-25 | 2025-01-25 | 32.60 | 0.18 | OTIS Mock AIME 2024-2025 | Alibaba | FALSE | Qwen Plus | 2025-01-25 | Alibaba | |
| grok-3-mini-beta_low | 2025-04-09 | 52.00 | 0.62 | OTIS Mock AIME 2024-2025 | xAI | TRUE | Grok-3 mini | 2025-04-09 | xAI | |
| mistral-medium-2505 | 2025-05-07 | 92.04 | 0.32 | OTIS Mock AIME 2024-2025 | Mistral | FALSE | Mistral Medium 3 | 2025-05-07 | Mistral AI | |
| DeepSeek-V3-0324 | 2025-03-24 | 94.29 | 0.38 | OTIS Mock AIME 2024-2025 | DeepSeek | FALSE | DeepSeek-V3 | 2025-03-24 | DeepSeek-V3 (Mar 2025) | DeepSeek |
| gpt-4.1-nano-2025-04-14 | 2025-04-14 | 19.49 | 0.29 | OTIS Mock AIME 2024-2025 | OpenAI | TRUE | GPT-4.1 nano | 2025-04-14 | GPT-4.1 nano | OpenAI |
| o1-mini-2024-09-12_medium | 2024-09-12 | 72.33 | 0.45 | OTIS Mock AIME 2024-2025 | OpenAI | FALSE | o1-mini | 2024-09-12 | o1-mini (medium) | OpenAI |
| gpt-4.5-preview-2025-02-27 | 2025-02-27 | 95.96 | 0.38 | OTIS Mock AIME 2024-2025 | OpenAI | FALSE | GPT-4.5 | 2025-02-27 | GPT-4.5 Preview (Feb 2025) | OpenAI |
| gemini-2.0-flash-001 | 2025-02-05 | 106.82 | 0.31 | OTIS Mock AIME 2024-2025 | FALSE | Gemini 2.0 Flash | 2025-02-05 | Gemini 2.0 Flash (Feb 2025) | Google DeepMind,Google | |
| DeepSeek-V3 | 2024-12-26 | 89.87 | 0.16 | OTIS Mock AIME 2024-2025 | DeepSeek | FALSE | DeepSeek-V3 | 2024-12-26 | DeepSeek | |
| claude-3-7-sonnet-20250219_32K | 2025-02-24 | 277.13 | 0.53 | OTIS Mock AIME 2024-2025 | Anthropic | FALSE | Claude 3.7 Sonnet | 2025-02-24 | Claude 3.7 Sonnet (32k thinking) | Anthropic |
| grok-2-1212 | 2024-12-12 | 115.44 | 0.12 | OTIS Mock AIME 2024-2025 | xAI | FALSE | Grok-2 | 2024-12-12 | xAI | |
| o3-mini-2025-01-31_medium | 2025-01-31 | 78.20 | 0.64 | OTIS Mock AIME 2024-2025 | OpenAI | TRUE | o3-mini | 2025-01-31 | o3-mini (medium) | OpenAI |
| o3-mini-2025-01-31_high | 2025-01-31 | 123.91 | 0.77 | OTIS Mock AIME 2024-2025 | OpenAI | TRUE | o3-mini | 2025-01-31 | o3-mini (high) | OpenAI |
| o1-2024-12-17_medium | 2024-12-17 | 118.64 | 0.73 | OTIS Mock AIME 2024-2025 | OpenAI | TRUE | o1 | 2024-12-17 | o1 (medium) | OpenAI |
| o1-preview-2024-09-12 | 2024-09-12 | 79.20 | 0.31 | OTIS Mock AIME 2024-2025 | OpenAI | FALSE | o1-preview | 2024-09-12 | o1-preview | OpenAI |
| gemini-1.5-pro-002 | 2024-09-24 | 125.53 | 0.23 | OTIS Mock AIME 2024-2025 | FALSE | Gemini 1.5 Pro | 2024-09-24 | Google DeepMind | ||
| phi-4 | 2024-12-12 | 33.02 | 0.14 | OTIS Mock AIME 2024-2025 | Other | FALSE | Phi-4 | 2024-12-12 | Microsoft Research | |
| o1-mini-2024-09-12_high | 2024-09-12 | 68.44 | 0.47 | OTIS Mock AIME 2024-2025 | OpenAI | FALSE | o1-mini | 2024-09-12 | o1-mini (high) | OpenAI |
| gemini-2.5-flash-preview-04-17 | 2025-04-17 | 127.29 | 0.73 | OTIS Mock AIME 2024-2025 | FALSE | Gemini 2.5 Flash | 2025-04-17 | Gemini 2.5 Flash Preview (Apr 2025) | Google DeepMind | |
| grok-3-mini-beta_high | 2025-04-09 | 137.31 | 0.78 | OTIS Mock AIME 2024-2025 | xAI | TRUE | Grok-3 mini | 2025-04-09 | xAI | |
| gpt-4.1-2025-04-14 | 2025-04-14 | 44.22 | 0.38 | OTIS Mock AIME 2024-2025 | OpenAI | FALSE | GPT-4.1 | 2025-04-14 | GPT-4.1 | OpenAI |
| claude-3-7-sonnet-20250219_64K | 2025-02-24 | 313.11 | 0.58 | OTIS Mock AIME 2024-2025 | Anthropic | FALSE | Claude 3.7 Sonnet | 2025-02-24 | Claude 3.7 Sonnet (64k thinking) | Anthropic |
| grok-3-beta | 2025-04-09 | 55.58 | 0.56 | OTIS Mock AIME 2024-2025 | xAI | FALSE | Grok-3 | 2025-04-09 | xAI | |
| gemini-2.0-flash-thinking-exp-01-21 | 2025-01-21 | 58.73 | 0.58 | OTIS Mock AIME 2024-2025 | FALSE | Gemini 2.0 Flash Thinking | 2025-01-21 | Gemini 2.0 Flash Thinking Exp | Google DeepMind,Google | |
| claude-3-7-sonnet-20250219_16K | 2025-02-24 | 185.67 | 0.47 | OTIS Mock AIME 2024-2025 | Anthropic | FALSE | Claude 3.7 Sonnet | 2025-02-24 | Claude 3.7 Sonnet (16k thinking) | Anthropic |
| claude-3-7-sonnet-20250219 | 2025-02-24 | 38.04 | 0.22 | OTIS Mock AIME 2024-2025 | Anthropic | FALSE | Claude 3.7 Sonnet | 2025-02-24 | Anthropic | |
| o3-2025-04-16_high | 2025-04-16 | 147.84 | 0.84 | OTIS Mock AIME 2024-2025 | OpenAI | TRUE | o3 | 2025-04-16 | o3 (high) | OpenAI |
| Llama-4-Maverick-17B-128E-Instruct-FP8 | 2025-04-05 | 16.22 | 0.21 | OTIS Mock AIME 2024-2025 | Meta | TRUE | Llama 4 Maverick | 2025-04-05 | Llama 4 Maverick (FP8) | Meta AI |
| DeepSeek-R1-Distill-Llama-70B | 2025-01-20 | 245.16 | 0.51 | OTIS Mock AIME 2024-2025 | DeepSeek | FALSE | DeepSeek-R1-Distill-Llama-70B | 2025-01-20 | DeepSeek | |
| gemma-3-27b-it | 2025-03-12 | 54.73 | 0.20 | OTIS Mock AIME 2024-2025 | FALSE | Gemma 3 27B | 2025-03-12 | Google DeepMind | ||
| gpt-4.1-mini-2025-04-14 | 2025-04-14 | 38.64 | 0.45 | OTIS Mock AIME 2024-2025 | OpenAI | TRUE | GPT-4.1 mini | 2025-04-14 | GPT-4.1 mini | OpenAI |
| gemini-1.5-flash-002 | 2024-09-24 | 56.82 | 0.16 | OTIS Mock AIME 2024-2025 | FALSE | Gemini 1.5 Flash | 2024-09-24 | Google DeepMind | ||
| DeepSeek-R1 | 2025-01-20 | 225.96 | 0.53 | OTIS Mock AIME 2024-2025 | DeepSeek | FALSE | DeepSeek-R1 | 2025-01-20 | DeepSeek | |
| claude-opus-4-20250514 | 2025-05-22 | 24.88 | 0.85 | MATH Level 5 | Anthropic | FALSE | Claude Opus 4 | 2025-05-22 | Anthropic | |
| claude-sonnet-4-20250514 | 2025-05-22 | 22.84 | 0.29 | OTIS Mock AIME 2024-2025 | Anthropic | FALSE | Claude Sonnet 4 | 2025-05-22 | Anthropic | |
| qwen3-235b-a22b | 2025-04-29 | 186.21 | 0.71 | GPQA Diamond | Alibaba | FALSE | Qwen3-235B-A22B | 2025-04-29 | Alibaba | |
| claude-sonnet-4-20250514_16K | 2025-05-22 | 165.18 | 0.53 | OTIS Mock AIME 2024-2025 | Anthropic | FALSE | Claude Sonnet 4 | 2025-05-22 | Anthropic | |
| claude-sonnet-4-20250514 | 2025-05-22 | 12.40 | 0.67 | GPQA Diamond | Anthropic | FALSE | Claude Sonnet 4 | 2025-05-22 | Anthropic | |
| claude-sonnet-4-20250514 | 2025-05-22 | 13.13 | 0.84 | MATH Level 5 | Anthropic | FALSE | Claude Sonnet 4 | 2025-05-22 | Anthropic | |
| claude-sonnet-4-20250514_32K | 2025-05-22 | 235.56 | 0.71 | OTIS Mock AIME 2024-2025 | Anthropic | FALSE | Claude Sonnet 4 | 2025-05-22 | Anthropic | |
| claude-opus-4-20250514_27K | 2025-05-22 | 337.82 | 0.64 | OTIS Mock AIME 2024-2025 | Anthropic | FALSE | Claude Opus 4 | 2025-05-22 | Anthropic | |
| DeepSeek-R1-0528 | 2025-05-28 | 367.73 | 0.66 | OTIS Mock AIME 2024-2025 | DeepSeek | FALSE | DeepSeek-R1 | 2025-05-28 | DeepSeek | |
| claude-sonnet-4-20250514_59K | 2025-05-22 | 134.78 | 0.79 | GPQA Diamond | Anthropic | FALSE | Claude Sonnet 4 | 2025-05-22 | Anthropic | |
| claude-opus-4-20250514 | 2025-05-22 | 21.68 | 0.69 | GPQA Diamond | Anthropic | FALSE | Claude Opus 4 | 2025-05-22 | Anthropic | |
| DeepSeek-R1-0528 | 2025-05-28 | 152.70 | 0.76 | GPQA Diamond | DeepSeek | FALSE | DeepSeek-R1 | 2025-05-28 | DeepSeek | |
| claude-sonnet-4-20250514_59K | 2025-05-22 | 340.31 | 0.69 | OTIS Mock AIME 2024-2025 | Anthropic | FALSE | Claude Sonnet 4 | 2025-05-22 | Anthropic | |
| DeepSeek-R1-0528 | 2025-05-28 | 163.48 | 0.97 | MATH Level 5 | DeepSeek | FALSE | DeepSeek-R1 | 2025-05-28 | DeepSeek | |
| qwen3-235b-a22b | 2025-04-29 | 147.64 | 0.69 | MATH Level 5 | Alibaba | FALSE | Qwen3-235B-A22B | 2025-04-29 | Alibaba | |
| claude-opus-4-20250514_16K | 2025-05-22 | 48.84 | 0.76 | GPQA Diamond | Anthropic | FALSE | Claude Opus 4 | 2025-05-22 | Anthropic | |
| claude-opus-4-20250514_16K | 2025-05-22 | 222.18 | 0.60 | OTIS Mock AIME 2024-2025 | Anthropic | FALSE | Claude Opus 4 | 2025-05-22 | Anthropic | |
| claude-sonnet-4-20250514_16K | 2025-05-22 | 44.43 | 0.76 | GPQA Diamond | Anthropic | FALSE | Claude Sonnet 4 | 2025-05-22 | Anthropic | |
| claude-opus-4-20250514 | 2025-05-22 | 37.22 | 0.42 | OTIS Mock AIME 2024-2025 | Anthropic | TRUE | Claude Opus 4 | 2025-05-22 | Anthropic | |
| claude-sonnet-4-20250514_32K | 2025-05-22 | 78.37 | 0.78 | GPQA Diamond | Anthropic | FALSE | Claude Sonnet 4 | 2025-05-22 | Anthropic |
| ID | Release date | Runtime | Accuracy | Benchmark | Provider | Pareto optimal | Model | Version release date | Display name | Organization |
|---|---|---|---|---|---|---|---|---|---|---|
| gpt-4-0613 | 2023-06-13 | 8.55 | 0.31 | GPQA Diamond | OpenAI | FALSE | GPT-4 | 2023-06-13 | GPT-4 (Jun 2023) | OpenAI |
| claude-2.0 | 2023-07-11 | 10.47 | 0.35 | GPQA Diamond | Anthropic | FALSE | Claude 2 | 2023-07-11 | Anthropic | |
| Llama-2-70b-chat-hf | 2023-07-18 | 24.13 | 0.26 | GPQA Diamond | Meta | FALSE | Llama 2-70B | 2023-07-18 | Meta AI | |
| gpt-4-1106-preview | 2023-11-06 | 16.43 | 0.42 | GPQA Diamond | OpenAI | FALSE | GPT-4 | 2023-11-06 | GPT-4 Preview (Nov 2023) | OpenAI |
| gpt-3.5-turbo-1106 | 2023-11-06 | 1.14 | 0.28 | GPQA Diamond | OpenAI | TRUE | GPT-3.5 Turbo | 2023-11-06 | GPT-3.5 Turbo (Nov 2023) | OpenAI |
| claude-2.1 | 2023-11-21 | 18.80 | 0.33 | GPQA Diamond | Anthropic | FALSE | Claude 2.1 | 2023-11-21 | Anthropic | |
| Mixtral-8x7B-Instruct-v0.1 | 2023-12-11 | 18.78 | 0.31 | GPQA Diamond | Mistral | FALSE | Mixtral 8x7B | 2023-12-11 | Mistral AI | |
| open-mixtral-8x7b | 2023-12-11 | 6.40 | 0.30 | GPQA Diamond | Mistral | FALSE | Mixtral 8x7B | 2023-12-11 | Mistral AI | |
| gpt-4-0125-preview | 2024-01-25 | 18.78 | 0.42 | GPQA Diamond | OpenAI | FALSE | GPT-4 | 2024-01-25 | OpenAI | |
| gpt-3.5-turbo-0125 | 2024-01-25 | 1.25 | 0.27 | GPQA Diamond | OpenAI | FALSE | GPT-3.5 Turbo | 2024-01-25 | OpenAI | |
| qwen1.5-72b-chat | 2024-02-04 | 24.69 | 0.29 | GPQA Diamond | Alibaba | FALSE | Qwen1.5-72B | 2024-02-04 | Alibaba | |
| gemini-1.0-pro-001 | 2024-02-15 | 3.32 | 0.34 | GPQA Diamond | FALSE | Gemini 1.0 Pro | 2024-02-15 | Google DeepMind | ||
| mistral-large-2402 | 2024-02-26 | 9.66 | 0.39 | GPQA Diamond | Mistral | FALSE | Mistral Large | 2024-02-26 | Mistral AI | |
| claude-3-opus-20240229 | 2024-02-29 | 18.70 | 0.47 | GPQA Diamond | Anthropic | FALSE | Claude 3 Opus | 2024-02-29 | Anthropic | |
| claude-3-sonnet-20240229 | 2024-02-29 | 9.97 | 0.41 | GPQA Diamond | Anthropic | FALSE | Claude 3 Sonnet | 2024-02-29 | Anthropic | |
| claude-3-haiku-20240307 | 2024-03-07 | 2.65 | 0.36 | GPQA Diamond | Anthropic | FALSE | Claude 3 Haiku | 2024-03-07 | ||
| dbrx-instruct | 2024-03-27 | 187.07 | 0.33 | GPQA Diamond | Other | FALSE | DBRX | 2024-03-27 | Databricks | |
| qwen1.5-32b-chat | 2024-04-03 | 29.06 | 0.31 | GPQA Diamond | Alibaba | FALSE | Qwen1.5-32B | 2024-04-03 | Alibaba | |
| gpt-4-turbo-2024-04-09 | 2024-04-09 | 30.84 | 0.47 | GPQA Diamond | OpenAI | FALSE | GPT-4 Turbo | 2024-04-09 | OpenAI | |
| WizardLM-2-8x22B | 2024-04-15 | 32.27 | 0.43 | GPQA Diamond | Other | FALSE | WizardLM-2 8x22B | 2024-04-15 | Microsoft | |
| open-mixtral-8x22b | 2024-04-17 | 9.45 | 0.34 | GPQA Diamond | Mistral | FALSE | Mixtral 8x22B | 2024-04-17 | Mistral AI | |
| Meta-Llama-3-70B-Instruct | 2024-04-18 | 16.13 | 0.41 | GPQA Diamond | Meta | FALSE | Llama 3-70B | 2024-04-18 | Meta AI | |
| Meta-Llama-3-8B-Instruct | 2024-04-18 | 11.28 | 0.26 | GPQA Diamond | Meta | FALSE | Llama 3-8B | 2024-04-18 | ||
| Yi-1.5-34B-Chat | 2024-05-13 | 30.66 | 0.32 | GPQA Diamond | Other | FALSE | Yi-1.5-34B | 2024-05-13 | 01.AI | |
| gpt-4o-2024-05-13 | 2024-05-13 | 10.01 | 0.49 | GPQA Diamond | OpenAI | FALSE | GPT-4o | 2024-05-13 | GPT-4o (May 2024) | OpenAI |
| gemini-1.5-flash-001 | 2024-05-23 | 2.33 | 0.40 | GPQA Diamond | TRUE | Gemini 1.5 Flash | 2024-05-23 | Gemini 1.5 Flash (May 2024) | Google DeepMind | |
| gemini-1.5-pro-001 | 2024-05-24 | 7.41 | 0.46 | GPQA Diamond | FALSE | Gemini 1.5 Pro | 2024-05-24 | Google DeepMind | ||
| qwen2-72b-instruct | 2024-06-07 | 42.08 | 0.41 | GPQA Diamond | Alibaba | FALSE | Qwen2-72B | 2024-06-07 | Alibaba | |
| Hermes-2-Theta-Llama-3-70B | 2024-06-20 | 15.11 | 0.38 | GPQA Diamond | Other | FALSE | Hermes 2 Theta Llama-3 70B | 2024-06-20 | Nous Research,Arcee AI | |
| claude-3-5-sonnet-20240620 | 2024-06-20 | 10.39 | 0.54 | GPQA Diamond | Anthropic | FALSE | Claude 3.5 Sonnet | 2024-06-20 | Claude 3.5 Sonnet (Jun 2024) | Anthropic |
| gemma-2-27b-it | 2024-06-24 | 24.28 | 0.37 | GPQA Diamond | FALSE | Gemma 2 27B | 2024-06-24 | Google DeepMind | ||
| gemma-2-9b-it | 2024-06-24 | 2.72 | 0.28 | GPQA Diamond | FALSE | Gemma 2 9B | 2024-06-24 | Google DeepMind | ||
| gpt-4o-mini-2024-07-18 | 2024-07-18 | 9.31 | 0.38 | GPQA Diamond | OpenAI | FALSE | GPT-4o mini | 2024-07-18 | OpenAI | |
| open-mistral-nemo-2407 | 2024-07-18 | 4.90 | 0.30 | GPQA Diamond | Mistral | FALSE | Mistral NeMo | 2024-07-18 | Mistral AI | |
| Llama-3.1-405B-Instruct | 2024-07-23 | 67.52 | 0.51 | GPQA Diamond | Meta | FALSE | Llama 3.1-405B | 2024-07-23 | Meta AI | |
| Llama-3.1-70B-Instruct | 2024-07-23 | 35.75 | 0.44 | GPQA Diamond | Meta | FALSE | Llama 3.1-70B | 2024-07-23 | ||
| Llama-3.1-8B-Instruct | 2024-07-23 | 12.71 | 0.26 | GPQA Diamond | Meta | FALSE | Llama 3.1-8B | 2024-07-23 | ||
| mistral-large-2407 | 2024-07-24 | 14.08 | 0.49 | GPQA Diamond | Mistral | FALSE | Mistral Large 2 | 2024-07-24 | Mistral AI | |
| gpt-4o-2024-08-06 | 2024-08-06 | 12.69 | 0.49 | GPQA Diamond | OpenAI | FALSE | GPT-4o | 2024-08-06 | GPT-4o (Aug 2024) | OpenAI |
| o1-preview-2024-09-12 | 2024-09-12 | 33.47 | 0.50 | GPQA Diamond | OpenAI | FALSE | o1-preview | 2024-09-12 | o1-preview | OpenAI |
| o1-mini-2024-09-12_high | 2024-09-12 | 15.61 | 0.62 | GPQA Diamond | OpenAI | FALSE | o1-mini | 2024-09-12 | o1-mini (high) | OpenAI |
| o1-mini-2024-09-12_medium | 2024-09-12 | 12.11 | 0.60 | GPQA Diamond | OpenAI | FALSE | o1-mini | 2024-09-12 | o1-mini (medium) | OpenAI |
| qwen2.5-32b-instruct | 2024-09-17 | 20.77 | 0.46 | GPQA Diamond | Alibaba | FALSE | Qwen2.5-32B | 2024-09-17 | Alibaba | |
| qwen2.5-72b-instruct | 2024-09-19 | 43.84 | 0.49 | GPQA Diamond | Alibaba | FALSE | Qwen2.5-72B | 2024-09-19 | Alibaba | |
| Llama-3.2-90B-Vision-Instruct | 2024-09-24 | 38.23 | 0.41 | GPQA Diamond | Meta | FALSE | Llama 3.2 90B | 2024-09-24 | Meta AI | |
| gemini-1.5-pro-002 | 2024-09-24 | 9.06 | 0.57 | GPQA Diamond | FALSE | Gemini 1.5 Pro | 2024-09-24 | Google DeepMind | ||
| gemini-1.5-flash-002 | 2024-09-24 | 3.18 | 0.47 | GPQA Diamond | TRUE | Gemini 1.5 Flash | 2024-09-24 | Google DeepMind | ||
| gemini-1.5-flash-8b-001 | 2024-10-03 | 3.79 | 0.33 | GPQA Diamond | FALSE | Gemini 1.5 Flash 8B | 2024-10-03 | Google DeepMind | ||
| ministral-8b-2410 | 2024-10-16 | 5.22 | 0.27 | GPQA Diamond | Mistral | FALSE | Ministral 8B | 2024-10-16 | Mistral AI | |
| ministral-3b-2410 | 2024-10-16 | 3.40 | 0.25 | GPQA Diamond | Mistral | FALSE | Ministral 3B | 2024-10-16 | Mistral AI | |
| claude-3-5-sonnet-20241022 | 2024-10-22 | 9.34 | 0.55 | GPQA Diamond | Anthropic | FALSE | Claude 3.5 Sonnet | 2024-10-22 | Claude 3.5 Sonnet (Oct 2024) | Anthropic |
| claude-3-5-haiku-20241022 | 2024-10-22 | 5.89 | 0.38 | GPQA Diamond | Anthropic | FALSE | Claude 3.5 Haiku | 2024-10-22 | Claude 3.5 Haiku (Oct 2024) | Anthropic |
| qwen-turbo-2024-11-01 | 2024-11-01 | 6.73 | 0.42 | GPQA Diamond | Alibaba | FALSE | Qwen Turbo | 2024-11-01 | Alibaba | |
| mistral-large-2411 | 2024-11-18 | 12.59 | 0.51 | GPQA Diamond | Mistral | FALSE | Mistral Large 2 | 2024-11-18 | Mistral AI | |
| gpt-4o-2024-11-20 | 2024-11-20 | 18.44 | 0.48 | GPQA Diamond | OpenAI | FALSE | GPT-4o | 2024-11-20 | GPT-4o (Nov 2024) | OpenAI |
| Llama-3.1-Tulu-3-70B-DPO | 2024-11-21 | 38.31 | 0.46 | GPQA Diamond | Other | FALSE | Tulu 3 (Tülu 3) 70B | 2024-11-21 | Allen Institute for AI,University of Washington | |
| Llama-3.3-70B-Instruct | 2024-12-06 | 20.36 | 0.47 | GPQA Diamond | Meta | FALSE | Llama 3.3 70B | 2024-12-06 | Meta AI | |
| grok-2-1212 | 2024-12-12 | 17.19 | 0.54 | GPQA Diamond | xAI | FALSE | Grok-2 | 2024-12-12 | xAI | |
| phi-4 | 2024-12-12 | 15.38 | 0.56 | GPQA Diamond | Other | FALSE | Phi-4 | 2024-12-12 | Microsoft Research | |
| o1-2024-12-17_high | 2024-12-17 | 69.64 | 0.77 | GPQA Diamond | OpenAI | FALSE | o1 | 2024-12-17 | o1 (high) | OpenAI |
| o1-2024-12-17_medium | 2024-12-17 | 52.89 | 0.76 | GPQA Diamond | OpenAI | FALSE | o1 | 2024-12-17 | o1 (medium) | OpenAI |
| DeepSeek-V3 | 2024-12-26 | 59.23 | 0.57 | GPQA Diamond | DeepSeek | FALSE | DeepSeek-V3 | 2024-12-26 | DeepSeek | |
| Eurus-2-7B-PRIME | 2024-12-31 | 19.36 | 0.34 | GPQA Diamond | Other | FALSE | Eurus-2-7B-PRIME | 2024-12-31 | Tsinghua University,University of Illinois Urbana-Champaign (UIUC),Shanghai AI Lab,Peking University,Shanghai Jiao Tong University,CUHK Shenzhen Research Institute | |
| DeepSeek-R1 | 2025-01-20 | 279.14 | 0.72 | GPQA Diamond | DeepSeek | FALSE | DeepSeek-R1 | 2025-01-20 | DeepSeek | |
| DeepSeek-R1-Distill-Qwen-14B | 2025-01-20 | 164.33 | 0.45 | GPQA Diamond | DeepSeek | FALSE | 2025-01-20 | |||
| DeepSeek-R1-Distill-Llama-70B | 2025-01-20 | 146.01 | 0.56 | GPQA Diamond | DeepSeek | FALSE | DeepSeek-R1-Distill-Llama-70B | 2025-01-20 | DeepSeek | |
| gemini-2.0-flash-thinking-exp-01-21 | 2025-01-21 | 25.04 | 0.57 | GPQA Diamond | FALSE | Gemini 2.0 Flash Thinking | 2025-01-21 | Gemini 2.0 Flash Thinking Exp | Google DeepMind,Google | |
| qwen-max-2025-01-25 | 2025-01-25 | 18.01 | 0.56 | GPQA Diamond | Alibaba | FALSE | Qwen2.5-Max | 2025-01-25 | Alibaba | |
| qwen-plus-2025-01-25 | 2025-01-25 | 9.11 | 0.48 | GPQA Diamond | Alibaba | FALSE | Qwen Plus | 2025-01-25 | Alibaba | |
| mistral-small-2501 | 2025-01-25 | 3.91 | 0.45 | GPQA Diamond | Mistral | FALSE | Mistral Small 3 | 2025-01-25 | Mistral AI | |
| o3-mini-2025-01-31_high | 2025-01-31 | 64.15 | 0.77 | GPQA Diamond | OpenAI | FALSE | o3-mini | 2025-01-31 | o3-mini (high) | OpenAI |
| o3-mini-2025-01-31_medium | 2025-01-31 | 18.51 | 0.74 | GPQA Diamond | OpenAI | TRUE | o3-mini | 2025-01-31 | o3-mini (medium) | OpenAI |
| gemini-2.0-pro-exp-02-05 | 2025-02-05 | 7.57 | 0.66 | GPQA Diamond | TRUE | Gemini 2.0 Pro | 2025-02-05 | Gemini 2.0 Pro Exp (Feb 2025) | Google DeepMind,Google | |
| gemini-2.0-flash-001 | 2025-02-05 | 6.13 | 0.64 | GPQA Diamond | TRUE | Gemini 2.0 Flash | 2025-02-05 | Gemini 2.0 Flash (Feb 2025) | Google DeepMind,Google | |
| claude-3-7-sonnet-20250219_64K | 2025-02-24 | 163.73 | 0.77 | GPQA Diamond | Anthropic | FALSE | Claude 3.7 Sonnet | 2025-02-24 | Claude 3.7 Sonnet (64k thinking) | Anthropic |
| claude-3-7-sonnet-20250219_32K | 2025-02-24 | 153.47 | 0.77 | GPQA Diamond | Anthropic | FALSE | Claude 3.7 Sonnet | 2025-02-24 | Claude 3.7 Sonnet (32k thinking) | Anthropic |
| claude-3-7-sonnet-20250219_16K | 2025-02-24 | 112.63 | 0.77 | GPQA Diamond | Anthropic | FALSE | Claude 3.7 Sonnet | 2025-02-24 | Claude 3.7 Sonnet (16k thinking) | Anthropic |
| claude-3-7-sonnet-20250219 | 2025-02-24 | 13.04 | 0.66 | GPQA Diamond | Anthropic | FALSE | Claude 3.7 Sonnet | 2025-02-24 | Anthropic | |
| gpt-4.5-preview-2025-02-27 | 2025-02-27 | 54.39 | 0.69 | GPQA Diamond | OpenAI | FALSE | GPT-4.5 | 2025-02-27 | GPT-4.5 Preview (Feb 2025) | OpenAI |
| gemma-3-27b-it | 2025-03-12 | 15.43 | 0.49 | GPQA Diamond | FALSE | Gemma 3 27B | 2025-03-12 | Google DeepMind | ||
| mistral-small-2503 | 2025-03-17 | 6.02 | 0.48 | GPQA Diamond | Mistral | FALSE | Mistral Small 3.1 | 2025-03-17 | Mistral AI | |
| DeepSeek-V3-0324 | 2025-03-24 | 39.95 | 0.68 | GPQA Diamond | DeepSeek | FALSE | DeepSeek-V3 | 2025-03-24 | DeepSeek-V3 (Mar 2025) | DeepSeek |
| gemini-2.5-pro-exp-03-25 | 2025-03-25 | 61.20 | 0.84 | GPQA Diamond | TRUE | Gemini 2.5 Pro | 2025-03-25 | Gemini 2.5 Pro Exp (Mar 2025) | Google DeepMind | |
| Llama-4-Scout-17B-16E-Instruct | 2025-04-05 | 17.46 | 0.52 | GPQA Diamond | Meta | FALSE | Llama 4 Scout | 2025-04-05 | Meta AI | |
| Llama-4-Maverick-17B-128E-Instruct-FP8 | 2025-04-05 | 11.51 | 0.67 | GPQA Diamond | Meta | TRUE | Llama 4 Maverick | 2025-04-05 | Llama 4 Maverick (FP8) | Meta AI |
| qwq-plus | 2025-04-08 | 219.18 | 0.65 | GPQA Diamond | Alibaba | FALSE | QWQ-Plus | 2025-04-08 | Alibaba | |
| grok-3-mini-beta_high | 2025-04-09 | 56.01 | 0.74 | GPQA Diamond | xAI | FALSE | Grok-3 mini | 2025-04-09 | xAI | |
| grok-3-beta | 2025-04-09 | 29.53 | 0.76 | GPQA Diamond | xAI | FALSE | Grok-3 | 2025-04-09 | xAI | |
| grok-3-mini-beta_low | 2025-04-09 | 23.63 | 0.76 | GPQA Diamond | xAI | TRUE | Grok-3 mini | 2025-04-09 | xAI | |
| gpt-4.1-2025-04-14 | 2025-04-14 | 10.13 | 0.67 | GPQA Diamond | OpenAI | TRUE | GPT-4.1 | 2025-04-14 | GPT-4.1 | OpenAI |
| gpt-4.1-mini-2025-04-14 | 2025-04-14 | 8.74 | 0.66 | GPQA Diamond | OpenAI | TRUE | GPT-4.1 mini | 2025-04-14 | GPT-4.1 mini | OpenAI |
| gpt-4.1-nano-2025-04-14 | 2025-04-14 | 5.58 | 0.49 | GPQA Diamond | OpenAI | TRUE | GPT-4.1 nano | 2025-04-14 | GPT-4.1 nano | OpenAI |
| o4-mini-2025-04-16_high | 2025-04-16 | 93.84 | 0.80 | GPQA Diamond | OpenAI | FALSE | o4-mini | 2025-04-16 | o4-mini (high) | OpenAI |
| o3-2025-04-16_high | 2025-04-16 | 91.54 | 0.82 | GPQA Diamond | OpenAI | FALSE | o3 | 2025-04-16 | o3 (high) | OpenAI |
| mistral-medium-2505 | 2025-05-07 | 17.39 | 0.60 | GPQA Diamond | Mistral | FALSE | Mistral Medium 3 | 2025-05-07 | Mistral AI | |
| gpt-4-0613 | 2023-06-13 | 12.42 | 0.23 | MATH Level 5 | OpenAI | FALSE | GPT-4 | 2023-06-13 | GPT-4 (Jun 2023) | OpenAI |
| claude-2.0 | 2023-07-11 | 10.80 | 0.12 | MATH Level 5 | Anthropic | FALSE | Claude 2 | 2023-07-11 | Anthropic | |
| gpt-3.5-turbo-1106 | 2023-11-06 | 3.00 | 0.16 | MATH Level 5 | OpenAI | FALSE | GPT-3.5 Turbo | 2023-11-06 | GPT-3.5 Turbo (Nov 2023) | OpenAI |
| gpt-4-1106-preview | 2023-11-06 | 21.95 | 0.40 | MATH Level 5 | OpenAI | FALSE | GPT-4 | 2023-11-06 | GPT-4 Preview (Nov 2023) | OpenAI |
| open-mixtral-8x7b | 2023-12-11 | 8.23 | 0.10 | MATH Level 5 | Mistral | FALSE | Mixtral 8x7B | 2023-12-11 | Mistral AI | |
| gpt-4-0125-preview | 2024-01-25 | 28.72 | 0.35 | MATH Level 5 | OpenAI | FALSE | GPT-4 | 2024-01-25 | OpenAI | |
| gpt-3.5-turbo-0125 | 2024-01-25 | 2.81 | 0.12 | MATH Level 5 | OpenAI | FALSE | GPT-3.5 Turbo | 2024-01-25 | OpenAI | |
| gemini-1.0-pro-001 | 2024-02-15 | 4.55 | 0.11 | MATH Level 5 | FALSE | Gemini 1.0 Pro | 2024-02-15 | Google DeepMind | ||
| mistral-large-2402 | 2024-02-26 | 15.55 | 0.25 | MATH Level 5 | Mistral | FALSE | Mistral Large | 2024-02-26 | Mistral AI | |
| claude-3-sonnet-20240229 | 2024-02-29 | 13.19 | 0.18 | MATH Level 5 | Anthropic | FALSE | Claude 3 Sonnet | 2024-02-29 | Anthropic | |
| claude-3-opus-20240229 | 2024-02-29 | 24.70 | 0.38 | MATH Level 5 | Anthropic | FALSE | Claude 3 Opus | 2024-02-29 | Anthropic | |
| claude-3-haiku-20240307 | 2024-03-07 | 10.89 | 0.15 | MATH Level 5 | Anthropic | FALSE | Claude 3 Haiku | 2024-03-07 | ||
| dbrx-instruct | 2024-03-27 | 143.23 | 0.12 | MATH Level 5 | Other | FALSE | DBRX | 2024-03-27 | Databricks | |
| gpt-4-turbo-2024-04-09 | 2024-04-09 | 29.79 | 0.47 | MATH Level 5 | OpenAI | FALSE | GPT-4 Turbo | 2024-04-09 | OpenAI | |
| WizardLM-2-8x22B | 2024-04-15 | 24.81 | 0.26 | MATH Level 5 | Other | FALSE | WizardLM-2 8x22B | 2024-04-15 | Microsoft | |
| open-mixtral-8x22b | 2024-04-17 | 11.27 | 0.24 | MATH Level 5 | Mistral | FALSE | Mixtral 8x22B | 2024-04-17 | Mistral AI | |
| Meta-Llama-3-70B-Instruct | 2024-04-18 | 22.82 | 0.23 | MATH Level 5 | Meta | FALSE | Llama 3-70B | 2024-04-18 | Meta AI | |
| Yi-1.5-34B-Chat | 2024-05-13 | 37.17 | 0.26 | MATH Level 5 | Other | FALSE | Yi-1.5-34B | 2024-05-13 | 01.AI | |
| gpt-4o-2024-05-13 | 2024-05-13 | 9.48 | 0.51 | MATH Level 5 | OpenAI | FALSE | GPT-4o | 2024-05-13 | GPT-4o (May 2024) | OpenAI |
| gemini-1.5-flash-001 | 2024-05-23 | 2.07 | 0.25 | MATH Level 5 | TRUE | Gemini 1.5 Flash | 2024-05-23 | Gemini 1.5 Flash (May 2024) | Google DeepMind | |
| gemini-1.5-pro-001 | 2024-05-24 | 8.75 | 0.41 | MATH Level 5 | FALSE | Gemini 1.5 Pro | 2024-05-24 | Google DeepMind | ||
| qwen2-72b-instruct | 2024-06-07 | 34.21 | 0.39 | MATH Level 5 | Alibaba | FALSE | Qwen2-72B | 2024-06-07 | Alibaba | |
| Hermes-2-Theta-Llama-3-70B | 2024-06-20 | 20.51 | 0.23 | MATH Level 5 | Other | FALSE | Hermes 2 Theta Llama-3 70B | 2024-06-20 | Nous Research,Arcee AI | |
| claude-3-5-sonnet-20240620 | 2024-06-20 | 12.94 | 0.52 | MATH Level 5 | Anthropic | FALSE | Claude 3.5 Sonnet | 2024-06-20 | Claude 3.5 Sonnet (Jun 2024) | Anthropic |
| gemma-2-9b-it | 2024-06-24 | 12.45 | 0.21 | MATH Level 5 | FALSE | Gemma 2 9B | 2024-06-24 | Google DeepMind | ||
| gemma-2-27b-it | 2024-06-24 | 17.05 | 0.28 | MATH Level 5 | FALSE | Gemma 2 27B | 2024-06-24 | Google DeepMind | ||
| open-mistral-nemo-2407 | 2024-07-18 | 5.34 | 0.11 | MATH Level 5 | Mistral | FALSE | Mistral NeMo | 2024-07-18 | Mistral AI | |
| gpt-4o-mini-2024-07-18 | 2024-07-18 | 14.64 | 0.53 | MATH Level 5 | OpenAI | FALSE | GPT-4o mini | 2024-07-18 | OpenAI | |
| Llama-3.1-405B-Instruct | 2024-07-23 | 23.42 | 0.50 | MATH Level 5 | Meta | FALSE | Llama 3.1-405B | 2024-07-23 | Meta AI | |
| Llama-3.1-70B-Instruct | 2024-07-23 | 194.69 | 0.37 | MATH Level 5 | Meta | FALSE | Llama 3.1-70B | 2024-07-23 | ||
| Llama-3.1-8B-Instruct | 2024-07-23 | 16.47 | 0.23 | MATH Level 5 | Meta | FALSE | Llama 3.1-8B | 2024-07-23 | ||
| mistral-large-2407 | 2024-07-24 | 17.75 | 0.45 | MATH Level 5 | Mistral | FALSE | Mistral Large 2 | 2024-07-24 | Mistral AI | |
| gpt-4o-2024-08-06 | 2024-08-06 | 15.65 | 0.53 | MATH Level 5 | OpenAI | FALSE | GPT-4o | 2024-08-06 | GPT-4o (Aug 2024) | OpenAI |
| o1-mini-2024-09-12_high | 2024-09-12 | 15.18 | 0.89 | MATH Level 5 | OpenAI | FALSE | o1-mini | 2024-09-12 | o1-mini (high) | OpenAI |
| o1-mini-2024-09-12_medium | 2024-09-12 | 10.76 | 0.84 | MATH Level 5 | OpenAI | TRUE | o1-mini | 2024-09-12 | o1-mini (medium) | OpenAI |
| o1-preview-2024-09-12 | 2024-09-12 | 42.64 | 0.82 | MATH Level 5 | OpenAI | FALSE | o1-preview | 2024-09-12 | o1-preview | OpenAI |
| qwen2.5-32b-instruct | 2024-09-17 | 24.57 | 0.56 | MATH Level 5 | Alibaba | FALSE | Qwen2.5-32B | 2024-09-17 | Alibaba | |
| qwen2.5-72b-instruct | 2024-09-19 | 40.02 | 0.63 | MATH Level 5 | Alibaba | FALSE | Qwen2.5-72B | 2024-09-19 | Alibaba | |
| gemini-1.5-pro-002 | 2024-09-24 | 11.55 | 0.70 | MATH Level 5 | FALSE | Gemini 1.5 Pro | 2024-09-24 | Google DeepMind | ||
| Llama-3.2-90B-Vision-Instruct | 2024-09-24 | 34.07 | 0.39 | MATH Level 5 | Meta | FALSE | Llama 3.2 90B | 2024-09-24 | Meta AI | |
| gemini-1.5-flash-002 | 2024-09-24 | 4.27 | 0.62 | MATH Level 5 | TRUE | Gemini 1.5 Flash | 2024-09-24 | Google DeepMind | ||
| ministral-8b-2410 | 2024-10-16 | 5.02 | 0.15 | MATH Level 5 | Mistral | FALSE | Ministral 8B | 2024-10-16 | Mistral AI | |
| ministral-3b-2410 | 2024-10-16 | 4.13 | 0.14 | MATH Level 5 | Mistral | FALSE | Ministral 3B | 2024-10-16 | Mistral AI | |
| claude-3-5-haiku-20241022 | 2024-10-22 | 6.90 | 0.46 | MATH Level 5 | Anthropic | FALSE | Claude 3.5 Haiku | 2024-10-22 | Claude 3.5 Haiku (Oct 2024) | Anthropic |
| claude-3-5-sonnet-20241022 | 2024-10-22 | 14.22 | 0.57 | MATH Level 5 | Anthropic | FALSE | Claude 3.5 Sonnet | 2024-10-22 | Claude 3.5 Sonnet (Oct 2024) | Anthropic |
| qwen-turbo-2024-11-01 | 2024-11-01 | 7.30 | 0.56 | MATH Level 5 | Alibaba | FALSE | Qwen Turbo | 2024-11-01 | Alibaba | |
| mistral-large-2411 | 2024-11-18 | 14.18 | 0.50 | MATH Level 5 | Mistral | FALSE | Mistral Large 2 | 2024-11-18 | Mistral AI | |
| gpt-4o-2024-11-20 | 2024-11-20 | 19.00 | 0.50 | MATH Level 5 | OpenAI | FALSE | GPT-4o | 2024-11-20 | GPT-4o (Nov 2024) | OpenAI |
| Llama-3.1-Tulu-3-70B-DPO | 2024-11-21 | 25.41 | 0.43 | MATH Level 5 | Other | FALSE | Tulu 3 (Tülu 3) 70B | 2024-11-21 | Allen Institute for AI,University of Washington | |
| Llama-3.3-70B-Instruct | 2024-12-06 | 24.58 | 0.42 | MATH Level 5 | Meta | FALSE | Llama 3.3 70B | 2024-12-06 | Meta AI | |
| phi-4 | 2024-12-12 | 21.98 | 0.65 | MATH Level 5 | Other | FALSE | Phi-4 | 2024-12-12 | Microsoft Research | |
| grok-2-1212 | 2024-12-12 | 47.80 | 0.64 | MATH Level 5 | xAI | FALSE | Grok-2 | 2024-12-12 | xAI | |
| o1-2024-12-17_medium | 2024-12-17 | 39.05 | 0.94 | MATH Level 5 | OpenAI | FALSE | o1 | 2024-12-17 | o1 (medium) | OpenAI |
| o1-2024-12-17_high | 2024-12-17 | 47.93 | 0.95 | MATH Level 5 | OpenAI | FALSE | o1 | 2024-12-17 | o1 (high) | OpenAI |
| DeepSeek-V3 | 2024-12-26 | 104.88 | 0.65 | MATH Level 5 | DeepSeek | FALSE | DeepSeek-V3 | 2024-12-26 | DeepSeek | |
| DeepSeek-R1-Distill-Qwen-14B | 2025-01-20 | 55.65 | 0.87 | MATH Level 5 | DeepSeek | FALSE | 2025-01-20 | |||
| DeepSeek-R1 | 2025-01-20 | 132.60 | 0.93 | MATH Level 5 | DeepSeek | FALSE | DeepSeek-R1 | 2025-01-20 | DeepSeek | |
| DeepSeek-R1-Distill-Llama-70B | 2025-01-20 | 68.77 | 0.90 | MATH Level 5 | DeepSeek | FALSE | DeepSeek-R1-Distill-Llama-70B | 2025-01-20 | DeepSeek | |
| qwen-plus-2025-01-25 | 2025-01-25 | 24.14 | 0.65 | MATH Level 5 | Alibaba | FALSE | Qwen Plus | 2025-01-25 | Alibaba | |
| qwen-max-2025-01-25 | 2025-01-25 | 29.36 | 0.67 | MATH Level 5 | Alibaba | FALSE | Qwen2.5-Max | 2025-01-25 | Alibaba | |
| mistral-small-2501 | 2025-01-25 | 4.65 | 0.45 | MATH Level 5 | Mistral | FALSE | Mistral Small 3 | 2025-01-25 | Mistral AI | |
| o3-mini-2025-01-31_high | 2025-01-31 | 25.00 | 0.97 | MATH Level 5 | OpenAI | TRUE | o3-mini | 2025-01-31 | o3-mini (high) | OpenAI |
| o3-mini-2025-01-31_medium | 2025-01-31 | 11.11 | 0.95 | MATH Level 5 | OpenAI | TRUE | o3-mini | 2025-01-31 | o3-mini (medium) | OpenAI |
| gemini-2.0-flash-001 | 2025-02-05 | 6.53 | 0.82 | MATH Level 5 | TRUE | Gemini 2.0 Flash | 2025-02-05 | Gemini 2.0 Flash (Feb 2025) | Google DeepMind,Google | |
| gemini-2.0-pro-exp-02-05 | 2025-02-05 | 9.00 | 0.84 | MATH Level 5 | TRUE | Gemini 2.0 Pro | 2025-02-05 | Gemini 2.0 Pro Exp (Feb 2025) | Google DeepMind,Google | |
| claude-3-7-sonnet-20250219_32K | 2025-02-24 | 140.26 | 0.90 | MATH Level 5 | Anthropic | FALSE | Claude 3.7 Sonnet | 2025-02-24 | Claude 3.7 Sonnet (32k thinking) | Anthropic |
| claude-3-7-sonnet-20250219_64K | 2025-02-24 | 152.58 | 0.91 | MATH Level 5 | Anthropic | FALSE | Claude 3.7 Sonnet | 2025-02-24 | Claude 3.7 Sonnet (64k thinking) | Anthropic |
| claude-3-7-sonnet-20250219 | 2025-02-24 | 15.83 | 0.68 | MATH Level 5 | Anthropic | FALSE | Claude 3.7 Sonnet | 2025-02-24 | Anthropic | |
| claude-3-7-sonnet-20250219_16K | 2025-02-24 | 109.73 | 0.86 | MATH Level 5 | Anthropic | FALSE | Claude 3.7 Sonnet | 2025-02-24 | Claude 3.7 Sonnet (16k thinking) | Anthropic |
| gpt-4.5-preview-2025-02-27 | 2025-02-27 | 74.19 | 0.79 | MATH Level 5 | OpenAI | FALSE | GPT-4.5 | 2025-02-27 | GPT-4.5 Preview (Feb 2025) | OpenAI |
| gemma-3-27b-it | 2025-03-12 | 23.46 | 0.74 | MATH Level 5 | FALSE | Gemma 3 27B | 2025-03-12 | Google DeepMind | ||
| mistral-small-2503 | 2025-03-17 | 7.16 | 0.47 | MATH Level 5 | Mistral | FALSE | Mistral Small 3.1 | 2025-03-17 | Mistral AI | |
| DeepSeek-V3-0324 | 2025-03-24 | 46.81 | 0.76 | MATH Level 5 | DeepSeek | FALSE | DeepSeek-V3 | 2025-03-24 | DeepSeek-V3 (Mar 2025) | DeepSeek |
| Llama-4-Scout-17B-16E-Instruct | 2025-04-05 | 24.90 | 0.62 | MATH Level 5 | Meta | FALSE | Llama 4 Scout | 2025-04-05 | Meta AI | |
| Llama-4-Maverick-17B-128E-Instruct-FP8 | 2025-04-05 | 11.39 | 0.73 | MATH Level 5 | Meta | FALSE | Llama 4 Maverick | 2025-04-05 | Llama 4 Maverick (FP8) | Meta AI |
| grok-3-beta | 2025-04-09 | 26.87 | 0.89 | MATH Level 5 | xAI | FALSE | Grok-3 | 2025-04-09 | xAI | |
| grok-3-mini-beta_low | 2025-04-09 | 20.47 | 0.91 | MATH Level 5 | xAI | FALSE | Grok-3 mini | 2025-04-09 | xAI | |
| grok-3-mini-beta_high | 2025-04-09 | 40.23 | 0.88 | MATH Level 5 | xAI | FALSE | Grok-3 mini | 2025-04-09 | xAI | |
| gpt-4.1-2025-04-14 | 2025-04-14 | 14.67 | 0.83 | MATH Level 5 | OpenAI | FALSE | GPT-4.1 | 2025-04-14 | GPT-4.1 | OpenAI |
| gpt-4.1-mini-2025-04-14 | 2025-04-14 | 13.41 | 0.87 | MATH Level 5 | OpenAI | FALSE | GPT-4.1 mini | 2025-04-14 | GPT-4.1 mini | OpenAI |
| gpt-4.1-nano-2025-04-14 | 2025-04-14 | 9.15 | 0.70 | MATH Level 5 | OpenAI | FALSE | GPT-4.1 nano | 2025-04-14 | GPT-4.1 nano | OpenAI |
| o4-mini-2025-04-16_high | 2025-04-16 | 37.48 | 0.98 | MATH Level 5 | OpenAI | FALSE | o4-mini | 2025-04-16 | o4-mini (high) | OpenAI |
| o3-2025-04-16_high | 2025-04-16 | 34.08 | 0.98 | MATH Level 5 | OpenAI | TRUE | o3 | 2025-04-16 | o3 (high) | OpenAI |
| gemini-2.5-pro-preview-05-06 | 2025-05-06 | 87.22 | 0.96 | MATH Level 5 | FALSE | Gemini 2.5 Pro | 2025-05-06 | Google DeepMind | ||
| mistral-medium-2505 | 2025-05-07 | 30.19 | 0.82 | MATH Level 5 | Mistral | FALSE | Mistral Medium 3 | 2025-05-07 | Mistral AI | |
| o4-mini-2025-04-16_high | 2025-04-16 | 144.47 | 0.82 | OTIS Mock AIME 2024-2025 | OpenAI | TRUE | o4-mini | 2025-04-16 | o4-mini (high) | OpenAI |
| qwen-max-2025-01-25 | 2025-01-25 | 39.62 | 0.16 | OTIS Mock AIME 2024-2025 | Alibaba | FALSE | Qwen2.5-Max | 2025-01-25 | Alibaba | |
| qwen-plus-2025-01-25 | 2025-01-25 | 32.60 | 0.18 | OTIS Mock AIME 2024-2025 | Alibaba | FALSE | Qwen Plus | 2025-01-25 | Alibaba | |
| grok-3-mini-beta_low | 2025-04-09 | 52.00 | 0.62 | OTIS Mock AIME 2024-2025 | xAI | TRUE | Grok-3 mini | 2025-04-09 | xAI | |
| mistral-medium-2505 | 2025-05-07 | 92.04 | 0.32 | OTIS Mock AIME 2024-2025 | Mistral | FALSE | Mistral Medium 3 | 2025-05-07 | Mistral AI | |
| DeepSeek-V3-0324 | 2025-03-24 | 94.29 | 0.38 | OTIS Mock AIME 2024-2025 | DeepSeek | FALSE | DeepSeek-V3 | 2025-03-24 | DeepSeek-V3 (Mar 2025) | DeepSeek |
| gpt-4.1-nano-2025-04-14 | 2025-04-14 | 19.49 | 0.29 | OTIS Mock AIME 2024-2025 | OpenAI | TRUE | GPT-4.1 nano | 2025-04-14 | GPT-4.1 nano | OpenAI |
| o1-mini-2024-09-12_medium | 2024-09-12 | 72.33 | 0.45 | OTIS Mock AIME 2024-2025 | OpenAI | FALSE | o1-mini | 2024-09-12 | o1-mini (medium) | OpenAI |
| gpt-4.5-preview-2025-02-27 | 2025-02-27 | 95.96 | 0.38 | OTIS Mock AIME 2024-2025 | OpenAI | FALSE | GPT-4.5 | 2025-02-27 | GPT-4.5 Preview (Feb 2025) | OpenAI |
| gemini-2.0-flash-001 | 2025-02-05 | 106.82 | 0.31 | OTIS Mock AIME 2024-2025 | FALSE | Gemini 2.0 Flash | 2025-02-05 | Gemini 2.0 Flash (Feb 2025) | Google DeepMind,Google | |
| DeepSeek-V3 | 2024-12-26 | 89.87 | 0.16 | OTIS Mock AIME 2024-2025 | DeepSeek | FALSE | DeepSeek-V3 | 2024-12-26 | DeepSeek | |
| claude-3-7-sonnet-20250219_32K | 2025-02-24 | 277.13 | 0.53 | OTIS Mock AIME 2024-2025 | Anthropic | FALSE | Claude 3.7 Sonnet | 2025-02-24 | Claude 3.7 Sonnet (32k thinking) | Anthropic |
| grok-2-1212 | 2024-12-12 | 115.44 | 0.12 | OTIS Mock AIME 2024-2025 | xAI | FALSE | Grok-2 | 2024-12-12 | xAI | |
| o3-mini-2025-01-31_medium | 2025-01-31 | 78.20 | 0.64 | OTIS Mock AIME 2024-2025 | OpenAI | TRUE | o3-mini | 2025-01-31 | o3-mini (medium) | OpenAI |
| o3-mini-2025-01-31_high | 2025-01-31 | 123.91 | 0.77 | OTIS Mock AIME 2024-2025 | OpenAI | TRUE | o3-mini | 2025-01-31 | o3-mini (high) | OpenAI |
| o1-2024-12-17_medium | 2024-12-17 | 118.64 | 0.73 | OTIS Mock AIME 2024-2025 | OpenAI | TRUE | o1 | 2024-12-17 | o1 (medium) | OpenAI |
| o1-preview-2024-09-12 | 2024-09-12 | 79.20 | 0.31 | OTIS Mock AIME 2024-2025 | OpenAI | FALSE | o1-preview | 2024-09-12 | o1-preview | OpenAI |
| gemini-1.5-pro-002 | 2024-09-24 | 125.53 | 0.23 | OTIS Mock AIME 2024-2025 | FALSE | Gemini 1.5 Pro | 2024-09-24 | Google DeepMind | ||
| phi-4 | 2024-12-12 | 33.02 | 0.14 | OTIS Mock AIME 2024-2025 | Other | FALSE | Phi-4 | 2024-12-12 | Microsoft Research | |
| o1-mini-2024-09-12_high | 2024-09-12 | 68.44 | 0.47 | OTIS Mock AIME 2024-2025 | OpenAI | FALSE | o1-mini | 2024-09-12 | o1-mini (high) | OpenAI |
| gemini-2.5-flash-preview-04-17 | 2025-04-17 | 127.29 | 0.73 | OTIS Mock AIME 2024-2025 | FALSE | Gemini 2.5 Flash | 2025-04-17 | Gemini 2.5 Flash Preview (Apr 2025) | Google DeepMind | |
| grok-3-mini-beta_high | 2025-04-09 | 137.31 | 0.78 | OTIS Mock AIME 2024-2025 | xAI | TRUE | Grok-3 mini | 2025-04-09 | xAI | |
| gpt-4.1-2025-04-14 | 2025-04-14 | 44.22 | 0.38 | OTIS Mock AIME 2024-2025 | OpenAI | FALSE | GPT-4.1 | 2025-04-14 | GPT-4.1 | OpenAI |
| claude-3-7-sonnet-20250219_64K | 2025-02-24 | 313.11 | 0.58 | OTIS Mock AIME 2024-2025 | Anthropic | FALSE | Claude 3.7 Sonnet | 2025-02-24 | Claude 3.7 Sonnet (64k thinking) | Anthropic |
| grok-3-beta | 2025-04-09 | 55.58 | 0.56 | OTIS Mock AIME 2024-2025 | xAI | FALSE | Grok-3 | 2025-04-09 | xAI | |
| gemini-2.0-flash-thinking-exp-01-21 | 2025-01-21 | 58.73 | 0.58 | OTIS Mock AIME 2024-2025 | FALSE | Gemini 2.0 Flash Thinking | 2025-01-21 | Gemini 2.0 Flash Thinking Exp | Google DeepMind,Google | |
| claude-3-7-sonnet-20250219_16K | 2025-02-24 | 185.67 | 0.47 | OTIS Mock AIME 2024-2025 | Anthropic | FALSE | Claude 3.7 Sonnet | 2025-02-24 | Claude 3.7 Sonnet (16k thinking) | Anthropic |
| claude-3-7-sonnet-20250219 | 2025-02-24 | 38.04 | 0.22 | OTIS Mock AIME 2024-2025 | Anthropic | FALSE | Claude 3.7 Sonnet | 2025-02-24 | Anthropic | |
| o3-2025-04-16_high | 2025-04-16 | 147.84 | 0.84 | OTIS Mock AIME 2024-2025 | OpenAI | TRUE | o3 | 2025-04-16 | o3 (high) | OpenAI |
| Llama-4-Maverick-17B-128E-Instruct-FP8 | 2025-04-05 | 16.22 | 0.21 | OTIS Mock AIME 2024-2025 | Meta | TRUE | Llama 4 Maverick | 2025-04-05 | Llama 4 Maverick (FP8) | Meta AI |
| DeepSeek-R1-Distill-Llama-70B | 2025-01-20 | 245.16 | 0.51 | OTIS Mock AIME 2024-2025 | DeepSeek | FALSE | DeepSeek-R1-Distill-Llama-70B | 2025-01-20 | DeepSeek | |
| gemma-3-27b-it | 2025-03-12 | 54.73 | 0.20 | OTIS Mock AIME 2024-2025 | FALSE | Gemma 3 27B | 2025-03-12 | Google DeepMind | ||
| gpt-4.1-mini-2025-04-14 | 2025-04-14 | 38.64 | 0.45 | OTIS Mock AIME 2024-2025 | OpenAI | TRUE | GPT-4.1 mini | 2025-04-14 | GPT-4.1 mini | OpenAI |
| gemini-1.5-flash-002 | 2024-09-24 | 56.82 | 0.16 | OTIS Mock AIME 2024-2025 | FALSE | Gemini 1.5 Flash | 2024-09-24 | Google DeepMind | ||
| DeepSeek-R1 | 2025-01-20 | 225.96 | 0.53 | OTIS Mock AIME 2024-2025 | DeepSeek | FALSE | DeepSeek-R1 | 2025-01-20 | DeepSeek | |
| claude-opus-4-20250514 | 2025-05-22 | 24.88 | 0.85 | MATH Level 5 | Anthropic | FALSE | Claude Opus 4 | 2025-05-22 | Anthropic | |
| claude-sonnet-4-20250514 | 2025-05-22 | 22.84 | 0.29 | OTIS Mock AIME 2024-2025 | Anthropic | FALSE | Claude Sonnet 4 | 2025-05-22 | Anthropic | |
| qwen3-235b-a22b | 2025-04-29 | 186.21 | 0.71 | GPQA Diamond | Alibaba | FALSE | Qwen3-235B-A22B | 2025-04-29 | Alibaba | |
| claude-sonnet-4-20250514_16K | 2025-05-22 | 165.18 | 0.53 | OTIS Mock AIME 2024-2025 | Anthropic | FALSE | Claude Sonnet 4 | 2025-05-22 | Anthropic | |
| claude-sonnet-4-20250514 | 2025-05-22 | 12.40 | 0.67 | GPQA Diamond | Anthropic | FALSE | Claude Sonnet 4 | 2025-05-22 | Anthropic | |
| claude-sonnet-4-20250514 | 2025-05-22 | 13.13 | 0.84 | MATH Level 5 | Anthropic | FALSE | Claude Sonnet 4 | 2025-05-22 | Anthropic | |
| claude-sonnet-4-20250514_32K | 2025-05-22 | 235.56 | 0.71 | OTIS Mock AIME 2024-2025 | Anthropic | FALSE | Claude Sonnet 4 | 2025-05-22 | Anthropic | |
| claude-opus-4-20250514_27K | 2025-05-22 | 337.82 | 0.64 | OTIS Mock AIME 2024-2025 | Anthropic | FALSE | Claude Opus 4 | 2025-05-22 | Anthropic | |
| DeepSeek-R1-0528 | 2025-05-28 | 367.73 | 0.66 | OTIS Mock AIME 2024-2025 | DeepSeek | FALSE | DeepSeek-R1 | 2025-05-28 | DeepSeek | |
| claude-sonnet-4-20250514_59K | 2025-05-22 | 134.78 | 0.79 | GPQA Diamond | Anthropic | FALSE | Claude Sonnet 4 | 2025-05-22 | Anthropic | |
| claude-opus-4-20250514 | 2025-05-22 | 21.68 | 0.69 | GPQA Diamond | Anthropic | FALSE | Claude Opus 4 | 2025-05-22 | Anthropic | |
| DeepSeek-R1-0528 | 2025-05-28 | 152.70 | 0.76 | GPQA Diamond | DeepSeek | FALSE | DeepSeek-R1 | 2025-05-28 | DeepSeek | |
| claude-sonnet-4-20250514_59K | 2025-05-22 | 340.31 | 0.69 | OTIS Mock AIME 2024-2025 | Anthropic | FALSE | Claude Sonnet 4 | 2025-05-22 | Anthropic | |
| DeepSeek-R1-0528 | 2025-05-28 | 163.48 | 0.97 | MATH Level 5 | DeepSeek | FALSE | DeepSeek-R1 | 2025-05-28 | DeepSeek | |
| qwen3-235b-a22b | 2025-04-29 | 147.64 | 0.69 | MATH Level 5 | Alibaba | FALSE | Qwen3-235B-A22B | 2025-04-29 | Alibaba | |
| claude-opus-4-20250514_16K | 2025-05-22 | 48.84 | 0.76 | GPQA Diamond | Anthropic | FALSE | Claude Opus 4 | 2025-05-22 | Anthropic | |
| claude-opus-4-20250514_16K | 2025-05-22 | 222.18 | 0.60 | OTIS Mock AIME 2024-2025 | Anthropic | FALSE | Claude Opus 4 | 2025-05-22 | Anthropic | |
| claude-sonnet-4-20250514_16K | 2025-05-22 | 44.43 | 0.76 | GPQA Diamond | Anthropic | FALSE | Claude Sonnet 4 | 2025-05-22 | Anthropic | |
| claude-opus-4-20250514 | 2025-05-22 | 37.22 | 0.42 | OTIS Mock AIME 2024-2025 | Anthropic | TRUE | Claude Opus 4 | 2025-05-22 | Anthropic | |
| claude-sonnet-4-20250514_32K | 2025-05-22 | 78.37 | 0.78 | GPQA Diamond | Anthropic | FALSE | Claude Sonnet 4 | 2025-05-22 | Anthropic |
LLM providers have several ways to balance performance against cost, such as model size, query batching, and quantization. Many of the models on the speed-accuracy trade-off frontiers appear to have been designed with efficiency in mind: over half of them are labeled turbo, flash, mini, or nano. The models on this frontier are mostly from two providers: OpenAI and Google.
Epoch's work is free to use, distribute, and reproduce provided the source and authors are credited under the Creative Commons BY license.
Learn more about this graph
Using Epoch’s internal benchmarking data, we measure the average time taken to answer a question across several benchmarks: GPQA Diamond, MATH Level 5, and OTIS Mock AIME 2024-2025. We plot this against each model’s accuracy on that benchmark. We focus on the Pareto frontier of models, i.e. those that are faster than all more accurate models, or more accurate than all faster models. We model the trade-off as an exponential decay in error rate with respect to the log of runtime. We observe a halving of error rate as being associated with a 6.0x, 1.7x, and 2.8x increase in runtime, respectively.
We also note that, of models appearing on at least one of these frontiers, 12/19 have “flash”, “mini”, or “nano” in their names. These generally correspond to smaller versions of larger models that are specifically optimized for speed and cost, using techniques like distillation.
Code for our analysis is available here.
Data
Data for runtime and accuracy comes from Epoch’s Benchmarking Hub. We focus on the benchmarks with highest coverage across models. These benchmarks all have a simple question-answering format which does not call for any agentic scaffolding or multi-turn interactions. Thus, runtime data reflects a single API call per sample. Models are typically sampled 8 times on GPQA Diamond and OTIS Mock AIME. Models are typically sampled 4 times on MATH Level 5, due to the larger size of this benchmark. In a few cases, due to cost or API instability, models are sampled only 1 time per question.
For GPQA Diamond, we filtered out models with accuracy lower than 25%, corresponding to random guessing. For the other benchmarks, we filtered out models with accuracy lower than 10%, representing a negligible degree of utility on the task.
Some reasoning models are offered with varying levels of “effort”. The same model run with a different effort level was considered a distinct evaluation for this analysis.
All together, this resulted in a dataset of the following size.
| Benchmark | Model Evaluation Runs |
|---|---|
| GPQA Diamond | 104 |
| MATH Level 5 | 90 |
| OTIS Mock AIME | 43 |
Analysis
We observe that choosing a model with 2x longer runtime cuts its error by about the same factor, regardless of initial runtime. To formalize this, we perform linear regressions for each benchmark, with the log of average question runtime as the independent variable and the negative of the log of the error rate as the dependent variable. We refer to this as the exponential decay fit. This model produces a good fit, although the sample size is small: see the first three columns in the table below.
We use bootstrap sampling (n=500) to assess sensitivity, fitting the exponential decay model to the frontier of each sample. The last column in the table below gives the median runtime multiplier needed to cut the error rate in half, together with its 90% bootstrap confidence interval (5th - 95th percentile).
| Benchmark | Observations at Frontier | R² | Runtime Increase (90% CI) |
|---|---|---|---|
| GPQA Diamond | 12 | 0.97 | 6.0x (5.3-11.3) |
| MATH Level 5 | 8 | 0.92 | 1.7x (1.5-2.4) |
| OTIS Mock AIME | 11 | 0.95 | 2.8x (2.4-3.3) |
We also evaluate using accuracy as the dependent variable, which we refer to as the log-linear fit. For MATH Level 5, the exponential decay fit yields significantly lower errors (paired t-test, p=0.04). This matches our expectations, given MATH Level 5’s increasing saturation: error rates compress as performance approaches 100%. For GPQA Diamond and OTIS Mock AIME 2024-2025 the two fits are not significantly different. The exponential decay fit is slightly better for GPQA Diamond whereas the log-linear fit is slightly better for OTIS Mock AIME 2024-2025.
Most of the current frontier models are provided by OpenAI and Google (15/19). To test for robustness, we filter out models from these providers and recompute the fit. The general pattern of an upward-sloping frontier remains, though, as the table below shows, R2’s are somewhat lower and the runtime increase factors are somewhat larger.
| Benchmark | Observations at Frontier | R² | Runtime Increase |
|---|---|---|---|
| GPQA Diamond | 10 | 0.88 | 8.9x |
| MATH Level 5 | 10 | 0.89 | 2.5x |
| OTIS Mock AIME | 5 | 0.97 | 3.0x |
Assumptions and limitations
This analysis uses data from model evaluations when they were run in the normal course of maintaining Epoch’s Benchmarking Hub. These runs have taken place on different dates over time: all took place in 2025, but not all on the same date. The date of each run can be found on the Benchmarking hub, in the started_at column.
Thus, the data is subject to an unknown amount of through-time variance, as providers may change the speed at which they serve a given model over time. We can get some sense of this from Artificial Analysis, which observes throughput speeds (tokens/second) 8 times daily and reports on the distribution of these observations over a three-month trailing window. For most models on the accuracy-speed frontier, the range from the 25th to 75th percentiles of these observations is between 10 and 50 tokens/second. There are two outliers: for o3-high, this range is 100 tokens/second, and for Llama 4 Maverick it is 150 tokens/second. Our analysis assumes that this through-time variance is not significant enough to invalidate the overall findings.




