The Known Good Updated 8 Oct 2026 Subscribe
Evaluations· Epoch AI· CC-BY 4.0· Known Good Index component

MATH Level 5

Hardest tier of the MATH dataset. Aggregated from Epoch AI's AI Benchmarking Hub (math_level_5.csv, column 'mean_score'), used under CC-BY 4.0. The Known Good aggregates published results; it runs no evaluations.

Publisher's page Licence & attribution How we use this score
97 models scored Higher is better Published by Epoch AI CC-BY 4.0
MATH Level 5

MATH Level 5 as measured and published by Epoch AI (CC-BY 4.0). Ingested, normalised only where it feeds an index, and never re-run by us. Higher is better.

⇩
98
98
98
98
98
97
97
96
96
96
96
95
95
93
91
91
90
90
89
89
87
87
💡
💡
💡
💡
💡 A lightbulb marks a model its provider publishes as a reasoning model
The Known Good
Every model we hold a MATH Level 5 score for
All 97 of 97 models
# Model Creator MATH Level 5 Known Good Index Measured
1 OpenAI: GPT-5 💡 OpenAI 98.1 77 8 Oct 2026
2 OpenAI: GPT-5 Mini 💡 OpenAI 97.8 66 8 Oct 2026
3 OpenAI: o4 Mini 💡 OpenAI 97.8 — 8 Oct 2026
4 OpenAI: o3 💡 OpenAI 97.8 72 8 Oct 2026
5 claude-sonnet-4-5-20250929 Anthropic 97.7 66 8 Oct 2026
6 Qwen: Qwen3 Max 💡 Alibaba 97.1 — 8 Oct 2026
7 DeepSeek: R1 0528 💡 DeepSeek 96.6 — 8 Oct 2026
8 OpenAI: o3 Mini 💡 OpenAI 96.5 86 8 Oct 2026
9 claude-haiku-4-5-20251001 Anthropic 96.4 67 8 Oct 2026
10 Google: Gemini 2.5 Pro Preview 05-06 💡 Google 95.9 — 8 Oct 2026
11 gemini-2.5-pro-preview-03-25 Google 95.6 — 8 Oct 2026
12 OpenAI: GPT-5 Nano 💡 OpenAI 95.2 68 8 Oct 2026
13 OpenAI: o1 💡 OpenAI 94.7 69 8 Oct 2026
14 DeepSeek: R1 💡 DeepSeek 93.1 75 8 Oct 2026
15 claude-3-7-sonnet-20250219_64K Anthropic 91.2 — 8 Oct 2026
16 grok-3-mini-beta xAI 90.9 — 8 Oct 2026
17 claude-3-7-sonnet-20250219 Anthropic 90.0 74 8 Oct 2026
18 DeepSeek: R1 Distill Llama 70B 💡 DeepSeek 89.9 63 8 Oct 2026
19 o1-mini OpenAI 89.2 65 8 Oct 2026
20 grok-3-beta xAI 88.7 — 8 Oct 2026
21 OpenAI: GPT-4.1 Mini OpenAI 87.3 — 8 Oct 2026
22 DeepSeek-R1-Distill-Qwen-14B DeepSeek 87.1 — 8 Oct 2026
23 claude-3-7-sonnet-20250219_16K Anthropic 86.3 — 8 Oct 2026
24 claude-opus-4-20250514 Anthropic 85.0 68 8 Oct 2026
25 claude-sonnet-4-20250514 Anthropic 84.4 — 8 Oct 2026
26 gemini-2.0-pro-exp-02-05 Google 83.5 74 8 Oct 2026
27 OpenAI: GPT-4.1 OpenAI 83.0 46 8 Oct 2026
28 gemini-2.0-flash-001 Google DeepMind,Google 82.2 61 8 Oct 2026
29 o1-preview OpenAI 81.6 — 8 Oct 2026
30 Mistral: Mistral Medium 3 Mistral 81.6 — 8 Oct 2026
31 gpt-4.5-preview OpenAI 78.6 54 8 Oct 2026
32 DeepSeek: DeepSeek V3 0324 DeepSeek 75.5 64 8 Oct 2026
33 Google: Gemma 3 27B Google 74.0 47 8 Oct 2026
34 Llama-4-Maverick-17B-128E-Instruct-FP8 Meta 73.0 — 8 Oct 2026
35 gemini-1.5-pro-002 Google 70.4 — 8 Oct 2026
36 OpenAI: GPT-4.1 Nano OpenAI 70.0 — 8 Oct 2026
37 Qwen: Qwen3 235B A22B 💡 Alibaba 68.9 — 8 Oct 2026
38 qwen-max Alibaba 67.2 — 8 Oct 2026
39 Qwen: Qwen-Plus 💡 Alibaba 65.3 — 8 Oct 2026
40 Microsoft: Phi 4 Microsoft 64.9 41 8 Oct 2026
41 DeepSeek: DeepSeek V3 DeepSeek 64.9 62 8 Oct 2026
42 grok-2-1212 xAI 63.5 45 8 Oct 2026
43 Qwen2.5 72B Instruct Alibaba 63.2 — 8 Oct 2026
44 Llama-4-Scout-17B-16E-Instruct Meta 62.3 — 8 Oct 2026
45 gemini-1.5-flash-002 Google 61.9 — 8 Oct 2026
46 claude-3-5-sonnet-20241022 Anthropic 56.9 45 8 Oct 2026
47 qwen-turbo Alibaba 56.2 — 8 Oct 2026
48 qwen2.5-32b-instruct Alibaba 56.1 — 8 Oct 2026
49 OpenAI: GPT-4o OpenAI 53.3 27 8 Oct 2026
50 OpenAI: GPT-4o-mini OpenAI 52.6 31 8 Oct 2026
51 claude-3-5-sonnet-20240620 Anthropic 51.7 — 8 Oct 2026
52 mistral-large-2411 Mistral 50.3 37 8 Oct 2026
53 Llama-3.1-405B-Instruct Meta 49.8 — 8 Oct 2026
54 mistral-small-2503 Mistral 46.8 33 8 Oct 2026
55 OpenAI: GPT-4 Turbo OpenAI 46.7 — 8 Oct 2026
56 claude-3-5-haiku-20241022 Anthropic 46.4 30 8 Oct 2026
57 Mistral Large 2407 Mistral 44.8 — 8 Oct 2026
58 mistral-small-2501 Mistral 44.8 31 8 Oct 2026
59 Llama-3.1-Tulu-3-70B-DPO Allen Institute for AI,University of Washington 42.7 — 8 Oct 2026
60 Meta: Llama 3.3 70B Instruct Meta 41.6 34 8 Oct 2026
61 gemini-1.5-pro-001 Google 40.7 — 8 Oct 2026
62 gpt-4-1106-preview OpenAI 40.0 — 8 Oct 2026
63 Llama-3.2-90B-Vision-Instruct Meta 39.4 — 8 Oct 2026
64 qwen2-72b-instruct Alibaba 39.1 — 8 Oct 2026
65 claude-3-opus-20240229 Anthropic 37.5 32 8 Oct 2026
66 Meta: Llama 3.1 70B Instruct Meta 36.7 — 8 Oct 2026
67 gpt-4-0125-preview OpenAI 35.4 — 8 Oct 2026
68 Google: Gemma 2 27B Google 27.9 21 8 Oct 2026
69 WizardLM-2 8x22B Microsoft 25.7 — 8 Oct 2026
70 Yi-1.5-34B-Chat 01.AI 25.5 — 8 Oct 2026
71 gemini-1.5-flash-001 Google 25.1 — 8 Oct 2026
72 mistral-large-2402 Mistral 24.5 — 8 Oct 2026
73 open-mixtral-8x22b Mistral 24.2 — 8 Oct 2026
74 gpt-4-0613 OpenAI 23.0 — 8 Oct 2026
75 Meta: Llama 3.1 8B Instruct 💡 Meta 22.9 — 8 Oct 2026
76 Hermes-2-Theta-Llama-3-70B Nous Research,Arcee AI 22.7 — 8 Oct 2026
77 Meta-Llama-3-70B-Instruct Meta 22.6 — 8 Oct 2026
78 gemma-2-9b-it Google 21.0 13 8 Oct 2026
79 claude-3-sonnet-20240229 Anthropic 18.2 — 8 Oct 2026
80 Phi-3-medium-128k-instruct Microsoft 17.6 — 8 Oct 2026
81 gpt-3.5-turbo-1106 OpenAI 15.9 — 8 Oct 2026
82 ministral-8b-2410 Mistral 14.9 — 8 Oct 2026
83 Anthropic: Claude 3 Haiku Anthropic 14.9 — 8 Oct 2026
84 ministral-3b-2410 Mistral 14.4 — 8 Oct 2026
85 claude-2.0 Anthropic 11.7 — 8 Oct 2026
86 dbrx-instruct Databricks 11.7 — 8 Oct 2026
87 gpt-3.5-turbo-0125 OpenAI 11.6 — 8 Oct 2026
88 gemini-1.0-pro-001 Google 11.2 — 8 Oct 2026
89 open-mistral-nemo-2407 Mistral 10.8 — 8 Oct 2026
90 open-mixtral-8x7b Mistral 10.0 — 8 Oct 2026
91 Mixtral-8x7B-Instruct-v0.1 Mistral 9.3 — 8 Oct 2026
92 deepseek-llm-67b-chat DeepSeek 6.4 — 8 Oct 2026
93 Meta-Llama-3-8B-Instruct Meta 6.1 — 8 Oct 2026
94 Yi-34B-Chat 01.AI 5.1 — 8 Oct 2026
95 open-mistral-7b Mistral 3.7 — 8 Oct 2026
96 Mistral-7B-Instruct-v0.3 Mistral 3.6 — 8 Oct 2026
97 Llama-2-70b-chat-hf Meta 3.3 — 8 Oct 2026
The Known Good
Provenance. These figures are published by Epoch AI and redistributed here under CC-BY 4.0. The publisher's own page is here. We did not run this evaluation and we do not adjust the published numbers — where a score feeds an index it is min-max normalised against every other model holding the same evaluation, and nothing else is done to it. This evaluation is one of the seven components of the Known Good Index. Full licence detail is on attribution, and every score here is in the CSV download.