The Known Good Updated 29 Jul 2026
Evaluations· Epoch AI· CC-BY 4.0· Known Good Index component

GPQA Diamond

Graduate-level science questions written to be Google-proof. Aggregated from Epoch AI's AI Benchmarking Hub (gpqa_diamond.csv, column 'mean_score'), used under CC-BY 4.0. The Known Good aggregates published results; it runs no evaluations.

Publisher's page Licence & attribution How we use this score
174 models scored Higher is better Published by Epoch AI CC-BY 4.0
GPQA Diamond

GPQA Diamond as measured and published by Epoch AI (CC-BY 4.0). Ingested, normalised only where it feeds an index, and never re-run by us. Higher is better.

💡 A lightbulb marks a model its provider publishes as a reasoning model
The Known Good
Every model we hold a GPQA Diamond score for
All 174 of 174 models
# Model Creator GPQA Diamond Known Good Index Measured
1 OpenAI: GPT-5.4 Pro 💡 OpenAI 94.6 29 Jul 2026
2 Google: Gemini 3.1 Pro Preview 💡 Google 94.1 96 29 Jul 2026
3 gpt-5.5-pre-release OpenAI 94.0 98 29 Jul 2026
4 gpt-5.5-pro-pre-release OpenAI 93.9 29 Jul 2026
5 Claude Opus 5 💡 Anthropic 93.9 29 Jul 2026
6 OpenAI: GPT-5.6 Sol 💡 OpenAI 93.5 29 Jul 2026
7 xAI: Grok 4.5 💡 xAI 93.4 29 Jul 2026
8 OpenAI: GPT-5.6 Terra 💡 OpenAI 93.3 29 Jul 2026
9 OpenAI: GPT-5.4 💡 OpenAI 93.3 90 29 Jul 2026
10 MoonshotAI: Kimi K3 💡 Moonshot AI 93.1 29 Jul 2026
11 Google: Gemini 3.5 Flash 💡 Google 92.8 95 29 Jul 2026
12 gemini-3-pro-preview Google 92.6 83 29 Jul 2026
13 Z.ai: GLM 5.2 💡 Z.ai 91.9 91 29 Jul 2026
14 OpenAI: GPT-5.6 Luna 💡 OpenAI 91.6 29 Jul 2026
15 Qwen: Qwen3.7 Max 💡 Alibaba 91.6 93 29 Jul 2026
16 OpenAI: GPT-5.2 💡 OpenAI 91.4 80 29 Jul 2026
17 Anthropic: Claude Opus 4.8 💡 Anthropic 91.0 29 Jul 2026
18 MoonshotAI: Kimi K2.6 💡 Moonshot AI 90.8 93 29 Jul 2026
19 OpenAI: GPT-5.5 💡 OpenAI 90.7 29 Jul 2026
20 Anthropic: Claude Sonnet 5 💡 Anthropic 90.5 29 Jul 2026
21 Anthropic: Claude Opus 4.6 💡 Anthropic 90.5 88 29 Jul 2026
22 Anthropic: Claude Opus 4.7 💡 Anthropic 90.2 94 29 Jul 2026
23 muse-spark Meta 89.8 29 Jul 2026
24 DeepSeek: DeepSeek V4 Pro 💡 DeepSeek 89.6 93 29 Jul 2026
25 MoonshotAI: Kimi K2.7 Code 💡 Moonshot AI 89.5 29 Jul 2026
26 grok-4.20-0309-reasoning xAI 89.3 29 Jul 2026
27 Qwen: Qwen3.6 Max Preview 💡 Alibaba 89.1 90 29 Jul 2026
28 xAI: Grok 4.3 💡 xAI 88.8 29 Jul 2026
29 claude-opus-4-6_64K Anthropic 88.8 29 Jul 2026
30 Z.ai: GLM 5 💡 Z.ai 87.8 77 29 Jul 2026
31 OpenAI: GPT-5.1 💡 OpenAI 87.6 74 29 Jul 2026
32 fireworks/kimi-k2p5 Moonshot AI 87.6 29 Jul 2026
33 Qwen: Qwen3.6 Plus 💡 Alibaba 87.4 78 29 Jul 2026
34 Anthropic: Claude Sonnet 4.6 💡 Anthropic 87.4 80 29 Jul 2026
35 grok-4-0709 xAI 87.0 67 29 Jul 2026
36 gemini-3.5-flash_minimal Google 86.4 29 Jul 2026
37 OpenAI: GPT-5 💡 OpenAI 86.2 78 29 Jul 2026
38 claude-opus-4-5-20251101 Anthropic 86.0 72 29 Jul 2026
39 Z.ai: GLM 5.1 💡 Z.ai 85.5 88 29 Jul 2026
40 claude-opus-4-5-20251101_16K Anthropic 85.5 29 Jul 2026
41 Google: Gemini 2.5 Pro 💡 Google 85.3 64 29 Jul 2026
42 Google: Gemini 2.5 Pro Preview 06-05 💡 Google 84.8 29 Jul 2026
43 Qwen: Qwen3.6 Flash 💡 Alibaba 84.4 29 Jul 2026
44 kimi-k2-thinking-turbo Moonshot AI 84.2 29 Jul 2026
45 qwen3.5-plus Alibaba 84.2 29 Jul 2026
46 Qwen: Qwen3.5-Flash 💡 Alibaba 83.8 29 Jul 2026
47 gemini-2.5-pro-exp-03-25 Google 83.8 29 Jul 2026
48 OpenAI: GPT-5.4 Mini 💡 OpenAI 83.6 29 Jul 2026
49 deepseek-reasoner DeepSeek 83.4 29 Jul 2026
50 Z.ai: GLM 4.7 💡 Z.ai 83.3 68 29 Jul 2026
51 Google: Gemini 3 Flash Preview 💡 Google 83.2 83 29 Jul 2026
52 claude-sonnet-4-5-20250929_59K Anthropic 82.3 29 Jul 2026
53 OpenAI: o3 💡 OpenAI 81.8 74 29 Jul 2026
54 claude-sonnet-4-5-20250929 Anthropic 81.7 66 29 Jul 2026
55 Qwen: Qwen3 235B A22B Thinking 2507 💡 Alibaba 80.1 29 Jul 2026
56 OpenAI: o4 Mini 💡 OpenAI 79.6 29 Jul 2026
57 claude-sonnet-4-5-20250929_16K Anthropic 78.8 29 Jul 2026
58 claude-3-7-sonnet-20250219_64K Anthropic 78.5 29 Jul 2026
59 OpenAI: GPT-5.4 Nano 💡 OpenAI 78.5 29 Jul 2026
60 claude-sonnet-4-20250514 Anthropic 78.3 29 Jul 2026
61 claude-sonnet-4-20250514_59K Anthropic 77.8 29 Jul 2026
62 claude-opus-4-1-20250805_16K Anthropic 77.3 29 Jul 2026
63 OpenAI: o3 Mini 💡 OpenAI 77.0 86 29 Jul 2026
64 OpenAI: o1 💡 OpenAI 76.8 70 29 Jul 2026
65 claude-opus-4-1-20250805_27K Anthropic 76.8 29 Jul 2026
66 claude-3-7-sonnet-20250219 Anthropic 76.8 74 29 Jul 2026
67 claude-3-7-sonnet-20250219_16K Anthropic 76.8 29 Jul 2026
68 DeepSeek: R1 0528 💡 DeepSeek 76.3 25 Jul 2026
69 deepseek-r1-0528 DeepSeek 76.3 29 Jul 2026
70 grok-3-mini-beta xAI 76.3 29 Jul 2026
71 claude-opus-4-20250514_16K Anthropic 76.3 29 Jul 2026
72 OpenAI: gpt-oss-120b 💡 OpenAI 75.8 61 29 Jul 2026
73 claude-sonnet-4-20250514_16K Anthropic 75.8 29 Jul 2026
74 OpenAI: GPT-5 Mini 💡 OpenAI 75.0 67 29 Jul 2026
75 gpt-5.4-2026-03-05_none OpenAI 74.7 29 Jul 2026
76 claude-opus-4-1-20250805 Anthropic 73.2 49 29 Jul 2026
77 gpt-5.2-2025-12-11_none OpenAI 73.2 29 Jul 2026
78 Qwen: Qwen3 Max 💡 Alibaba 72.6 29 Jul 2026
79 gpt-5-2025-08-07_minimal OpenAI 71.7 29 Jul 2026
80 DeepSeek: DeepSeek V3 DeepSeek 71.2 62 29 Jul 2026
81 claude-haiku-4-5-20251001 Anthropic 71.2 67 29 Jul 2026
82 Qwen: Qwen3 235B A22B 💡 Alibaba 70.7 29 Jul 2026
83 OpenAI: GPT-5 Nano 💡 OpenAI 69.4 67 29 Jul 2026
84 DeepSeek: R1 💡 DeepSeek 69.2 75 25 Jul 2026
85 deepseek-r1 DeepSeek 69.2 75 29 Jul 2026
86 claude-opus-4-20250514 Anthropic 69.2 68 29 Jul 2026
87 gpt-4.5-preview OpenAI 68.7 54 29 Jul 2026
88 DeepSeek: DeepSeek V3 0324 DeepSeek 67.6 64 29 Jul 2026
89 grok-3-beta xAI 67.6 29 Jul 2026
90 Llama-4-Maverick-17B-128E-Instruct-FP8 Meta 67.0 29 Jul 2026
91 OpenAI: GPT-4.1 OpenAI 66.9 46 29 Jul 2026
92 Google: Gemini 2.5 Pro Preview 05-06 💡 Google 66.7 29 Jul 2026
93 OpenAI: GPT-4.1 Mini OpenAI 65.8 29 Jul 2026
94 gemini-2.0-pro-exp-02-05 Google 65.7 73 29 Jul 2026
95 qwq-plus Alibaba 65.4 29 Jul 2026
96 gemini-2.0-flash-001 Google DeepMind,Google 64.1 61 29 Jul 2026
97 o1-mini OpenAI 62.4 64 29 Jul 2026
98 mistral-medium-2505 Mistral 59.5 29 Jul 2026
99 gemini-1.5-pro-002 Google 57.2 29 Jul 2026
100 gemini-2.0-flash-thinking-exp-01-21 Google DeepMind,Google 57.1 62 29 Jul 2026
101 qwen-max Alibaba 56.1 29 Jul 2026
102 Microsoft: Phi 4 Microsoft 56.1 41 29 Jul 2026
103 DeepSeek: R1 Distill Llama 70B 💡 DeepSeek 55.7 62 29 Jul 2026
104 claude-3-5-sonnet-20241022 Anthropic 55.3 45 29 Jul 2026
105 claude-3-5-sonnet-20240620 Anthropic 54.0 29 Jul 2026
106 grok-2-1212 xAI 53.8 45 29 Jul 2026
107 Llama-4-Scout-17B-16E-Instruct Meta 51.8 29 Jul 2026
108 mistral-large-2411 Mistral 51.3 37 29 Jul 2026
109 Llama-3.1-405B-Instruct Meta 50.9 29 Jul 2026
110 o1-preview OpenAI 50.3 29 Jul 2026
111 OpenAI: GPT-4o OpenAI 49.2 26 29 Jul 2026
112 Qwen2.5 72B Instruct Alibaba 49.1 29 Jul 2026
113 Mistral Large 2407 Mistral 49.0 29 Jul 2026
114 OpenAI: GPT-4.1 Nano OpenAI 48.9 29 Jul 2026
115 Google: Gemma 3 27B Google 48.9 46 25 Jul 2026
116 gemma-3-27b-it Google 48.9 46 29 Jul 2026
117 gpt-5-nano-2025-08-07_minimal OpenAI 48.5 29 Jul 2026
118 magistral-small-2506 Mistral 48.4 29 Jul 2026
119 Qwen: Qwen-Plus 💡 Alibaba 48.1 29 Jul 2026
120 mistral-small-2503 Mistral 47.5 33 29 Jul 2026
121 Meta: Llama 3.3 70B Instruct Meta 47.4 34 29 Jul 2026
122 gemini-1.5-flash-002 Google 47.3 29 Jul 2026
123 claude-3-opus-20240229 Anthropic 47.2 32 29 Jul 2026
124 OpenAI: GPT-4 Turbo OpenAI 46.6 29 Jul 2026
125 Llama-3.1-Tulu-3-70B-DPO Allen Institute for AI,University of Washington 46.3 29 Jul 2026
126 qwen2.5-32b-instruct Alibaba 46.1 29 Jul 2026
127 gemini-1.5-pro-001 Google 45.9 29 Jul 2026
128 mistral-small-2501 Mistral 45.3 31 29 Jul 2026
129 DeepSeek-R1-Distill-Qwen-14B DeepSeek 44.7 29 Jul 2026
130 Meta: Llama 3.1 70B Instruct Meta 44.2 29 Jul 2026
131 WizardLM-2 8x22B Microsoft 43.4 29 Jul 2026
132 gpt-4-1106-preview OpenAI 42.4 29 Jul 2026
133 gpt-4-0125-preview OpenAI 42.3 29 Jul 2026
134 qwen-turbo Alibaba 41.8 29 Jul 2026
135 Llama-3.2-90B-Vision-Instruct Meta 41.0 29 Jul 2026
136 qwen2-72b-instruct Alibaba 40.8 29 Jul 2026
137 claude-3-sonnet-20240229 Anthropic 40.6 29 Jul 2026
138 Meta-Llama-3-70B-Instruct Meta 40.6 29 Jul 2026
139 gemini-1.5-flash-001 Google 40.4 29 Jul 2026
140 mistral-large-2402 Mistral 38.8 29 Jul 2026
141 claude-3-5-haiku-20241022 Anthropic 38.1 29 29 Jul 2026
142 OpenAI: GPT-4o-mini OpenAI 37.7 30 29 Jul 2026
143 Hermes-2-Theta-Llama-3-70B Nous Research,Arcee AI 37.5 29 Jul 2026
144 Google: Gemma 2 27B Google 36.5 21 25 Jul 2026
145 gemma-2-27b-it Google 36.5 21 29 Jul 2026
146 claude-3-haiku-20240307 Anthropic 36.3 29 Jul 2026
147 gpt-4-0314 OpenAI 35.7 29 Jul 2026
148 claude-2.0 Anthropic 34.7 29 Jul 2026
149 open-mixtral-8x22b Mistral 34.1 29 Jul 2026
150 gemini-1.0-pro-001 Google 34.0 29 Jul 2026
151 Eurus-2-7B-PRIME Tsinghua University,University of Illinois Urbana-Champaign (UIUC),Shanghai AI Lab,Peking University,Shanghai Jiao Tong University,CUHK Shenzhen Research Institute 33.9 29 Jul 2026
152 gemini-1.5-flash-8b-001 Google 33.0 29 Jul 2026
153 claude-2.1 Anthropic 33.0 29 Jul 2026
154 dbrx-instruct Databricks 32.9 29 Jul 2026
155 Yi-1.5-34B-Chat 01.AI 32.0 29 Jul 2026
156 qwen1.5-32b-chat Alibaba 30.7 29 Jul 2026
157 gpt-4-0613 OpenAI 30.7 29 Jul 2026
158 Mixtral-8x7B-Instruct-v0.1 Mistral 30.6 29 Jul 2026
159 open-mistral-nemo-2407 Mistral 29.9 29 Jul 2026
160 open-mixtral-8x7b Mistral 29.8 29 Jul 2026
161 qwen1.5-72b-chat Alibaba 28.8 29 Jul 2026
162 gpt-3.5-turbo-1106 OpenAI 28.0 29 Jul 2026
163 Phi-3-medium-128k-instruct Microsoft 27.6 29 Jul 2026
164 gemma-2-9b-it Google 27.5 12 29 Jul 2026
165 gpt-3.5-turbo-0125 OpenAI 27.2 29 Jul 2026
166 ministral-8b-2410 Mistral 27.1 29 Jul 2026
167 Llama-2-70b-chat-hf Meta 26.3 29 Jul 2026
168 Meta-Llama-3-8B-Instruct Meta 26.1 29 Jul 2026
169 Meta: Llama 3.1 8B Instruct Meta 25.9 29 Jul 2026
170 ministral-3b-2410 Mistral 25.3 29 Jul 2026
171 deepseek-llm-67b-chat DeepSeek 24.6 29 Jul 2026
172 Mistral-7B-Instruct-v0.3 Mistral 15.2 29 Jul 2026
173 Yi-34B-Chat 01.AI 14.7 29 Jul 2026
174 open-mistral-7b Mistral 13.2 29 Jul 2026
The Known Good
Provenance. These figures are published by Epoch AI and redistributed here under CC-BY 4.0. The publisher's own page is here. We did not run this evaluation and we do not adjust the published numbers — where a score feeds an index it is min-max normalised against every other model holding the same evaluation, and nothing else is done to it. This evaluation is one of the seven components of the Known Good Index. Full licence detail is on attribution, and every score here is in the CSV download.