llmboard.aiLeaderboard Center
Overall
Overall RankingOpen Models
Tools
Model DirectoryCompare Models
Capabilities
CodingReasoningMathKnowledgeInstruction Following
Price & Efficiency
Price & ValueCapability vs. PriceRuntime Performance
Modalities
Image GenerationVideo GenerationSpeech ModelsEmbeddings
Core Benchmarks
GPQAMMLU-ProAIME 2025SWE-Bench VerifiedMMLUHumanity's Last ExamLiveCodeBenchMATHHumanEvalMMMU-ProView all benchmarks
Methods
Scoring & Data
393 models668 benchmarks

Leaderboard Center

Overall RankingCodingCore BenchmarksPrice & ValueRuntime Performance

Modalities

All ModelsImage GenerationImage EditingVideo GenerationImage-to-VideoVideo EditingText-to-SpeechSpeech-to-TextEmbeddings

Data & Methods

Scoring MethodAll BenchmarksReasoningMath

Vendors

All VendorsOpenAIAnthropicGoogle
llmboard.aiCopyright 2026 llmboard.ai

physics benchmark

GPQA

A challenging dataset of 448 multiple-choice questions written by domain experts in biology, physics, and chemistry. Questions are Google-proof and extremely difficult, with PhD experts reaching 65% accuracy.

Updated Aug 11, 2026

Models100
Model coverage234
MetricScore
EvidenceC

On this page

  • Ranking
  • Distribution
  • Highlights
  • About
  • FAQ

GPQA Ranking

Higher score ranks better on this benchmark.

100 rows
Columns

Show columns

01ANClaude Mythos PreviewAnthropic94.6%100.0%234CAug 11, 2026
02OPGPT-5.6 SolOpenAI94.6%99.6%234CAug 11, 2026
03GOGemini 3.1 ProGoogle94.3%99.1%234CAug 11, 2026
04ANClaude Opus 4.7Anthropic94.2%98.7%234CAug 11, 2026
05ANClaude Opus 4.8Anthropic93.6%98.3%234CAug 11, 2026
06OPGPT-5.5OpenAI93.6%97.8%234CAug 11, 2026
07MAKimi K3Moonshot AI93.5%97.4%234CAug 11, 2026
08OPGPT-5.2 ProOpenAI93.2%97.0%234CAug 11, 2026
09XAGrok 4.5xAI93.0%96.6%234BAug 11, 2026
10OPGPT-5.6 TerraOpenAI92.9%96.1%234CAug 11, 2026
11OPGPT-5.4OpenAI92.8%95.7%234CAug 11, 2026
12ACQwen3.8 MaxAlibaba Cloud / Qwen Team92.6%95.3%234CAug 11, 2026
13OPGPT-5.2OpenAI92.4%94.8%234CAug 11, 2026
14ACQwen3.7 MaxAlibaba Cloud / Qwen Team92.4%94.4%234CAug 11, 2026
15OPGPT-5.6 LunaOpenAI92.3%94.0%234CAug 11, 2026
16GOGemini 3 ProGoogle91.9%93.6%234CAug 11, 2026
17ANClaude Opus 4.6Anthropic91.3%93.1%234CAug 11, 2026
18ZAGLM-5.2Zhipu AI91.2%92.7%234CAug 11, 2026
19MAKimi K2.6Moonshot AI90.5%92.3%234CAug 11, 2026
20GOGemini 3 FlashGoogle90.4%91.8%234CAug 11, 2026
21TEHy3Tencent90.4%91.4%234CAug 11, 2026
22ACQwen3.6 PlusAlibaba Cloud / Qwen Team90.4%91.0%234CAug 11, 2026
23ACQwen3.7-PlusAlibaba Cloud / Qwen Team90.3%90.6%234CAug 11, 2026
24DEDeepSeek-V4-Pro-MaxDeepSeek90.1%90.1%234CAug 11, 2026
25ANClaude Sonnet 4.6Anthropic89.9%89.7%234CAug 11, 2026
26MEMuse SparkMeta89.5%89.3%234CAug 11, 2026
27BYSeed 2.0 ProByteDance88.9%88.8%234CAug 11, 2026
28XAGrok-4 HeavyxAI88.4%88.4%234CAug 11, 2026
29ACQwen3.5-397B-A17BAlibaba Cloud / Qwen Team88.4%88.0%234CAug 11, 2026
30DEDeepSeek-V4-Flash-MaxDeepSeek88.1%87.5%234CAug 11, 2026
31OPGPT-5 MediumOpenAI88.1%87.1%234CAug 11, 2026
32OPGPT-5.1OpenAI88.1%86.7%234CAug 11, 2026
33OPGPT-5.1 HighOpenAI88.1%86.3%234CAug 11, 2026
34OPGPT-5.1 InstantOpenAI88.1%85.8%234CAug 11, 2026
35OPGPT-5.1 ThinkingOpenAI88.1%85.4%234CAug 11, 2026
36OPGPT-5.4 miniOpenAI88.0%85.0%234CAug 11, 2026
37ACQwen3.6-27BAlibaba Cloud / Qwen Team87.8%84.5%234CAug 11, 2026
38MAKimi K2.5Moonshot AI87.6%84.1%234CAug 11, 2026
39XAGrok-4xAI87.5%83.7%234CAug 11, 2026
40OPGPT-5 HighOpenAI87.3%83.3%234CAug 11, 2026
41ANClaude Opus 4.5Anthropic87.0%82.8%234CAug 11, 2026
42NVNemotron 3 Ultra (550B A55B)NVIDIA87.0%82.4%234CAug 11, 2026
43GOGemini 3.1 Flash-LiteGoogle86.9%82.0%234CAug 11, 2026
44ACQwen3.5-122B-A10BAlibaba Cloud / Qwen Team86.6%81.5%234CAug 11, 2026
45GOGemini 2.5 Pro Preview 06-05Google86.4%81.1%234CAug 11, 2026
46ZAGLM-5.1Zhipu AI86.2%80.7%234CAug 11, 2026
47ACQwen3.6-35B-A3BAlibaba Cloud / Qwen Team86.0%80.3%234CAug 11, 2026
48ZAGLM-4.7Zhipu AI85.7%79.8%234CAug 11, 2026
49OPGPT-5OpenAI85.7%79.4%234CAug 11, 2026
50XAGrok 4 FastxAI85.7%79.0%234CAug 11, 2026
51OPGPT-5.5 InstantOpenAI85.6%78.5%234CAug 11, 2026
52ACQwen3.5-27BAlibaba Cloud / Qwen Team85.5%78.1%234CAug 11, 2026
53BYSeed 2.0 LiteByteDance85.1%77.7%234CAug 11, 2026
54BAERNIE 5.0Baidu85.0%77.3%234CAug 11, 2026
55ANClaude 3.7 SonnetAnthropic84.8%76.8%234CAug 11, 2026
56XAGrok-3xAI84.6%76.4%234CAug 11, 2026
57MIMAI-Code-1-FlashMicrosoft84.6%76.0%234CAug 11, 2026
58MAKimi K2-Thinking-0905Moonshot AI84.5%75.5%234CAug 11, 2026
59GOGemma 4 31BGoogle84.3%75.1%234CAug 11, 2026
60MIMAI-Thinking-1Microsoft84.2%74.7%234CAug 11, 2026
61ACQwen3.5-35B-A3BAlibaba Cloud / Qwen Team84.2%74.3%234CAug 11, 2026
62OPChatGPT-4o LatestOpenAI84.0%73.8%234CAug 11, 2026
63XAGrok-3 MinixAI84.0%73.4%234CAug 11, 2026
64XIMiMo-V2-FlashXiaomi83.7%73.0%234CAug 11, 2026
65MEMuse Glimmer-30BMeta83.5%72.5%234CAug 11, 2026
66ANClaude Sonnet 4.5Anthropic83.4%72.1%234CAug 11, 2026
67OPo3OpenAI83.3%71.7%234CAug 11, 2026
68GOGemini 2.5 ProGoogle83.0%71.2%234CAug 11, 2026
69GOGemini 2.5 FlashGoogle82.8%70.8%234CAug 11, 2026
70OPGPT-5.4 nanoOpenAI82.8%70.4%234CAug 11, 2026
71NVNemotron 3 Super (120B A12B)NVIDIA82.7%70.0%234CAug 11, 2026
72DEDeepSeek-V3.2 (Thinking)DeepSeek82.4%69.5%234CAug 11, 2026
73DEDeepSeek-V3.2DeepSeek82.4%69.1%234CAug 11, 2026
74GOGemma 4 26B-A4BGoogle82.3%68.7%234CAug 11, 2026
75OPGPT-5 miniOpenAI82.3%68.2%234CAug 11, 2026
76ACQwen3.5-9BAlibaba Cloud / Qwen Team81.7%67.8%234CAug 11, 2026
77MELongCat-Flash-ThinkingMeituan81.5%67.4%234CAug 11, 2026
78AMNova 2 ProAmazon81.4%67.0%234CAug 11, 2026
79OPo4-miniOpenAI81.4%66.5%234CAug 11, 2026
80ACQwen3-235B-A22B-Thinking-2507Alibaba Cloud / Qwen Team81.1%66.1%234CAug 11, 2026
81DEDeepSeek-R1-0528DeepSeek81.0%65.7%234CAug 11, 2026
82ZAGLM-4.6Zhipu AI81.0%65.2%234CAug 11, 2026
83MIMiniMax M2.1MiniMax81.0%64.8%234CAug 11, 2026
84ANClaude Opus 4.1Anthropic80.9%64.4%234CAug 11, 2026
85OPGPT OSS 120B HighOpenAI80.9%64.0%234CAug 11, 2026
86MELongCat-Flash-Thinking-2601Meituan80.5%63.5%234CAug 11, 2026
87OPGPT OSS 120BOpenAI80.1%63.1%234CAug 11, 2026
88DEDeepSeek-V3.2-ExpDeepSeek79.9%62.7%234CAug 11, 2026
89ANClaude Opus 4Anthropic79.6%62.2%234CAug 11, 2026
90AMNova 2 LiteAmazon79.6%61.8%234CAug 11, 2026
91ZAGLM-4.5Zhipu AI79.1%61.4%234CAug 11, 2026
92OPo1-proOpenAI79.0%60.9%234CAug 11, 2026
93GOGemma 4 12BGoogle78.8%60.5%234CAug 11, 2026
94SASarvam-105BSarvam AI78.7%60.1%234CAug 11, 2026
95MIMiniMax M2MiniMax78.0%59.7%234CAug 11, 2026
96OPo1OpenAI78.0%59.2%234CAug 11, 2026
97ACQwen3-235B-A22B-Instruct-2507Alibaba Cloud / Qwen Team77.5%58.8%234CAug 11, 2026
98OPo3-miniOpenAI77.2%58.4%234CAug 11, 2026
99ACQwen3-Next-80B-A3B-ThinkingAlibaba Cloud / Qwen Team77.2%57.9%234CAug 11, 2026
100ACQwen3.5-4BAlibaba Cloud / Qwen Team76.2%57.5%234CAug 11, 2026

GPQA Score Distribution

A closer view of the leading scores on this benchmark.

GPQA

GPQA Highlights

The leading models and scores on this benchmark.

Rank #1Claude Mythos Preview94.6%Rank #2GPT-5.6 Sol94.6%Rank #3Gemini 3.1 Pro94.3%Rank #4Claude Opus 4.794.2%

What is GPQA?

What GPQA measures and how its scores work.

A challenging dataset of 448 multiple-choice questions written by domain experts in biology, physics, and chemistry. Questions are Google-proof and extremely difficult, with PhD experts reaching 65% accuracy.

Scores are shown in ratio. This benchmark is not independently verified and has an evidence level of C.

Family
GPQA
Modality
text
Primary category
physics
Score direction
higher
LLMBoard eligible
Yes
Evaluation key
gpqa|llm-stats-current

Benchmark scores retain their original unit. Overall score eligibility is shown separately.

FAQ

Common questions about GPQA.

Which model scores highest on GPQA?

Claude Mythos Preview is currently ranked first with 94.6%.

What does GPQA measure?

A challenging dataset of 448 multiple-choice questions written by domain experts in biology, physics, and chemistry. Questions are Google-proof and extremely difficult, with PhD experts reaching 65% accuracy.

Is a higher score better?

Yes. Higher values rank better for this benchmark.

How many models are compared?

100 model results are currently shown.

Does this benchmark affect the overall score?

Yes. This benchmark can contribute to the current LLMBoard capability score.