llmboard.aiLeaderboard Center
Overall
Overall RankingOpen Models
Tools
Model DirectoryCompare Models
Capabilities
CodingReasoningMathKnowledgeInstruction Following
Price & Efficiency
Price & ValueCapability vs. PriceRuntime Performance
Modalities
Image GenerationVideo GenerationSpeech ModelsEmbeddings
Core Benchmarks
GPQAMMLU-ProAIME 2025SWE-Bench VerifiedMMLUHumanity's Last ExamLiveCodeBenchMATHHumanEvalMMMU-ProView all benchmarks
Methods
Scoring & Data
393 models668 benchmarks

Leaderboard Center

Overall RankingCodingCore BenchmarksPrice & ValueRuntime Performance

Modalities

All ModelsImage GenerationImage EditingVideo GenerationImage-to-VideoVideo EditingText-to-SpeechSpeech-to-TextEmbeddings

Data & Methods

Scoring MethodAll BenchmarksReasoningMath

Vendors

All VendorsOpenAIAnthropicGoogle
llmboard.aiCopyright 2026 llmboard.ai

language benchmark

MMLU-Pro

A more robust and challenging multi-task language understanding benchmark that extends MMLU by expanding multiple-choice options from 4 to 10, eliminating trivial questions, and focusing on reasoning-intensive tasks. Features over 12,000 curated questions across 14 domains and causes a 16-33% accuracy drop compared to original MMLU.

Updated Aug 11, 2026

Models100
Model coverage129
MetricScore
EvidenceB

On this page

  • Ranking
  • Distribution
  • Highlights
  • About
  • FAQ

MMLU-Pro Ranking

Higher score ranks better on this benchmark.

100 rows
Columns

Show columns

01ACQwen3.7 MaxAlibaba Cloud / Qwen Team89.6%100.0%129CAug 11, 2026
02ACQwen3.6 PlusAlibaba Cloud / Qwen Team88.5%99.2%129CAug 11, 2026
03ACQwen3.7-PlusAlibaba Cloud / Qwen Team88.5%98.4%129CAug 11, 2026
04MIMiniMax M2.1MiniMax88.0%97.7%129CAug 11, 2026
05ACQwen3.5-397B-A17BAlibaba Cloud / Qwen Team87.8%96.9%129CAug 11, 2026
06DEDeepSeek-V4-Pro-MaxDeepSeek87.5%96.1%129CAug 11, 2026
07MAKimi K2.5Moonshot AI87.1%95.3%129CAug 11, 2026
08BAERNIE 5.0Baidu87.0%94.5%129CAug 11, 2026
09NVNemotron 3 Ultra (550B A55B)NVIDIA86.8%93.8%129CAug 11, 2026
10ACQwen3.5-122B-A10BAlibaba Cloud / Qwen Team86.7%93.0%129CAug 11, 2026
11DEDeepSeek-V4-Flash-MaxDeepSeek86.2%92.2%129CAug 11, 2026
12ACQwen3.6-27BAlibaba Cloud / Qwen Team86.2%91.4%129CAug 11, 2026
13ACQwen3.5-27BAlibaba Cloud / Qwen Team86.1%90.6%129CAug 11, 2026
14ACQwen3.5-35B-A3BAlibaba Cloud / Qwen Team85.3%89.8%129CAug 11, 2026
15GOGemma 4 31BGoogle85.2%89.1%129CAug 11, 2026
16ACQwen3.6-35B-A3BAlibaba Cloud / Qwen Team85.2%88.3%129CAug 11, 2026
17DEDeepSeek-R1-0528DeepSeek85.0%87.5%129CAug 11, 2026
18DEDeepSeek-V3.2 (Thinking)DeepSeek85.0%86.7%129CAug 11, 2026
19DEDeepSeek-V3.2DeepSeek85.0%85.9%129CAug 11, 2026
20DEDeepSeek-V3.2-ExpDeepSeek85.0%85.2%129CAug 11, 2026
21MIMAI-Thinking-1Microsoft85.0%84.4%129CAug 11, 2026
22XIMiMo-V2-FlashXiaomi84.9%83.6%129CAug 11, 2026
23ZAGLM-4.5Zhipu AI84.6%82.8%129CAug 11, 2026
24MAKimi K2-Thinking-0905Moonshot AI84.6%82.0%129CAug 11, 2026
25ACQwen3-235B-A22B-Thinking-2507Alibaba Cloud / Qwen Team84.4%81.3%129CAug 11, 2026
26ZAGLM-4.7Zhipu AI84.3%80.5%129CAug 11, 2026
27LAK-EXAONE-236B-A23BLG AI Research83.8%79.7%129CAug 11, 2026
28ACQwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team83.8%78.9%129CAug 11, 2026
29NVNemotron 3 Super (120B A12B)NVIDIA83.7%78.1%129CAug 11, 2026
30DEDeepSeek-V3.1DeepSeek83.7%77.3%129CAug 11, 2026
31ACQwen3-235B-A22B-Instruct-2507Alibaba Cloud / Qwen Team83.0%76.6%129CAug 11, 2026
32ACQwen3-Next-80B-A3B-ThinkingAlibaba Cloud / Qwen Team82.7%75.8%129CAug 11, 2026
33MELongCat-Flash-ChatMeituan82.7%75.0%129CAug 11, 2026
34GOGemma 4 26B-A4BGoogle82.6%74.2%129CAug 11, 2026
35MELongCat-Flash-ThinkingMeituan82.6%73.4%129CAug 11, 2026
36MAKimi K2 0905Moonshot AI82.5%72.7%129CAug 11, 2026
37ACQwen3.5-9BAlibaba Cloud / Qwen Team82.5%71.9%129CAug 11, 2026
38ACQwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team82.1%71.1%129CAug 11, 2026
39MIMiniMax M2MiniMax82.0%70.3%129CAug 11, 2026
40ACQwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team81.8%69.5%129CAug 11, 2026
41SASarvam-105BSarvam AI81.7%68.8%129CAug 11, 2026
42AMNova 2 ProAmazon81.6%68.0%129CAug 11, 2026
43ZAGLM-4.5-AirZhipu AI81.4%67.2%129CAug 11, 2026
44DEDeepSeek-V3 0324DeepSeek81.2%66.4%129CAug 11, 2026
45MAKimi K2 InstructMoonshot AI81.1%65.6%129CAug 11, 2026
46MAKimi K2-Instruct-0905Moonshot AI81.1%64.8%129CAug 11, 2026
47MIMiniMax M1 80KMiniMax81.1%64.1%129CAug 11, 2026
48AMNova 2 LiteAmazon80.9%63.3%129CAug 11, 2026
49OPGPT OSS 120B HighOpenAI80.7%62.5%129CAug 11, 2026
50AMNova 2 OmniAmazon80.7%61.7%129CAug 11, 2026
51MIMiniMax M1 40KMiniMax80.6%60.9%129CAug 11, 2026
52ACQwen3-Next-80B-A3B-InstructAlibaba Cloud / Qwen Team80.6%60.2%129CAug 11, 2026
53MELlama 4 MaverickMeta80.5%59.4%129CAug 11, 2026
54ACQwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team80.5%58.6%129CAug 11, 2026
55SASarvam-30BSarvam AI80.0%57.8%129CAug 11, 2026
56ACQwen3.5-4BAlibaba Cloud / Qwen Team79.1%57.0%129CAug 11, 2026
57ACQwen3 VL 32B InstructAlibaba Cloud / Qwen Team78.6%56.3%129CAug 11, 2026
58NVNemotron 3 Nano (30B A3B)NVIDIA78.3%55.5%129CAug 11, 2026
59MELongCat-Flash-LiteMeituan78.3%54.7%129CAug 11, 2026
60MAMistral Small 4Mistral AI78.0%53.9%129CAug 11, 2026
61ACQwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team77.8%53.1%129CAug 11, 2026
62ANClaude 3.5 SonnetAnthropic77.6%52.3%129CAug 11, 2026
63GODiffusionGemma 26B-A4BGoogle77.6%51.6%129CAug 11, 2026
64ACQwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team77.3%50.8%129CAug 11, 2026
65GOGemma 4 12BGoogle77.2%50.0%129CAug 11, 2026
66GOGemini 2.0 FlashGoogle76.4%49.2%129CAug 11, 2026
67ANClaude 3.5 SonnetAnthropic76.1%48.4%129CAug 11, 2026
68MIPhi 4 Reasoning PlusMicrosoft76.0%47.7%129CAug 11, 2026
69DEDeepSeek-V3DeepSeek75.9%46.9%129CAug 11, 2026
70GOGemini 1.5 ProGoogle75.8%46.1%129CAug 11, 2026
71XAGrok-2xAI75.5%45.3%129CAug 11, 2026
72OPGPT-4oOpenAI74.7%44.5%129CAug 11, 2026
73MELlama 4 ScoutMeta74.3%43.8%129CAug 11, 2026
74MIPhi 4 ReasoningMicrosoft74.3%43.0%129CAug 11, 2026
75ACQwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team73.6%42.2%129CAug 11, 2026
76MELlama 3.1 405B InstructMeta73.3%41.4%129CAug 11, 2026
77OPGPT-4oOpenAI72.6%40.6%129CAug 11, 2026
78XAGrok-2 minixAI72.0%39.8%129CAug 11, 2026
79GOGemini 2.0 Flash-LiteGoogle71.6%39.1%129CAug 11, 2026
80ACQwen3 VL 8B InstructAlibaba Cloud / Qwen Team71.6%38.3%129CAug 11, 2026
81ACQwen2.5 72B InstructAlibaba Cloud / Qwen Team71.1%37.5%129CAug 11, 2026
82MIPhi 4Microsoft70.4%36.7%129CAug 11, 2026
83GOGemma 4 E4BGoogle69.4%35.9%129CAug 11, 2026
84MAKimi K2 BaseMoonshot AI69.2%35.2%129CAug 11, 2026
85MAMistral Small 3.2 24B InstructMistral AI69.1%34.4%129CAug 11, 2026
86ACQwen2.5 32B InstructAlibaba Cloud / Qwen Team69.0%33.6%129CAug 11, 2026
87MELlama 3.3 70B InstructMeta68.9%32.8%129CAug 11, 2026
88ACQwen2.5 VL 32B InstructAlibaba Cloud / Qwen Team68.8%32.0%129CAug 11, 2026
89ANClaude 3 OpusAnthropic68.5%31.3%129CAug 11, 2026
90XIMiMo-V2.5-ProXiaomi68.5%30.5%129CAug 11, 2026
91ACQwen3 235B A22BAlibaba Cloud / Qwen Team68.2%29.7%129CAug 11, 2026
92GOGemma 3 27BGoogle67.5%28.9%129CAug 11, 2026
93GOGemini 1.5 FlashGoogle67.3%28.1%129CAug 11, 2026
94ACQwen3 VL 4B InstructAlibaba Cloud / Qwen Team67.1%27.3%129CAug 11, 2026
95OPMiniCPM-SALAOpenBMB67.0%26.6%129CAug 11, 2026
96MAMistral Small 3.1 24B InstructMistral AI66.8%25.8%129CAug 11, 2026
97ACQwen3.5-2BAlibaba Cloud / Qwen Team66.5%25.0%129CAug 11, 2026
98MELlama 3.1 70B InstructMeta66.4%24.2%129CAug 11, 2026
99MAMistral Small 3 24B InstructMistral AI66.3%23.4%129CAug 11, 2026
100ANClaude 3.5 HaikuAnthropic65.0%22.7%129CAug 11, 2026

MMLU-Pro Score Distribution

A closer view of the leading scores on this benchmark.

MMLU-Pro

MMLU-Pro Highlights

The leading models and scores on this benchmark.

Rank #1Qwen3.7 Max89.6%Rank #2Qwen3.6 Plus88.5%Rank #3Qwen3.7-Plus88.5%Rank #4MiniMax M2.188.0%

What is MMLU-Pro?

What MMLU-Pro measures and how its scores work.

A more robust and challenging multi-task language understanding benchmark that extends MMLU by expanding multiple-choice options from 4 to 10, eliminating trivial questions, and focusing on reasoning-intensive tasks. Features over 12,000 curated questions across 14 domains and causes a 16-33% accuracy drop compared to original MMLU.

Scores are shown in ratio. This benchmark is not independently verified and has an evidence level of B.

Family
MMLU-Pro
Modality
text
Primary category
language
Score direction
higher
LLMBoard eligible
Yes
Evaluation key
mmlu-pro|llm-stats-current

Benchmark scores retain their original unit. Overall score eligibility is shown separately.

FAQ

Common questions about MMLU-Pro.

Which model scores highest on MMLU-Pro?

Qwen3.7 Max is currently ranked first with 89.6%.

What does MMLU-Pro measure?

A more robust and challenging multi-task language understanding benchmark that extends MMLU by expanding multiple-choice options from 4 to 10, eliminating trivial questions, and focusing on reasoning-intensive tasks. Features over 12,000 curated questions across 14 domains and causes a 16-33% accuracy drop compared to original MMLU.

Is a higher score better?

Yes. Higher values rank better for this benchmark.

How many models are compared?

100 model results are currently shown.

Does this benchmark affect the overall score?

Yes. This benchmark can contribute to the current LLMBoard capability score.