llmboard.aiLeaderboard Center
Overall
Overall RankingOpen Models
Tools
Model DirectoryCompare Models
Capabilities
CodingReasoningMathKnowledgeInstruction Following
Price & Efficiency
Price & ValueCapability vs. PriceRuntime Performance
Modalities
Image GenerationVideo GenerationSpeech ModelsEmbeddings
Core Benchmarks
GPQAMMLU-ProAIME 2025SWE-Bench VerifiedMMLUHumanity's Last ExamLiveCodeBenchMATHHumanEvalMMMU-ProView all benchmarks
Methods
Scoring & Data
393 models668 benchmarks

Leaderboard Center

Overall RankingCodingCore BenchmarksPrice & ValueRuntime Performance

Modalities

All ModelsImage GenerationImage EditingVideo GenerationImage-to-VideoVideo EditingText-to-SpeechSpeech-to-TextEmbeddings

Data & Methods

Scoring MethodAll BenchmarksReasoningMath

Vendors

All VendorsOpenAIAnthropicGoogle
llmboard.aiCopyright 2026 llmboard.ai

language benchmark

MMLU

Massive Multitask Language Understanding benchmark testing knowledge across 57 diverse subjects including STEM, humanities, social sciences, and professional domains

Updated Aug 11, 2026

Models100
Model coverage100
MetricScore
EvidenceB

On this page

  • Ranking
  • Distribution
  • Highlights
  • About
  • FAQ

MMLU Ranking

Higher score ranks better on this benchmark.

100 rows
Columns

Show columns

01OPGPT-5OpenAI92.5%100.0%100CAug 11, 2026
02OPo1OpenAI91.8%99.0%100CAug 11, 2026
03OPGPT-4.5OpenAI90.8%98.0%100CAug 11, 2026
04OPo1-previewOpenAI90.8%97.0%100CAug 11, 2026
05ACQwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team90.6%96.0%100CAug 11, 2026
06SASarvam-105BSarvam AI90.6%95.0%100CAug 11, 2026
07ANClaude 3.5 SonnetAnthropic90.4%93.9%100CAug 11, 2026
08ANClaude 3.5 SonnetAnthropic90.4%92.9%100CAug 11, 2026
09OPGPT-4.1OpenAI90.2%91.9%100CAug 11, 2026
10MAKimi K2 0905Moonshot AI90.2%90.9%100CAug 11, 2026
11OPGPT OSS 120BOpenAI90.0%89.9%100CAug 11, 2026
12MELongCat-Flash-ChatMeituan89.7%88.9%100CAug 11, 2026
13MAKimi K2 InstructMoonshot AI89.5%87.9%100CAug 11, 2026
14MAKimi K2-Instruct-0905Moonshot AI89.5%86.9%100CAug 11, 2026
15XIMiMo-V2.5-ProXiaomi89.4%85.9%100CAug 11, 2026
16ACQwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team88.8%84.8%100CAug 11, 2026
17OPGPT-4oOpenAI88.7%83.8%100CAug 11, 2026
18ACQwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team88.7%82.8%100CAug 11, 2026
19DEDeepSeek-V3DeepSeek88.5%81.8%100CAug 11, 2026
20ACQwen3 235B A22BAlibaba Cloud / Qwen Team87.8%80.8%100CAug 11, 2026
21MAKimi K2 BaseMoonshot AI87.8%79.8%100CAug 11, 2026
22ACQwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team87.6%78.8%100CAug 11, 2026
23OPGPT-4.1 miniOpenAI87.5%77.8%100CAug 11, 2026
24XAGrok-2xAI87.5%76.8%100CAug 11, 2026
25MAKimi-k1.5Moonshot AI87.4%75.8%100CAug 11, 2026
26MELlama 3.1 405B InstructMeta87.3%74.8%100CAug 11, 2026
27OPo3-miniOpenAI86.9%73.7%100CAug 11, 2026
28ANClaude 3 OpusAnthropic86.8%72.7%100CAug 11, 2026
29OPGPT-4 TurboOpenAI86.5%71.7%100CAug 11, 2026
30OPGPT-4OpenAI86.4%70.7%100CAug 11, 2026
31ACQwen3 VL 32B InstructAlibaba Cloud / Qwen Team86.4%69.7%100CAug 11, 2026
32XAGrok-2 minixAI86.2%68.7%100CAug 11, 2026
33MELlama 3.2 90B InstructMeta86.0%67.7%100CAug 11, 2026
34MELlama 3.3 70B InstructMeta86.0%66.7%100CAug 11, 2026
35GOGemini 1.5 ProGoogle85.9%65.7%100CAug 11, 2026
36AMNova ProAmazon85.9%64.7%100CAug 11, 2026
37OPGPT-4oOpenAI85.7%63.6%100CAug 11, 2026
38MELongCat-Flash-LiteMeituan85.5%62.6%100CAug 11, 2026
39MELlama 4 MaverickMeta85.5%61.6%100CAug 11, 2026
40OPGPT OSS 20BOpenAI85.3%60.6%100CAug 11, 2026
41OPo1-miniOpenAI85.2%59.6%100CAug 11, 2026
42ACQwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team85.2%58.6%100CAug 11, 2026
43SASarvam-30BSarvam AI85.1%57.6%100CAug 11, 2026
44ACQwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team85.0%56.6%100CAug 11, 2026
45MIPhi 4Microsoft84.8%55.6%100CAug 11, 2026
46MAMistral Large 2Mistral AI84.0%54.5%100CAug 11, 2026
47MELlama 3.1 70B InstructMeta83.6%53.5%100CAug 11, 2026
48ACQwen2.5 32B InstructAlibaba Cloud / Qwen Team83.3%52.5%100CAug 11, 2026
49ACQwen2 72B InstructAlibaba Cloud / Qwen Team82.3%51.5%100CAug 11, 2026
50OPGPT-4o miniOpenAI82.0%50.5%100CAug 11, 2026
51ACQwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team81.5%49.5%100CAug 11, 2026
52XAGrok-1.5xAI81.3%48.5%100CAug 11, 2026
53ALJamba 1.5 LargeAI21 Labs81.2%47.5%100CAug 11, 2026
54MAMistral Small 3.1 24B BaseMistral AI81.0%46.5%100CAug 11, 2026
55MAMistral Small 3 24B BaseMistral AI80.7%45.5%100CAug 11, 2026
56ACQwen3 VL 8B InstructAlibaba Cloud / Qwen Team80.7%44.4%100CAug 11, 2026
57MAMistral Small 3.1 24B InstructMistral AI80.6%43.4%100CAug 11, 2026
58MAMistral Small 3.2 24B InstructMistral AI80.5%42.4%100CAug 11, 2026
59AMNova LiteAmazon80.5%41.4%100CAug 11, 2026
60DEDeepSeek-V2.5DeepSeek80.4%40.4%100CAug 11, 2026
61NVLlama 3.1 Nemotron 70B InstructNVIDIA80.2%39.4%100CAug 11, 2026
62OPGPT-4.1 nanoOpenAI80.1%38.4%100CAug 11, 2026
63ACQwen2.5 14B InstructAlibaba Cloud / Qwen Team79.7%37.4%100CAug 11, 2026
64MELlama 4 ScoutMeta79.6%36.4%100CAug 11, 2026
65MAMinistral 3 (14B Base 2512)Mistral AI79.4%35.4%100CAug 11, 2026
66NRHermes 3 70BNous Research79.1%34.3%100CAug 11, 2026
67ANClaude 3 SonnetAnthropic79.0%33.3%100CAug 11, 2026
68GOGemini 1.5 FlashGoogle78.9%32.3%100CAug 11, 2026
69MIPhi-3.5-MoE-instructMicrosoft78.9%31.3%100CAug 11, 2026
70ACQwen2.5 VL 32B InstructAlibaba Cloud / Qwen Team78.4%30.3%100CAug 11, 2026
71AMNova MicroAmazon77.6%29.3%100CAug 11, 2026
72ACQwen3 VL 4B InstructAlibaba Cloud / Qwen Team77.2%28.3%100CAug 11, 2026
73MAMinistral 3 (8B Base 2512)Mistral AI76.1%27.3%100CAug 11, 2026
74COCommand R+Cohere75.7%26.3%100CAug 11, 2026
75ANClaude 3 HaikuAnthropic75.2%25.3%100CAug 11, 2026
76GOGemma 2 27BGoogle75.2%24.2%100CAug 11, 2026
77ACQwen2.5-Coder 32B InstructAlibaba Cloud / Qwen Team75.1%23.2%100CAug 11, 2026
78MELlama 3.2 11B InstructMeta73.0%22.2%100CAug 11, 2026
79GOGemini 1.0 ProGoogle71.8%21.2%100CAug 11, 2026
80GOGemma 2 9BGoogle71.3%20.2%100CAug 11, 2026
81MAMinistral 3 (3B Base 2512)Mistral AI70.7%19.2%100CAug 11, 2026
82ACQwen2 7B InstructAlibaba Cloud / Qwen Team70.5%18.2%100CAug 11, 2026
83OPGPT-3.5 TurboOpenAI69.8%17.2%100BAug 11, 2026
84ALJamba 1.5 MiniAI21 Labs69.7%16.2%100CAug 11, 2026
85MELlama 3.1 8B InstructMeta69.4%15.2%100CAug 11, 2026
86MAPixtral-12BMistral AI69.2%14.1%100CAug 11, 2026
87MIPhi-3.5-mini-instructMicrosoft69.0%13.1%100CAug 11, 2026
88MAMistral NeMo InstructMistral AI68.0%12.1%100CAug 11, 2026
89ACQwen2.5-Coder 7B InstructAlibaba Cloud / Qwen Team67.6%11.1%100CAug 11, 2026
90MIPhi 4 MiniMicrosoft67.3%10.1%100CAug 11, 2026
91IBGranite 3.3 8B InstructIBM65.5%9.1%100CAug 11, 2026
92MAMinistral 8B InstructMistral AI65.0%8.1%100CAug 11, 2026
93GOGemma 3n E4B InstructedGoogle64.9%7.1%100CAug 11, 2026
94GOGemma 3n E4B Instructed LiteRT PreviewGoogle64.9%6.1%100CAug 11, 2026
95IBGranite 3.3 8B BaseIBM63.9%5.0%100CAug 11, 2026
96MELlama 3.2 3B InstructMeta63.4%4.0%100CAug 11, 2026
97IBIBM Granite 4.0 Tiny PreviewIBM60.4%3.0%100CAug 11, 2026
98GOGemma 3n E2B InstructedGoogle60.1%2.0%100CAug 11, 2026
99GOGemma 3n E2B Instructed LiteRT (Preview)Google60.1%1.0%100CAug 11, 2026
100BAERNIE 4.5Baidu41.9%0.0%100CAug 11, 2026

MMLU Score Distribution

A closer view of the leading scores on this benchmark.

MMLU

MMLU Highlights

The leading models and scores on this benchmark.

Rank #1GPT-592.5%Rank #2o191.8%Rank #3GPT-4.590.8%Rank #4o1-preview90.8%

What is MMLU?

What MMLU measures and how its scores work.

Massive Multitask Language Understanding benchmark testing knowledge across 57 diverse subjects including STEM, humanities, social sciences, and professional domains

Scores are shown in ratio. This benchmark is not independently verified and has an evidence level of B.

Family
MMLU
Modality
text
Primary category
language
Score direction
higher
LLMBoard eligible
Yes
Evaluation key
mmlu|llm-stats-current

Benchmark scores retain their original unit. Overall score eligibility is shown separately.

FAQ

Common questions about MMLU.

Which model scores highest on MMLU?

GPT-5 is currently ranked first with 92.5%.

What does MMLU measure?

Massive Multitask Language Understanding benchmark testing knowledge across 57 diverse subjects including STEM, humanities, social sciences, and professional domains

Is a higher score better?

Yes. Higher values rank better for this benchmark.

How many models are compared?

100 model results are currently shown.

Does this benchmark affect the overall score?

Yes. This benchmark can contribute to the current LLMBoard capability score.