llmboard.aiLeaderboard Center
Overall
Overall RankingOpen Models
Tools
Model DirectoryCompare Models
Capabilities
CodingReasoningMathKnowledgeInstruction Following
Price & Efficiency
Price & ValueCapability vs. PriceRuntime Performance
Modalities
Image GenerationVideo GenerationSpeech ModelsEmbeddings
Core Benchmarks
GPQAMMLU-ProAIME 2025SWE-Bench VerifiedMMLUHumanity's Last ExamLiveCodeBenchMATHHumanEvalMMMU-ProView all benchmarks
Methods
Scoring & Data
393 models668 benchmarks

Leaderboard Center

Overall RankingCodingCore BenchmarksPrice & ValueRuntime Performance

Modalities

All ModelsImage GenerationImage EditingVideo GenerationImage-to-VideoVideo EditingText-to-SpeechSpeech-to-TextEmbeddings

Data & Methods

Scoring MethodAll BenchmarksReasoningMath

Vendors

All VendorsOpenAIAnthropicGoogle
llmboard.aiCopyright 2026 llmboard.ai
  • Overall
  • Capabilities
  • Benchmarks
  • Price & Runtime
Aggregated AI Model Rankings

Overall AI Model Ranking

Compare current model versions across independent benchmarks, community preference data, and official pricing. Scores show relative capability, not model IQ or an absolute performance gap.

167 ranked12 core benchmarks
Sources
2
Benchmarks
668
Models
393
Updated
2026-08-11
30 rows
Columns

Show columns

01ANClaude Opus 5Anthropic97.4LeadingReasoning, Knowledge$5$25Moderate 60%Jul 24, 2026Aug 12, 2026
02ANClaude Fable 5Anthropic95.8LeadingKnowledge, Coding$10$50Limited 40%Jun 9, 2026Aug 12, 2026
03OPGPT-5.6-SolGPT-5.6 Sol · OpenAI95.1LeadingMath, Reasoning$5$30High 80%Jul 9, 2026Aug 12, 2026
04ANClaude MythosClaude Mythos Preview · Anthropic93.6LeadingMath, ReasoningN/AN/AHigh 80%N/AAug 12, 2026
05MAKimi K3Moonshot AI93.0LeadingReasoning, Knowledge$3$15Moderate 60%Jul 16, 2026Aug 12, 2026
06ACQwen3.8 MaxAlibaba Cloud / Qwen Team89.3StrongInstruction Following, Reasoning$2$6High 80%Aug 2, 2026Aug 12, 2026
07MEMuse Spark 1.1Meta88.3StrongKnowledge, Coding$1.25$4.25Limited 40%Jul 9, 2026Aug 12, 2026
08ANClaude Opus 4.8Anthropic87.9StrongReasoning, Knowledge$5$25Moderate 60%May 28, 2026Aug 12, 2026
09OPGPT-5.6-TerraGPT-5.6 Terra · OpenAI87.6StrongReasoning, Math$2$12High 80%Jul 9, 2026Aug 12, 2026
10ANClaude Opus 4.7Anthropic84.2StrongReasoning, Knowledge$5$25Moderate 60%Apr 16, 2026Aug 12, 2026
11ANClaude Sonnet 5Anthropic84.0StrongKnowledge, Coding$2$10Moderate 60%Jun 30, 2026Aug 12, 2026
12OPGPT-5.5OpenAI84.0StrongReasoning, Knowledge$5$30High 80%Apr 23, 2026Aug 12, 2026
13MEMuse Spark 1.2Meta82.3ProvisionalCoding$1.25$4.25Limited 20%Aug 5, 2026Aug 12, 2026
14XAGrok 4.5xAI82.2ProvisionalReasoning, Coding$2$6Limited 40%Jul 16, 2026Aug 12, 2026
15ANClaude Opus 4.6Anthropic79.6StrongMath, Knowledge$5$25High 80%Feb 5, 2026Aug 12, 2026
16GOGemini 3.6 FlashGoogle79.3ProvisionalCoding$1.5$7.5Limited 20%Jul 21, 2026Aug 12, 2026
17ZAGLM 5.2GLM-5.2 · Zhipu AI79.3StrongReasoning, Math$1.4$4.4High 80%Jun 16, 2026Aug 12, 2026
18GOGemini 3.5 FlashGoogle79.2StrongReasoning, Knowledge$1.5$9Moderate 60%May 19, 2026Aug 12, 2026
19ACQwen3.7 MaxAlibaba Cloud / Qwen Team78.8StrongMath, Instruction Following$2.5$7.5High 100%May 19, 2026Aug 12, 2026
20BYSeed 2.1 ProByteDance78.7StrongReasoning, KnowledgeN/AN/AHigh 80%Jun 24, 2026Aug 12, 2026
21DEDeepSeek-V4-FlashDeepSeek-V4-Flash-0731 · DeepSeek78.3ProvisionalCoding$0.14$0.28Limited 20%Jul 31, 2026Aug 12, 2026
22GOGemini 3.1 ProGoogle77.5StrongReasoning, Knowledge$2$12Moderate 60%Feb 19, 2026Aug 12, 2026
23OPGPT-5.4OpenAI77.1StrongReasoning, Math$2.5$15High 80%Mar 5, 2026Aug 12, 2026
24OPGPT-5.6-LunaGPT-5.6 Luna · OpenAI76.4StrongReasoning, Math$0.20$1.2High 80%Jul 9, 2026Aug 12, 2026
25OPGPT-5.5-ProGPT-5.5 Pro · OpenAI75.8ProvisionalKnowledge, Math$30$180Limited 40%Apr 23, 2026Aug 12, 2026
26MAKimi K2.6Moonshot AI75.5StrongReasoning, Math$0.95$4High 80%Apr 20, 2026Aug 12, 2026
27DEDeepSeek-V4-ProDeepSeek-V4-Pro-Max · DeepSeek73.8CompetitiveReasoning, Knowledge$0.435$0.87High 80%Apr 23, 2026Aug 12, 2026
28ACQwen3.7 PlusQwen3.7-Plus · Alibaba Cloud / Qwen Team73.8CompetitiveInstruction Following, Reasoning$0.50$3High 100%May 31, 2026Aug 12, 2026
29MEMuse SparkMeta73.2CompetitiveKnowledge, ReasoningN/AN/AModerate 60%Apr 8, 2026Aug 12, 2026
30BYSeed 2.1 TurboByteDance73.1CompetitiveReasoning, KnowledgeN/AN/AHigh 80%Jun 24, 2026Aug 12, 2026

Rank by capability

Each leaderboard sorts by its own capability measure, not by the overall score.

CodingClaude Sonnet 4.5Code generation and software engineeringReasoningClaude Opus 5Complex problems and logical reasoningMathGPT-5.6-SolMathematics and quantitative reasoningKnowledgeClaude MythosKnowledge coverage and factual answersInstruction FollowingQwen3.8 MaxReliable completion of requested tasksOpen ModelsOpen-weight models onlyCompare capability, licensing, and cost separately

Core benchmarks

A focused set of broad-coverage, current, score-eligible evaluations.

GPQAphysics234 modelsMMLU-Prolanguage129 modelsAIME 2025math114 modelsSWE-Bench Verifiedreasoning105 modelsMMLUlanguage100 modelsHumanity's Last Exammath93 modelsLiveCodeBenchreasoning73 modelsMATHmath71 modelsHumanEvalreasoning66 modelsMMMU-Promultimodal66 modelsIFEvalinstruction following65 modelsMMMUmultimodal63 models
Browse all 668 benchmarks

Capability, price, and runtime

These selection signals are shown together but remain separate. Price and runtime never change the capability score.

Capability vs. official API price

Only models with positive official pay-as-you-go token prices are shown.

020406080100$0.05$0.1$0.2$0.5$1.0$2.0$5.0$10LLMBoard ScoreOfficial API price blend (8:1 input/output), USD / 1M
Efficient frontier128 models with official PAYG prices

Capability vs. output speed

Each scored version uses its fastest tracked model-provider record. Output Speed is generated tokens received per second.

Open runtime rankings
0.021.042.163.184.2105.20.1 tok/s0.5 tok/s2.0 tok/s10 tok/s20 tok/s100 tok/s500 tok/s2,000 tok/sLLMBoard scoreOutput speed
Each mark is one scored model version92 records

Runtime data is provider-specific and remains independent from capability, evidence coverage, and price. Open the full runtime page for catalog latency, TTFT, observed throughput, and reliability.