llmboard.aiAI model intelligence
Home

Model Rankings

OverallOpen ModelsAgentCodingReasoningMathKnowledgeInstruction FollowingTextVision
Image GenerationImage Editing
Video GenerationImage to VideoVideo Editing
Text to SpeechSpeech to Text
Embeddings

Efficiency

Chat Token PricingImage PricingVideo PricingAudio Pricing
Chat Speed & LatencyProvider Reliability

Benchmarks

GPQAMMLU-ProAIME 2025SWE-Bench VerifiedMMLUHumanity's Last ExamLiveCodeBenchMATHHumanEvalMMMU-Pro
All Benchmarks

Tools

Model DirectoryCompare Models

Scoring & Data

Scoring & Data
393 models668 benchmarks

Leaderboard Center

Overall RankingCodingCore BenchmarksPrice & ValueRuntime Performance

Modalities

All ModelsImage GenerationImage EditingVideo GenerationImage-to-VideoVideo EditingText-to-SpeechSpeech-to-TextEmbeddings

Data & Methods

Scoring MethodAll BenchmarksReasoningMath

Vendors

All VendorsOpenAIAnthropicGoogle
llmboard.aiCopyright 2026 llmboard.ai

Capability ranking

Best AI for Reasoning

Use this reasoning model leaderboard to compare the current ranking from the LLMBoard Reasoning Score after applying benchmark evidence requirements.

Updated 2026-08-17

On this page

  • Ranking
  • Overview
  • Leaders
  • Capability
  • Value
  • Composition
  • Compare
  • Top models
  • FAQ

Reasoning Model Leaderboard Ranking

This leaderboard ranking orders models by their LLMBoard Reasoning Score aggregated from eligible benchmark evidence.

30 of 105 rows
Columns

Show columns

Sort by
Rank
Model
LLMBoard Reasoning Score
Context
Official input / 1M
Official output / 1M
Rank01ModelANClaude Opus 4.8AnthropicLLMBoard Reasoning Score99.1Context1MOfficial input / 1M$5Official output / 1M$25
Rank02ModelOPGPT-5.5OpenAILLMBoard Reasoning Score99.1Context1.1MOfficial input / 1M$5Official output / 1M$30
Rank03ModelACQwen3.8 MaxAlibaba Cloud / Qwen TeamLLMBoard Reasoning Score97.7Context1MOfficial input / 1M$2Official output / 1M$6
Rank04ModelGOGemini 3.1 ProGoogleLLMBoard Reasoning Score96.5Context1MOfficial input / 1M$2Official output / 1M$12
Rank05ModelOPGPT-5.4OpenAILLMBoard Reasoning Score91.7Context1.1MOfficial input / 1M$2.5Official output / 1M$15
Rank06ModelACQwen3.7 MaxAlibaba Cloud / Qwen TeamLLMBoard Reasoning Score91.6Context1MOfficial input / 1M$2.5Official output / 1M$7.5
Rank07ModelBYSeed 2.1 ProByteDanceLLMBoard Reasoning Score90.1Context256KOfficial input / 1MN/AOfficial output / 1MN/A
Rank08ModelACQwen3.7 PlusAlibaba Cloud / Qwen TeamLLMBoard Reasoning Score87.9Context1MOfficial input / 1M$0.50Official output / 1M$3
Rank09ModelGOGemma 4 31BGoogleLLMBoard Reasoning Score87.0Context262.1KOfficial input / 1MN/AOfficial output / 1MN/A
Rank10ModelANClaude Opus 4.6AnthropicLLMBoard Reasoning Score84.1Context1MOfficial input / 1M$5Official output / 1M$25
Rank11ModelXIMiMo V2.5 ProXiaomiLLMBoard Reasoning Score83.9Context1MOfficial input / 1M$0.435Official output / 1M$0.87
Rank12ModelACQwen3.8 27BAlibaba Cloud / Qwen TeamLLMBoard Reasoning Score81.3Context262.1KOfficial input / 1MN/AOfficial output / 1MN/A
Rank13ModelACQwen3.5 397B A17BAlibaba Cloud / Qwen TeamLLMBoard Reasoning Score81.0Context262.1KOfficial input / 1M$0.60Official output / 1M$3.6
Rank14ModelOPGPT-5.2-ProOpenAILLMBoard Reasoning Score79.8Context400KOfficial input / 1M$21Official output / 1M$168
Rank15ModelANClaude Sonnet 4.6AnthropicLLMBoard Reasoning Score79.3Context1MOfficial input / 1M$3Official output / 1M$15
Rank16ModelGOGemma 4 26B A4BGoogleLLMBoard Reasoning Score78.7Context262.1KOfficial input / 1MN/AOfficial output / 1MN/A
Rank17ModelANClaude Sonnet 3.5AnthropicLLMBoard Reasoning Score77.6Context200KOfficial input / 1MN/AOfficial output / 1MN/A
Rank18ModelBYSeed 2.1 TurboByteDanceLLMBoard Reasoning Score76.4Context256KOfficial input / 1MN/AOfficial output / 1MN/A
Rank19ModelMAKimi K2.5Moonshot AILLMBoard Reasoning Score76.2Context262.1KOfficial input / 1M$0.60Official output / 1M$3
Rank20ModelACQwen3.6 PlusAlibaba Cloud / Qwen TeamLLMBoard Reasoning Score75.7Context1MOfficial input / 1M$0.50Official output / 1M$3
Rank21ModelOPGPT-5.2OpenAILLMBoard Reasoning Score75.5Context400KOfficial input / 1M$1.75Official output / 1M$14
Rank22ModelANClaude Opus 3AnthropicLLMBoard Reasoning Score73.7Context200KOfficial input / 1MN/AOfficial output / 1MN/A
Rank23ModelGOGemini 3 ProGoogleLLMBoard Reasoning Score72.9Context1MOfficial input / 1MN/AOfficial output / 1MN/A
Rank24ModelGOGemini 3 FlashGoogleLLMBoard Reasoning Score71.5Context1MOfficial input / 1M$0.50Official output / 1M$3
Rank25ModelCOCommand R+CohereLLMBoard Reasoning Score71.2Context128KOfficial input / 1M$2.5Official output / 1M$10
Rank26ModelACQwen3 235B A22B ThinkingAlibaba Cloud / Qwen TeamLLMBoard Reasoning Score70.9Context262.1KOfficial input / 1MN/AOfficial output / 1MN/A
Rank27ModelMEMuse SparkMetaLLMBoard Reasoning Score70.4ContextN/AOfficial input / 1MN/AOfficial output / 1MN/A
Rank28ModelGOGemma 4 12BGoogleLLMBoard Reasoning Score69.8ContextN/AOfficial input / 1MN/AOfficial output / 1MN/A
Rank29ModelGOGemma 2 27BGoogleLLMBoard Reasoning Score68.6ContextN/AOfficial input / 1MN/AOfficial output / 1MN/A
Rank30ModelAMNova ProAmazonLLMBoard Reasoning Score68.5Context300KOfficial input / 1M$0.80Official output / 1M$3.2
Rank31ModelOPGPT-4OpenAILLMBoard Reasoning Score67.5Context8.2KOfficial input / 1M$30Official output / 1M$60
Rank32ModelMELlama 3.1 405BMetaLLMBoard Reasoning Score67.0Context128KOfficial input / 1MN/AOfficial output / 1MN/A
Rank33ModelTMInkling SmallThinking Machines LabLLMBoard Reasoning Score66.5Context1MOfficial input / 1MN/AOfficial output / 1MN/A
Rank34ModelACQwen3.5 122B A10BAlibaba Cloud / Qwen TeamLLMBoard Reasoning Score62.4Context262.1KOfficial input / 1M$0.40Official output / 1M$3.2
Rank35ModelGOGemini 1.5 ProGoogleLLMBoard Reasoning Score61.9Context2.1MOfficial input / 1MN/AOfficial output / 1MN/A
Rank36ModelMIPhi 3.5 MoEMicrosoftLLMBoard Reasoning Score61.7ContextN/AOfficial input / 1MN/AOfficial output / 1MN/A
Rank37ModelACQwen3 235B A22BAlibaba Cloud / Qwen TeamLLMBoard Reasoning Score60.7Context262.1KOfficial input / 1M$0.70Official output / 1M$2.8
Rank38ModelANClaude Opus 4.5AnthropicLLMBoard Reasoning Score59.4Context200KOfficial input / 1M$5Official output / 1M$25
Rank39ModelGODiffusionGemma 26B A4BGoogleLLMBoard Reasoning Score59.4ContextN/AOfficial input / 1MN/AOfficial output / 1MN/A
Rank40ModelNRHermes 3 70BNous ResearchLLMBoard Reasoning Score59.1Context131.1KOfficial input / 1MN/AOfficial output / 1MN/A
Rank41ModelANClaude Sonnet 3AnthropicLLMBoard Reasoning Score58.3Context200KOfficial input / 1MN/AOfficial output / 1MN/A
Rank42ModelACQwen3 Next 80B A3B ThinkingAlibaba Cloud / Qwen TeamLLMBoard Reasoning Score57.8Context131.1KOfficial input / 1M$0.50Official output / 1M$6
Rank43ModelNVLlama 3.1 Nemotron 70BNVIDIALLMBoard Reasoning Score57.3Context128KOfficial input / 1MN/AOfficial output / 1MN/A
Rank44ModelACQwen3.6 35B A3BAlibaba Cloud / Qwen TeamLLMBoard Reasoning Score54.9Context262.1KOfficial input / 1M$0.248Official output / 1M$1.49
Rank45ModelGOGemini 1.5 FlashGoogleLLMBoard Reasoning Score54.9Context1MOfficial input / 1MN/AOfficial output / 1MN/A
Rank46ModelOPGPT-4-TurboOpenAILLMBoard Reasoning Score53.6Context128KOfficial input / 1M$10Official output / 1M$30
Rank47ModelACQwen3 VL 235B A22BAlibaba Cloud / Qwen TeamLLMBoard Reasoning Score53.2Context262.1KOfficial input / 1MN/AOfficial output / 1MN/A
Rank48ModelACQwen3.5 35B A3BAlibaba Cloud / Qwen TeamLLMBoard Reasoning Score53.2Context262.1KOfficial input / 1M$0.25Official output / 1M$2
Rank49ModelACQwen3 Next 80B A3BAlibaba Cloud / Qwen TeamLLMBoard Reasoning Score52.9Context131.1KOfficial input / 1M$0.50Official output / 1M$2
Rank50ModelMELlama 3.1 70BMetaLLMBoard Reasoning Score52.8Context128KOfficial input / 1MN/AOfficial output / 1MN/A
Rank51ModelACQwen3.6 27BAlibaba Cloud / Qwen TeamLLMBoard Reasoning Score51.8Context262.1KOfficial input / 1M$0.60Official output / 1M$3.6
Rank52ModelAMNova LiteAmazonLLMBoard Reasoning Score51.3Context300KOfficial input / 1M$0.06Official output / 1M$0.24
Rank53ModelACQwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen TeamLLMBoard Reasoning Score51.2Context262.1KOfficial input / 1MN/AOfficial output / 1MN/A
Rank54ModelACQwen3.5 27BAlibaba Cloud / Qwen TeamLLMBoard Reasoning Score50.8Context262.1KOfficial input / 1M$0.30Official output / 1M$2.4
Rank55ModelACQwen2 72BAlibaba Cloud / Qwen TeamLLMBoard Reasoning Score50.8ContextN/AOfficial input / 1MN/AOfficial output / 1MN/A
Rank56ModelXAGrok 4xAILLMBoard Reasoning Score50.8Context256KOfficial input / 1MN/AOfficial output / 1MN/A
Rank57ModelACQwen2.5 32BAlibaba Cloud / Qwen TeamLLMBoard Reasoning Score50.5ContextN/AOfficial input / 1M$0.70Official output / 1M$2.8
Rank58ModelGOGemma 2 9BGoogleLLMBoard Reasoning Score49.9ContextN/AOfficial input / 1MN/AOfficial output / 1MN/A
Rank59ModelMELongCat Flash ChatMeituanLLMBoard Reasoning Score48.7Context128KOfficial input / 1MN/AOfficial output / 1MN/A
Rank60ModelACQwen3.5 9BAlibaba Cloud / Qwen TeamLLMBoard Reasoning Score47.3Context262.1KOfficial input / 1MN/AOfficial output / 1MN/A
Rank61ModelACQwen3 VL 32B ThinkingAlibaba Cloud / Qwen TeamLLMBoard Reasoning Score46.9ContextN/AOfficial input / 1MN/AOfficial output / 1MN/A
Rank62ModelMAMistral NeMoMistral AILLMBoard Reasoning Score46.9Context128KOfficial input / 1M$0.15Official output / 1M$0.15
Rank63ModelGOGemma 3 27BGoogleLLMBoard Reasoning Score46.6Context131.1KOfficial input / 1MN/AOfficial output / 1MN/A
Rank64ModelANClaude Haiku 3AnthropicLLMBoard Reasoning Score46.4Context200KOfficial input / 1MN/AOfficial output / 1MN/A
Rank65ModelACQwen2.5 Coder 32BAlibaba Cloud / Qwen TeamLLMBoard Reasoning Score46.3Context131.1KOfficial input / 1MN/AOfficial output / 1MN/A
Rank66ModelALJamba 1.5 LargeAI21 LabsLLMBoard Reasoning Score46.0Context256KOfficial input / 1MN/AOfficial output / 1MN/A
Rank67ModelOPo3OpenAILLMBoard Reasoning Score45.9Context200KOfficial input / 1M$2Official output / 1M$8
Rank68ModelGOGemma 4 E4BGoogleLLMBoard Reasoning Score44.9Context131.1KOfficial input / 1MN/AOfficial output / 1MN/A
Rank69ModelANClaude Haiku 3.5AnthropicLLMBoard Reasoning Score42.1Context200KOfficial input / 1MN/AOfficial output / 1MN/A
Rank70ModelAMNova MicroAmazonLLMBoard Reasoning Score40.0Context128KOfficial input / 1M$0.035Official output / 1M$0.14
Rank71ModelGOGemma 3 12BGoogleLLMBoard Reasoning Score39.3Context131.1KOfficial input / 1MN/AOfficial output / 1MN/A
Rank72ModelACQwen3 VL 32BAlibaba Cloud / Qwen TeamLLMBoard Reasoning Score38.5ContextN/AOfficial input / 1MN/AOfficial output / 1MN/A
Rank73ModelACQwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen TeamLLMBoard Reasoning Score37.3Context262.1KOfficial input / 1MN/AOfficial output / 1MN/A
Rank74ModelANClaude Opus 4AnthropicLLMBoard Reasoning Score36.8Context200KOfficial input / 1MN/AOfficial output / 1MN/A
Rank75ModelACQwen3.5 4BAlibaba Cloud / Qwen TeamLLMBoard Reasoning Score35.6ContextN/AOfficial input / 1MN/AOfficial output / 1MN/A
Rank76ModelOPGPT-4o-miniOpenAILLMBoard Reasoning Score35.2Context128KOfficial input / 1M$0.15Official output / 1M$0.60
Rank77ModelALJamba 1.5 MiniAI21 LabsLLMBoard Reasoning Score34.8Context256.1KOfficial input / 1MN/AOfficial output / 1MN/A
Rank78ModelMAMinistral 8BMistral AILLMBoard Reasoning Score34.1Context131.1KOfficial input / 1MN/AOfficial output / 1MN/A
Rank79ModelMIPhi 4MicrosoftLLMBoard Reasoning Score33.5Context16KOfficial input / 1M$0.125Official output / 1M$0.50
Rank80ModelGOGemma 4 E2BGoogleLLMBoard Reasoning Score32.8Context131.1KOfficial input / 1MN/AOfficial output / 1MN/A
Rank81ModelACQwen3 VL 8B ThinkingAlibaba Cloud / Qwen TeamLLMBoard Reasoning Score31.8Context262.1KOfficial input / 1MN/AOfficial output / 1MN/A
Rank82ModelACQwen3 VL 30B A3BAlibaba Cloud / Qwen TeamLLMBoard Reasoning Score30.1Context262.1KOfficial input / 1MN/AOfficial output / 1MN/A
Rank83ModelACQwen3 VL 4B ThinkingAlibaba Cloud / Qwen TeamLLMBoard Reasoning Score27.8Context262.1KOfficial input / 1MN/AOfficial output / 1MN/A
Rank84ModelMIPhi 3.5 miniMicrosoftLLMBoard Reasoning Score27.6Context128KOfficial input / 1MN/AOfficial output / 1MN/A
Rank85ModelIBGranite 3.3 8BIBMLLMBoard Reasoning Score27.4Context128KOfficial input / 1MN/AOfficial output / 1MN/A
Rank86ModelMELlama 3.1 8BMetaLLMBoard Reasoning Score26.4Context128KOfficial input / 1MN/AOfficial output / 1MN/A
Rank87ModelGOGemma 3n E4B LiteRTGoogleLLMBoard Reasoning Score25.7ContextN/AOfficial input / 1MN/AOfficial output / 1MN/A
Rank88ModelMIPhi 4 MiniMicrosoftLLMBoard Reasoning Score23.8Context128KOfficial input / 1M$0.075Official output / 1M$0.30
Rank89ModelMELlama 3.2 3BMetaLLMBoard Reasoning Score23.2Context128KOfficial input / 1MN/AOfficial output / 1MN/A
Rank90ModelACQwen2.5 Coder 7BAlibaba Cloud / Qwen TeamLLMBoard Reasoning Score22.8ContextN/AOfficial input / 1M$0.144Official output / 1M$0.287
Rank91ModelOPGPT-4oOpenAILLMBoard Reasoning Score22.3Context128KOfficial input / 1M$2.5Official output / 1M$10
Rank92ModelACQwen3 VL 8BAlibaba Cloud / Qwen TeamLLMBoard Reasoning Score22.0Context262.1KOfficial input / 1MN/AOfficial output / 1MN/A
Rank93ModelGOGemma 3 4BGoogleLLMBoard Reasoning Score21.7Context131.1KOfficial input / 1MN/AOfficial output / 1MN/A
Rank94ModelACQwen2.5 14BAlibaba Cloud / Qwen TeamLLMBoard Reasoning Score20.2ContextN/AOfficial input / 1M$0.35Official output / 1M$1.4
Rank95ModelOPGPT-3.5-TurboOpenAILLMBoard Reasoning Score18.0Context16.4KOfficial input / 1M$0.50Official output / 1M$1.5
Rank96ModelGOGemini DiffusionGoogleLLMBoard Reasoning Score16.2ContextN/AOfficial input / 1MN/AOfficial output / 1MN/A
Rank97ModelIBIBM Granite 4.0 TinyIBMLLMBoard Reasoning Score15.9ContextN/AOfficial input / 1MN/AOfficial output / 1MN/A
Rank98ModelACQwen3.5 2BAlibaba Cloud / Qwen TeamLLMBoard Reasoning Score14.9ContextN/AOfficial input / 1MN/AOfficial output / 1MN/A
Rank99ModelACQwen3 VL 4BAlibaba Cloud / Qwen TeamLLMBoard Reasoning Score12.2Context262.1KOfficial input / 1MN/AOfficial output / 1MN/A
Rank100ModelGOGemma 3n E2B LiteRTGoogleLLMBoard Reasoning Score9.5ContextN/AOfficial input / 1MN/AOfficial output / 1MN/A
Rank101ModelGOGemma 3n E4BGoogleLLMBoard Reasoning Score8.0Context32KOfficial input / 1MN/AOfficial output / 1MN/A
Rank102ModelBAERNIE 4.5BaiduLLMBoard Reasoning Score6.3Context128KOfficial input / 1MN/AOfficial output / 1MN/A
Rank103ModelACQwen3.5 0.8BAlibaba Cloud / Qwen TeamLLMBoard Reasoning Score2.2ContextN/AOfficial input / 1MN/AOfficial output / 1MN/A
Rank104ModelGOGemma 3n E2BGoogleLLMBoard Reasoning Score1.8ContextN/AOfficial input / 1MN/AOfficial output / 1MN/A
Rank105ModelGOGemma 3 1BGoogleLLMBoard Reasoning Score0.1ContextN/AOfficial input / 1MN/AOfficial output / 1MN/A

Official PAYG prices appear here. Third-party offers remain on the pricing and model detail pages.

What this leaderboard says

Key findings from the current reasoning leaderboard ranking and its supporting benchmark coverage.

Ranked models105
Vendors20
Open-weight models23
Official prices41
Top reasoning modelClaude Opus 4.899.1 reasoning scoreBest open-weight modelGemma 4 31BRank #9Lowest official inputNova Micro$0.04 / 1MLargest contextGemini 1.5 Pro2.1M tokens

Claude Opus 4.8 leads this page at 99.1, 0.0 points ahead of GPT-5.5.

Gemma 4 31B is the highest-ranked open-weight option at #9. Nova Micro has the lowest official input price among ranked models.

Reasoning Leaderboard Leaders

The leading reasoning scores in this benchmark-backed ranking, with the axis focused on the competitive leaderboard range.

Top reasoning models

Reasoning Benchmark Profile

Compare reasoning benchmark strength with each model's broader capability score and leaderboard position.

ModelReasoningKnowledgeMathCodingInstruction
Claude Opus 4.8Anthropic99.192.9N/A84.8N/A
GPT-5.5OpenAI99.182.762.573.6N/A
Qwen3.8 MaxAlibaba Cloud / Qwen Team97.770.4N/A75.9100.0
Gemini 3.1 ProGoogle96.589.8N/A54.2N/A
GPT-5.4OpenAI91.762.281.355.1N/A
26.24665.985.8105.7-7.218.844.970.996.9LLMBoard Reasoning ScoreLLMBoard Overall Score
80 models with comparable dataOpen a model by selecting its logo
GPQA94.3%Gemini 3.1 Pro89 compared models
MMLU-Pro89.6%Qwen3.7 Max67 compared models
AIME 2025100.0%Gemini 3 Pro29 compared models
SWE-Bench Verified88.6%Claude Opus 4.829 compared models
LiveCodeBench79.0%Grok-413 compared models
HumanEval93.7%Claude 3.5 Sonnet40 compared models
BrowseComp86.2%Seed 2.1 Pro17 compared models
LiveCodeBench v691.6%Qwen3.7 Max34 compared models

Capability at each price point

Official vendor API prices plotted against the reasoning metric used on this page. Price remains a separate decision signal.

020406080100$0.05$0.1$0.2$0.5$1.0$2.0$5.0$10LLMBoard Reasoning ScoreOfficial API price blend (8:1 input/output), USD / 1M
Efficient frontier41 models with official PAYG prices

Reasoning Leaderboard Composition

Vendor concentration and model access among the first 25 products in the ranking.

Top-model vendor mix

25 models
Alibaba Cloud / Qwen Team6Anthropic5Google5OpenAI4ByteDance2Xiaomi1Moonshot AI1Cohere1

Access model

Open weights
6
Closed weights
19
Official price available
17

Compare the leaders

Open focused comparisons between the current leader and the nearest practical alternatives.

Claude Opus 4.8vsGPT-5.5Claude Opus 4.8vsGemma 4 31BClaude Opus 4.8vsNova Micro
Overall leaderboardCoding leaderboardMath leaderboardKnowledge leaderboardInstruction leaderboard

The Top AI Models for Reasoning

A data-backed look at the first five models in this reasoning leaderboard ranking, including benchmark context, price and output speed where available.

Ranking basisThis reasoning AI model leaderboard uses the reasoning capability score shown on this page. The leaderboard ranking keeps matched price and speed data separate from benchmark evidence.

  1. 01
    AN
    Claude Opus 4.8Anthropic
    LLMBoard Reasoning Score
    99.1
    Price
    $5.0 input / $25 output per 1M tokens
    Speed
    Up to 46 tok/s via Anthropic

    Strengths

    • Ranks #1 with 99.1 LLMBoard Reasoning Score
    • 1M-token context window

    Considerations

    • Evidence coverage is 60%
    • Weights are not marked as open
  2. 02
    OP
    GPT-5.5OpenAI
    LLMBoard Reasoning Score
    99.1
    Price
    $5.0 input / $30 output per 1M tokens

    Strengths

    • Ranks #2 with 99.1 LLMBoard Reasoning Score
    • 1.1M-token context window

    Considerations

    • Weights are not marked as open
  3. 03
    AC
    Qwen3.8 MaxAlibaba Cloud / Qwen Team
    LLMBoard Reasoning Score
    97.7
    Price
    $2.0 input / $6.0 output per 1M tokens

    Strengths

    • Ranks #3 with 97.7 LLMBoard Reasoning Score
    • Lowest official input price among the current top five
    • 1M-token context window

    Considerations

    • Weights are not marked as open
  4. 04
    GO
    Gemini 3.1 ProGoogle
    LLMBoard Reasoning Score
    96.5
    Price
    $2.0 input / $12 output per 1M tokens
    Speed
    Up to 23 tok/s via Google

    Strengths

    • Ranks #4 with 96.5 LLMBoard Reasoning Score
    • Lowest official input price among the current top five
    • 1M-token context window

    Considerations

    • Evidence coverage is 60%
    • Weights are not marked as open
  5. 05
    OP
    GPT-5.4OpenAI
    LLMBoard Reasoning Score
    91.7
    Price
    $2.5 input / $15 output per 1M tokens
    Speed
    Up to 9.1 tok/s via OpenAI

    Strengths

    • Ranks #5 with 91.7 LLMBoard Reasoning Score
    • 1.1M-token context window

    Considerations

    • Weights are not marked as open

Selection summary

Best AI Models for Reasoning

Claude Opus 4.8 is currently the best-ranked LLM for reasoning with a 99.1 reasoning score. The score is a relative ranking signal, so price, speed, context and evidence coverage should still be checked separately.

Use this leaderboard with the supporting benchmark results and coverage details above. A leaderboard position summarizes the selected ranking signal; it does not replace workload-specific testing.

Capability rank #1Claude Opus 4.8Up to 46 tok/s via AnthropicCapability rank #2GPT-5.5$5.0 input / $30 output per 1M tokensCapability rank #3Qwen3.8 Max$2.0 input / $6.0 output per 1M tokens

About this leaderboard

Common questions about the Best AI for Reasoning leaderboard, benchmark evidence and ranking method.

What is the best model on Best AI for Reasoning?

Claude Opus 4.8 is currently ranked first with a reasoning score of 99.1.

How is this leaderboard ranked?

Each model appears once using its current scored version. The leaderboard ranking follows the capability named in the title, while the overall page uses the LLMBoard score aggregated from eligible benchmark evidence.

How many models are included?

This page currently ranks 105 unique model products.

Where does pricing come from?

Main price columns use the model vendor's official standard PAYG API rate. Eligible third-party offers appear only in separately labeled columns, and unavailable official prices display as N/A.

Does Arena affect the score?

No. Arena results are displayed as an independent signal and are not included in the current LLMBoard capability score.