llmboard.aiAI model intelligence
Home

Model Rankings

OverallOpen ModelsAgentCodingReasoningMathKnowledgeInstruction FollowingTextVision
Image GenerationImage Editing
Video GenerationImage to VideoVideo Editing
Text to SpeechSpeech to Text
Embeddings

Efficiency

Chat Token PricingImage PricingVideo PricingAudio Pricing
Chat Speed & LatencyProvider Reliability

Benchmarks

GPQAMMLU-ProAIME 2025SWE-Bench VerifiedMMLUHumanity's Last ExamLiveCodeBenchMATHHumanEvalMMMU-Pro
All Benchmarks

Tools

Model DirectoryCompare Models

Scoring & Data

Scoring & Data
393 models668 benchmarks

Leaderboard Center

Overall RankingCodingCore BenchmarksPrice & ValueRuntime Performance

Modalities

All ModelsImage GenerationImage EditingVideo GenerationImage-to-VideoVideo EditingText-to-SpeechSpeech-to-TextEmbeddings

Data & Methods

Scoring MethodAll BenchmarksReasoningMath

Vendors

All VendorsOpenAIAnthropicGoogle
llmboard.aiCopyright 2026 llmboard.ai

reasoning benchmark

SWE-Bench Verified Leaderboard

A verified subset of 500 software engineering problems from real GitHub issues, validated by human annotators for evaluating language models' ability to resolve real-world coding issues by generating patches for Python codebases.

Updated Aug 17, 2026

Models100
Model coverage111
MetricScore
EvidenceC

On this page

  • Ranking
  • Highlights
  • Distribution
  • Top models
  • About
  • FAQ

SWE-Bench Verified Ranking

Higher score ranks better on this benchmark.

30 of 100 rows
Columns

Show columns

Sort by
Rank
Model
Score
Percentile
Participants
Evidence
Evaluated
Rank01ModelANClaude Fable 5AnthropicScore95.0%Percentile100.0%Participants111EvidenceCEvaluatedAug 17, 2026
Rank02ModelANClaude Mythos PreviewAnthropicScore93.9%Percentile99.1%Participants111EvidenceCEvaluatedAug 17, 2026
Rank03ModelANClaude Opus 4.8AnthropicScore88.6%Percentile98.2%Participants111EvidenceCEvaluatedAug 17, 2026
Rank04ModelANClaude Opus 4.7AnthropicScore87.6%Percentile97.3%Participants111EvidenceCEvaluatedAug 17, 2026
Rank05ModelANClaude Sonnet 5AnthropicScore85.2%Percentile96.4%Participants111EvidenceCEvaluatedAug 17, 2026
Rank06ModelANClaude Opus 4.5AnthropicScore80.9%Percentile95.5%Participants111EvidenceCEvaluatedAug 17, 2026
Rank07ModelANClaude Opus 4.6AnthropicScore80.8%Percentile94.5%Participants111EvidenceCEvaluatedAug 17, 2026
Rank08ModelDEDeepSeek-V4-Pro-MaxDeepSeekScore80.6%Percentile93.6%Participants111EvidenceCEvaluatedAug 17, 2026
Rank09ModelGOGemini 3.1 ProGoogleScore80.6%Percentile92.7%Participants111EvidenceCEvaluatedAug 17, 2026
Rank10ModelMIMiniMax M3MiniMaxScore80.5%Percentile91.8%Participants111EvidenceCEvaluatedAug 17, 2026
Rank11ModelACQwen3.7 MaxAlibaba Cloud / Qwen TeamScore80.4%Percentile90.9%Participants111EvidenceCEvaluatedAug 17, 2026
Rank12ModelTMInkling-SmallThinking Machines LabScore80.2%Percentile90.0%Participants111EvidenceCEvaluatedAug 17, 2026
Rank13ModelMAKimi K2.6Moonshot AIScore80.2%Percentile89.1%Participants111EvidenceCEvaluatedAug 17, 2026
Rank14ModelMIMiniMax M2.5MiniMaxScore80.2%Percentile88.2%Participants111EvidenceCEvaluatedAug 17, 2026
Rank15ModelOPGPT-5.2OpenAIScore80.0%Percentile87.3%Participants111EvidenceCEvaluatedAug 17, 2026
Rank16ModelANClaude Sonnet 4.6AnthropicScore79.6%Percentile86.4%Participants111EvidenceCEvaluatedAug 17, 2026
Rank17ModelDEDeepSeek-V4-Flash-MaxDeepSeekScore79.0%Percentile85.5%Participants111EvidenceCEvaluatedAug 17, 2026
Rank18ModelXIMiMo-V2.5-ProXiaomiScore78.9%Percentile84.5%Participants111EvidenceCEvaluatedAug 17, 2026
Rank19ModelACQwen3.6 PlusAlibaba Cloud / Qwen TeamScore78.8%Percentile83.6%Participants111EvidenceCEvaluatedAug 17, 2026
Rank20ModelDEDeepSeek-V4-Flash-0423DeepSeekScore78.6%Percentile82.7%Participants111EvidenceCEvaluatedAug 17, 2026
Rank21ModelGOGemini 3 FlashGoogleScore78.0%Percentile81.8%Participants111EvidenceCEvaluatedAug 17, 2026
Rank22ModelTEHy3TencentScore78.0%Percentile80.9%Participants111EvidenceCEvaluatedAug 17, 2026
Rank23ModelXIMiMo-V2-ProXiaomiScore78.0%Percentile80.0%Participants111EvidenceCEvaluatedAug 17, 2026
Rank24ModelZAGLM-5Zhipu AIScore77.8%Percentile79.1%Participants111EvidenceCEvaluatedAug 17, 2026
Rank25ModelACQwen3.7-PlusAlibaba Cloud / Qwen TeamScore77.7%Percentile78.2%Participants111EvidenceCEvaluatedAug 17, 2026
Rank26ModelMAMistral Medium 3.5Mistral AIScore77.6%Percentile77.3%Participants111EvidenceCEvaluatedAug 17, 2026
Rank27ModelMEMuse SparkMetaScore77.4%Percentile76.4%Participants111EvidenceCEvaluatedAug 17, 2026
Rank28ModelACQwen3.6-27BAlibaba Cloud / Qwen TeamScore77.2%Percentile75.5%Participants111EvidenceCEvaluatedAug 17, 2026
Rank29ModelMAKimi K2.5Moonshot AIScore76.8%Percentile74.5%Participants111EvidenceCEvaluatedAug 17, 2026
Rank30ModelBYSeed 2.0 ProByteDanceScore76.5%Percentile73.6%Participants111EvidenceCEvaluatedAug 17, 2026
Rank31ModelACQwen3.5-397B-A17BAlibaba Cloud / Qwen TeamScore76.4%Percentile72.7%Participants111EvidenceCEvaluatedAug 17, 2026
Rank32ModelOPGPT-5.1OpenAIScore76.3%Percentile71.8%Participants111EvidenceCEvaluatedAug 17, 2026
Rank33ModelOPGPT-5.1 InstantOpenAIScore76.3%Percentile70.9%Participants111EvidenceCEvaluatedAug 17, 2026
Rank34ModelOPGPT-5.1 ThinkingOpenAIScore76.3%Percentile70.0%Participants111EvidenceCEvaluatedAug 17, 2026
Rank35ModelGOGemini 3 ProGoogleScore76.2%Percentile69.1%Participants111EvidenceCEvaluatedAug 17, 2026
Rank36ModelMEMuse Glimmer-30BMetaScore76.0%Percentile68.2%Participants111EvidenceCEvaluatedAug 17, 2026
Rank37ModelOPGPT-5OpenAIScore74.9%Percentile67.3%Participants111EvidenceCEvaluatedAug 17, 2026
Rank38ModelXIMiMo-V2-OmniXiaomiScore74.8%Percentile66.4%Participants111EvidenceCEvaluatedAug 17, 2026
Rank39ModelANClaude Opus 4.1AnthropicScore74.5%Percentile65.5%Participants111EvidenceCEvaluatedAug 17, 2026
Rank40ModelOPGPT-5 CodexOpenAIScore74.5%Percentile64.5%Participants111EvidenceCEvaluatedAug 17, 2026
Rank41ModelSTStep-3.5-FlashStepFunScore74.4%Percentile63.6%Participants111EvidenceCEvaluatedAug 17, 2026
Rank42ModelZAGLM-4.7Zhipu AIScore73.8%Percentile62.7%Participants111EvidenceCEvaluatedAug 17, 2026
Rank43ModelOPGPT-5.1 CodexOpenAIScore73.7%Percentile61.8%Participants111EvidenceCEvaluatedAug 17, 2026
Rank44ModelMIMAI-Thinking-1MicrosoftScore73.5%Percentile60.9%Participants111EvidenceCEvaluatedAug 17, 2026
Rank45ModelBYSeed 2.0 LiteByteDanceScore73.5%Percentile60.0%Participants111EvidenceCEvaluatedAug 17, 2026
Rank46ModelXIMiMo-V2-FlashXiaomiScore73.4%Percentile59.1%Participants111EvidenceCEvaluatedAug 17, 2026
Rank47ModelACQwen3.6-35B-A3BAlibaba Cloud / Qwen TeamScore73.4%Percentile58.2%Participants111EvidenceCEvaluatedAug 17, 2026
Rank48ModelANClaude Haiku 4.5AnthropicScore73.3%Percentile57.3%Participants111EvidenceCEvaluatedAug 17, 2026
Rank49ModelDEDeepSeek-V3.2 (Thinking)DeepSeekScore73.1%Percentile56.4%Participants111EvidenceCEvaluatedAug 17, 2026
Rank50ModelDEDeepSeek-V3.2DeepSeekScore73.1%Percentile55.5%Participants111EvidenceCEvaluatedAug 17, 2026
Rank51ModelDEDeepSeek-V3.2-SpecialeDeepSeekScore73.1%Percentile54.5%Participants111EvidenceCEvaluatedAug 17, 2026
Rank52ModelANClaude Sonnet 4AnthropicScore72.7%Percentile53.6%Participants111EvidenceCEvaluatedAug 17, 2026
Rank53ModelMIMAI-Code-1.1-FlashMicrosoftScore72.6%Percentile52.7%Participants111EvidenceCEvaluatedAug 17, 2026
Rank54ModelANClaude Opus 4AnthropicScore72.5%Percentile51.8%Participants111EvidenceCEvaluatedAug 17, 2026
Rank55ModelACQwen3.5-27BAlibaba Cloud / Qwen TeamScore72.4%Percentile50.9%Participants111EvidenceCEvaluatedAug 17, 2026
Rank56ModelACQwen3.5-122B-A10BAlibaba Cloud / Qwen TeamScore72.0%Percentile50.0%Participants111EvidenceCEvaluatedAug 17, 2026
Rank57ModelMIMAI-Code-1-FlashMicrosoftScore71.6%Percentile49.1%Participants111EvidenceCEvaluatedAug 17, 2026
Rank58ModelMAKimi K2-Thinking-0905Moonshot AIScore71.3%Percentile48.2%Participants111EvidenceCEvaluatedAug 17, 2026
Rank59ModelPOLaguna XS 2.1PoolsideScore70.9%Percentile47.3%Participants111EvidenceCEvaluatedAug 17, 2026
Rank60ModelXAGrok Code Fast 1xAIScore70.8%Percentile46.4%Participants111EvidenceCEvaluatedAug 17, 2026
Rank61ModelNVNemotron 3 Ultra (550B A55B)NVIDIAScore70.7%Percentile45.5%Participants111EvidenceCEvaluatedAug 17, 2026
Rank62ModelUPSolar Pro 4UpstageScore70.6%Percentile44.5%Participants111EvidenceCEvaluatedAug 17, 2026
Rank63ModelANClaude 3.7 SonnetAnthropicScore70.3%Percentile43.6%Participants111EvidenceCEvaluatedAug 17, 2026
Rank64ModelMELongCat-Flash-Thinking-2601MeituanScore70.0%Percentile42.7%Participants111EvidenceCEvaluatedAug 17, 2026
Rank65ModelAMNova 2 ProAmazonScore70.0%Percentile41.8%Participants111EvidenceCEvaluatedAug 17, 2026
Rank66ModelACQwen3-Coder 480B A35B InstructAlibaba Cloud / Qwen TeamScore69.6%Percentile40.9%Participants111EvidenceCEvaluatedAug 17, 2026
Rank67ModelACQwen3 MaxAlibaba Cloud / Qwen TeamScore69.6%Percentile40.0%Participants111EvidenceCEvaluatedAug 17, 2026
Rank68ModelMIMiniMax M2MiniMaxScore69.4%Percentile39.1%Participants111EvidenceCEvaluatedAug 17, 2026
Rank69ModelACQwen3.5-35B-A3BAlibaba Cloud / Qwen TeamScore69.2%Percentile38.2%Participants111EvidenceCEvaluatedAug 17, 2026
Rank70ModelOPo3OpenAIScore69.1%Percentile37.3%Participants111EvidenceCEvaluatedAug 17, 2026
Rank71ModelOPo4-miniOpenAIScore68.1%Percentile36.4%Participants111EvidenceCEvaluatedAug 17, 2026
Rank72ModelZAGLM-4.6Zhipu AIScore68.0%Percentile35.5%Participants111EvidenceCEvaluatedAug 17, 2026
Rank73ModelDEDeepSeek-V3.2-ExpDeepSeekScore67.8%Percentile34.5%Participants111EvidenceCEvaluatedAug 17, 2026
Rank74ModelCONorth Mini Code 1.0CohereScore67.6%Percentile33.6%Participants111EvidenceCEvaluatedAug 17, 2026
Rank75ModelGOGemini 2.5 Pro Preview 06-05GoogleScore67.2%Percentile32.7%Participants111EvidenceCEvaluatedAug 17, 2026
Rank76ModelMIMiniMax M2.1MiniMaxScore67.0%Percentile31.8%Participants111EvidenceCEvaluatedAug 17, 2026
Rank77ModelDEDeepSeek-V3.1DeepSeekScore66.0%Percentile30.9%Participants111EvidenceCEvaluatedAug 17, 2026
Rank78ModelMAKimi K2-Instruct-0905Moonshot AIScore65.8%Percentile30.0%Participants111EvidenceCEvaluatedAug 17, 2026
Rank79ModelAMNova 2 LiteAmazonScore64.5%Percentile29.1%Participants111EvidenceCEvaluatedAug 17, 2026
Rank80ModelZAGLM-4.5Zhipu AIScore64.2%Percentile28.2%Participants111EvidenceCEvaluatedAug 17, 2026
Rank81ModelGOGemini 2.5 ProGoogleScore63.2%Percentile27.3%Participants111EvidenceCEvaluatedAug 17, 2026
Rank82ModelMADevstral MediumMistral AIScore61.6%Percentile26.4%Participants111EvidenceCEvaluatedAug 17, 2026
Rank83ModelGOGemini 2.5 FlashGoogleScore60.4%Percentile25.4%Participants111EvidenceCEvaluatedAug 17, 2026
Rank84ModelMELongCat-Flash-ChatMeituanScore60.4%Percentile24.6%Participants111EvidenceCEvaluatedAug 17, 2026
Rank85ModelMELongCat-Flash-ThinkingMeituanScore59.4%Percentile23.6%Participants111EvidenceCEvaluatedAug 17, 2026
Rank86ModelZAGLM-4.7-FlashZhipu AIScore59.2%Percentile22.7%Participants111EvidenceCEvaluatedAug 17, 2026
Rank87ModelZAGLM-4.5-AirZhipu AIScore57.6%Percentile21.8%Participants111EvidenceCEvaluatedAug 17, 2026
Rank88ModelMIMiniMax M1 80KMiniMaxScore56.0%Percentile20.9%Participants111EvidenceCEvaluatedAug 17, 2026
Rank89ModelMIMiniMax M1 40KMiniMaxScore55.6%Percentile20.0%Participants111EvidenceCEvaluatedAug 17, 2026
Rank90ModelOPGPT-4.1OpenAIScore54.6%Percentile19.1%Participants111EvidenceCEvaluatedAug 17, 2026
Rank91ModelMELongCat-Flash-LiteMeituanScore54.4%Percentile18.2%Participants111EvidenceCEvaluatedAug 17, 2026
Rank92ModelNVNemotron 3 Super (120B A12B)NVIDIAScore53.7%Percentile17.3%Participants111EvidenceCEvaluatedAug 17, 2026
Rank93ModelMADevstral Small 1.1Mistral AIScore53.6%Percentile16.4%Participants111EvidenceCEvaluatedAug 17, 2026
Rank94ModelNVNemotron 3.5 Lightning (30B A3B)NVIDIAScore51.6%Percentile15.4%Participants111EvidenceCEvaluatedAug 17, 2026
Rank95ModelOPo3-miniOpenAIScore49.3%Percentile14.6%Participants111EvidenceCEvaluatedAug 17, 2026
Rank96ModelANClaude 3.5 SonnetAnthropicScore49.0%Percentile13.6%Participants111EvidenceCEvaluatedAug 17, 2026
Rank97ModelSASarvam-105BSarvam AIScore45.0%Percentile12.7%Participants111EvidenceCEvaluatedAug 17, 2026
Rank98ModelDEDeepSeek-R1-0528DeepSeekScore44.6%Percentile11.8%Participants111EvidenceCEvaluatedAug 17, 2026
Rank99ModelDEDeepSeek-V3DeepSeekScore42.0%Percentile10.9%Participants111EvidenceCEvaluatedAug 17, 2026
Rank100ModelOPo1-previewOpenAIScore41.3%Percentile10.0%Participants111EvidenceCEvaluatedAug 17, 2026

SWE-Bench Verified Highlights

The leading models and scores on this benchmark.

Rank #1Claude Fable 595.0%Rank #2Claude Mythos Preview93.9%Rank #3Claude Opus 4.888.6%Rank #4Claude Opus 4.787.6%

SWE-Bench Verified Score Distribution

A closer view of the leading scores on this benchmark.

SWE-Bench Verified

The Top AI Models for SWE-Bench Verified

The first five results on this benchmark, with official price and output speed added where the model identity can be matched.

Ranking basisThis swe-bench verified AI model leaderboard uses descending score in the benchmark's original unit. The leaderboard ranking keeps matched price and speed data separate from benchmark evidence.

  1. 01
    AN
    Claude Fable 5Anthropic
    Score
    95.0%
    Price
    $10 input / $50 output per 1M tokens
    Speed
    Up to 9.1 tok/s via Anthropic

    Strengths

    • Ranks #1 of 111 compared models
    • 100th percentile on this benchmark
    • C evidence result

    Considerations

    • This result measures SWE-Bench Verified, not total model capability
  2. 02
    AN
    Claude Mythos PreviewAnthropic
    Score
    93.9%

    Strengths

    • Ranks #2 of 111 compared models
    • 99th percentile on this benchmark
    • C evidence result

    Considerations

    • This result measures SWE-Bench Verified, not total model capability
  3. 03
    AN
    Claude Opus 4.8Anthropic
    Score
    88.6%
    Price
    $5.0 input / $25 output per 1M tokens
    Speed
    Up to 46 tok/s via Anthropic

    Strengths

    • Ranks #3 of 111 compared models
    • 98th percentile on this benchmark
    • C evidence result

    Considerations

    • This result measures SWE-Bench Verified, not total model capability
  4. 04
    AN
    Claude Opus 4.7Anthropic
    Score
    87.6%
    Price
    $5.0 input / $25 output per 1M tokens
    Speed
    Up to 42 tok/s via Anthropic

    Strengths

    • Ranks #4 of 111 compared models
    • 97th percentile on this benchmark
    • C evidence result

    Considerations

    • This result measures SWE-Bench Verified, not total model capability
  5. 05
    AN
    Claude Sonnet 5Anthropic
    Score
    85.2%
    Price
    $2.0 input / $10 output per 1M tokens
    Speed
    Up to 11 tok/s via Anthropic

    Strengths

    • Ranks #5 of 111 compared models
    • 96th percentile on this benchmark
    • C evidence result

    Considerations

    • This result measures SWE-Bench Verified, not total model capability

Selection summary

Best AI Models for SWE-Bench Verified

Claude Fable 5 currently leads SWE-Bench Verified with 95.0%. It is the top model on this specific benchmark, while the best LLM for the broader task should also be checked against other benchmarks, price and runtime.

Use this leaderboard with the supporting benchmark results and coverage details above. A leaderboard position summarizes the selected ranking signal; it does not replace workload-specific testing.

Benchmark rank #1Claude Fable 595.0% · $10 input / $50 output per 1M tokensBenchmark rank #2Claude Mythos Preview93.9%Benchmark rank #3Claude Opus 4.888.6% · $5.0 input / $25 output per 1M tokens

What is SWE-Bench Verified?

What SWE-Bench Verified measures and how its scores work.

A verified subset of 500 software engineering problems from real GitHub issues, validated by human annotators for evaluating language models' ability to resolve real-world coding issues by generating patches for Python codebases.

Scores are shown in ratio. This benchmark is not independently verified and has an evidence level of C.

Family
SWE-Bench Verified
Modality
text
Primary category
reasoning
Score direction
higher
LLMBoard eligible
Yes
Evaluation key
swe-bench-verified|llm-stats-current

Benchmark scores retain their original unit. Overall score eligibility is shown separately.

FAQ

Common questions about SWE-Bench Verified.

Which model scores highest on SWE-Bench Verified?

Claude Fable 5 is currently ranked first with 95.0%.

What does SWE-Bench Verified measure?

A verified subset of 500 software engineering problems from real GitHub issues, validated by human annotators for evaluating language models' ability to resolve real-world coding issues by generating patches for Python codebases.

Is a higher score better?

Yes. Higher values rank better for this benchmark.

How many models are compared?

100 model results are currently shown.

Does this benchmark affect the overall score?

Yes. This benchmark can contribute to the current LLMBoard capability score.