llmboard.aiAI model intelligence
Home

Model Rankings

OverallOpen ModelsAgentCodingReasoningMathKnowledgeInstruction FollowingTextVision
Image GenerationImage Editing
Video GenerationImage to VideoVideo Editing
Text to SpeechSpeech to Text
Embeddings

Efficiency

Chat Token PricingImage PricingVideo PricingAudio Pricing
Chat Speed & LatencyProvider Reliability

Benchmarks

GPQAMMLU-ProAIME 2025SWE-Bench VerifiedMMLUHumanity's Last ExamLiveCodeBenchMATHHumanEvalMMMU-Pro
All Benchmarks

Tools

Model DirectoryCompare Models

Scoring & Data

Scoring & Data
393 models668 benchmarks

Leaderboard Center

Overall RankingCodingCore BenchmarksPrice & ValueRuntime Performance

Modalities

All ModelsImage GenerationImage EditingVideo GenerationImage-to-VideoVideo EditingText-to-SpeechSpeech-to-TextEmbeddings

Data & Methods

Scoring MethodAll BenchmarksReasoningMath

Vendors

All VendorsOpenAIAnthropicGoogle
llmboard.aiCopyright 2026 llmboard.ai

Arena benchmark

LM Arena Document Leaderboard

LM Arena Document model ratings and results.

Updated Aug 17, 2026. Data as of 2026-08-17

Models33
Categories1
Result typerating

On this page

  • Ranking
  • Highlights
  • Distribution
  • Top models
  • About
  • FAQ

Document Ranking

Models are ordered by their Arena rank.

30 of 33 rows
Columns

Show columns

Sort by
Rank
Model
Organization
Rating / score
Votes
Observations
Result date
Rank01ModelANClaude Opus 5AnthropicOrganizationanthropicRating / score1520.1Votes1,663ObservationsN/AResult dateJul 30, 2026
Rank02ModelANClaude Opus 4.6AnthropicOrganizationanthropicRating / score1509.9Votes37,271ObservationsN/AResult dateJul 30, 2026
Rank04ModelANClaude Fable 5AnthropicOrganizationanthropicRating / score1504.2Votes5,792ObservationsN/AResult dateJul 30, 2026
Rank05ModelANClaude Opus 4.7AnthropicOrganizationanthropicRating / score1498.1Votes18,990ObservationsN/AResult dateJul 30, 2026
Rank07ModelOPGPT-5.5OpenAIOrganizationopenaiRating / score1484.7Votes16,816ObservationsN/AResult dateJul 30, 2026
Rank08ModelANClaude Sonnet 4.6AnthropicOrganizationanthropicRating / score1482.8Votes54,427ObservationsN/AResult dateJul 30, 2026
Rank10ModelOPGPT-5.6 TerraOpenAIOrganizationopenaiRating / score1479.2Votes1,969ObservationsN/AResult dateJul 30, 2026
Rank11ModelOPGPT-5.6 SolOpenAIOrganizationopenaiRating / score1478.7Votes1,152ObservationsN/AResult dateJul 30, 2026
Rank12ModelANClaude Opus 4.8AnthropicOrganizationanthropicRating / score1474.6Votes8,388ObservationsN/AResult dateJul 30, 2026
Rank13ModelMEMuse Spark 1.1MetaOrganizationmetaRating / score1471.7Votes2,054ObservationsN/AResult dateJul 30, 2026
Rank14ModelANClaude Sonnet 5AnthropicOrganizationanthropicRating / score1470.2Votes3,601ObservationsN/AResult dateJul 30, 2026
Rank15ModelOPGPT-5.4OpenAIOrganizationopenaiRating / score1470.1Votes29,809ObservationsN/AResult dateJul 30, 2026
Rank17ModelGOGemini 3.5 FlashGoogleOrganizationgoogleRating / score1464.6Votes3,689ObservationsN/AResult dateJul 30, 2026
Rank18ModelOPGPT-5.6 LunaOpenAIOrganizationopenaiRating / score1462.3Votes1,888ObservationsN/AResult dateJul 30, 2026
Rank19ModelANClaude Opus 4.5AnthropicOrganizationanthropicRating / score1461.7Votes7,965ObservationsN/AResult dateJul 30, 2026
Rank20ModelXAGrok 4.5xAIOrganizationxaiRating / score1453.7Votes2,435ObservationsN/AResult dateJul 30, 2026
Rank21ModelMAKimi K2.6Moonshot AIOrganizationmoonshotRating / score1450.9Votes11,181ObservationsN/AResult dateJul 30, 2026
Rank22ModelANClaude Sonnet 4.5AnthropicOrganizationanthropicRating / score1446.2Votes28,634ObservationsN/AResult dateJul 30, 2026
Rank23ModelGOGemini 3.1 ProGoogleOrganizationgoogleRating / score1445.3Votes45,162ObservationsN/AResult dateJul 30, 2026
Rank24ModelMEMuse SparkMetaOrganizationmetaRating / score1443.2Votes1,078ObservationsN/AResult dateJul 30, 2026
Rank25ModelACQwen3.7-PlusAlibaba Cloud / Qwen TeamOrganizationalibabaRating / score1439.6Votes3,088ObservationsN/AResult dateJul 30, 2026
Rank26ModelMIMiniMax M3MiniMaxOrganizationminimaxRating / score1434.8Votes6,263ObservationsN/AResult dateJul 30, 2026
Rank27ModelGOGemini 3 ProGoogleOrganizationgoogleRating / score1433.0Votes10,739ObservationsN/AResult dateJul 30, 2026
Rank28ModelMAKimi K2.5Moonshot AIOrganizationmoonshotRating / score1429.5Votes19,891ObservationsN/AResult dateJul 30, 2026
Rank29ModelGOGemma 4 31BGoogleOrganizationgoogleRating / score1423.7Votes10,577ObservationsN/AResult dateJul 30, 2026
Rank30ModelANClaude Haiku 4.5AnthropicOrganizationanthropicRating / score1423.0Votes30,937ObservationsN/AResult dateJul 30, 2026
Rank31ModelGOGemini 2.5 ProGoogleOrganizationgoogleRating / score1420.9Votes24,963ObservationsN/AResult dateJul 30, 2026
Rank32ModelZAGLM-5V-TurboZhipu AIOrganizationzaiRating / score1417.2Votes4,894ObservationsN/AResult dateJul 30, 2026
Rank33ModelXAGrok-4.20 Beta ReasoningxAIOrganizationxaiRating / score1413.9Votes18,666ObservationsN/AResult dateJul 30, 2026
Rank34ModelGOGemini 3 FlashGoogleOrganizationgoogleRating / score1413.3Votes7,173ObservationsN/AResult dateJul 30, 2026
Rank35ModelOPGPT-5.2OpenAIOrganizationopenaiRating / score1405.0Votes7,073ObservationsN/AResult dateJul 30, 2026
Rank36ModelOPGPT-5.5 InstantOpenAIOrganizationopenaiRating / score1401.6Votes8,442ObservationsN/AResult dateJul 30, 2026
Rank37ModelOPGPT-5.1OpenAIOrganizationopenaiRating / score1400.8Votes8,220ObservationsN/AResult dateJul 30, 2026

Arena highlights

Rank #1Claude Opus 51520.1 ratingRank #2Claude Opus 4.61509.9 ratingRank #4Claude Fable 51504.2 ratingRank #5Claude Opus 4.71498.1 rating

Document Rating Distribution

A closer view of the leading model ratings.

Document

The Top AI Models for Document

The first five models in this source ranking, with price and output speed included when a canonical model match is available.

Ranking basisThis document AI model leaderboard uses the source rating and Arena rank. The leaderboard ranking keeps matched price and speed data separate from benchmark evidence.

  1. 01
    AN
    Claude Opus 5Anthropic
    rating
    1,520
    Price
    $5.0 input / $25 output per 1M tokens
    Speed
    Up to 3.3 tok/s via Anthropic

    Strengths

    • Ranks #1 on Document
    • 1,663 votes support the result
    • Matched official PAYG token pricing is available

    Considerations

    • Arena results are independent from the LLMBoard capability score
  2. 02
    AN
    Claude Opus 4.6Anthropic
    rating
    1,510
    Price
    $5.0 input / $25 output per 1M tokens
    Speed
    Up to 17 tok/s via Anthropic

    Strengths

    • Ranks #2 on Document
    • 37,271 votes support the result
    • Matched official PAYG token pricing is available

    Considerations

    • Arena results are independent from the LLMBoard capability score
  3. 04
    AN
    Claude Fable 5Anthropic
    rating
    1,504
    Price
    $10 input / $50 output per 1M tokens
    Speed
    Up to 9.1 tok/s via Anthropic

    Strengths

    • Ranks #4 on Document
    • 5,792 votes support the result
    • Matched official PAYG token pricing is available

    Considerations

    • Arena results are independent from the LLMBoard capability score
  4. 05
    AN
    Claude Opus 4.7Anthropic
    rating
    1,498
    Price
    $5.0 input / $25 output per 1M tokens
    Speed
    Up to 42 tok/s via Anthropic

    Strengths

    • Ranks #5 on Document
    • 18,990 votes support the result
    • Matched official PAYG token pricing is available

    Considerations

    • Arena results are independent from the LLMBoard capability score
  5. 07
    OP
    GPT-5.5OpenAI
    rating
    1,485
    Price
    $5.0 input / $30 output per 1M tokens

    Strengths

    • Ranks #7 on Document
    • 16,816 votes support the result
    • Matched official PAYG token pricing is available

    Considerations

    • Arena results are independent from the LLMBoard capability score

Selection summary

Best AI Models for Document

Claude Opus 5 currently leads Document at 1,520. The best AI model for this use case may change when price, speed and independent benchmark capability are considered.

Use this leaderboard with the supporting benchmark results and coverage details above. A leaderboard position summarizes the selected ranking signal; it does not replace workload-specific testing.

Arena rank #1Claude Opus 5$5.0 input / $25 output per 1M tokensArena rank #2Claude Opus 4.6$5.0 input / $25 output per 1M tokensArena rank #4Claude Fable 5$10 input / $50 output per 1M tokens

What is the Document Arena?

What Document measures and how to read its results.

Document reports rating values and currently defines 1 evaluation category.

Arena results are preference or task-outcome signals. They are not automatically equivalent to capability benchmark scores.

FAQ

Common questions about Document.

Which model leads Document?

Claude Opus 5 is currently ranked first.

What does Document measure?

This Arena reports rating values across 1 configured evaluation category.

Does this result affect the LLMBoard score?

No. Arena results remain a separate preference or task-outcome signal.

How many models are included?

33 model results are currently shown.