llmboard.aiAI model intelligence
Home

Model Rankings

OverallOpen ModelsAgentCodingReasoningMathKnowledgeInstruction FollowingTextVision
Image GenerationImage Editing
Video GenerationImage to VideoVideo Editing
Text to SpeechSpeech to Text
Embeddings

Efficiency

Chat Token PricingImage PricingVideo PricingAudio Pricing
Chat Speed & LatencyProvider Reliability

Benchmarks

GPQAMMLU-ProAIME 2025SWE-Bench VerifiedMMLUHumanity's Last ExamLiveCodeBenchMATHHumanEvalMMMU-Pro
All Benchmarks

Tools

Model DirectoryCompare Models

Scoring & Data

Scoring & Data
393 models668 benchmarks

Leaderboard Center

Overall RankingCodingCore BenchmarksPrice & ValueRuntime Performance

Modalities

All ModelsImage GenerationImage EditingVideo GenerationImage-to-VideoVideo EditingText-to-SpeechSpeech-to-TextEmbeddings

Data & Methods

Scoring MethodAll BenchmarksReasoningMath

Vendors

All VendorsOpenAIAnthropicGoogle
llmboard.aiCopyright 2026 llmboard.ai

Arena benchmark

LM Arena Text Factuality Leaderboard

LM Arena Text Factuality model ratings and results.

Updated Aug 17, 2026. Data as of 2026-08-17

Models100
Categories29
Result typerating

On this page

  • Ranking
  • Highlights
  • Distribution
  • Top models
  • About
  • FAQ

Text Factuality Ranking

Models are ordered by their Arena rank.

30 of 100 rows
Columns

Show columns

Sort by
Rank
Model
Organization
Rating / score
Votes
Observations
Result date
Rank01ModelANClaude Opus 5AnthropicOrganizationanthropicRating / score1493.3Votes9,559ObservationsN/AResult dateAug 12, 2026
Rank03ModelANClaude Opus 4.6AnthropicOrganizationanthropicRating / score1487.1Votes76,063ObservationsN/AResult dateAug 12, 2026
Rank04ModelOPGPT-5.5OpenAIOrganizationopenaiRating / score1485.9Votes55,244ObservationsN/AResult dateAug 12, 2026
Rank05ModelANClaude Fable 5AnthropicOrganizationanthropicRating / score1485.5Votes21,422ObservationsN/AResult dateAug 12, 2026
Rank06ModelOPGPT-5.4OpenAIOrganizationopenaiRating / score1485.3Votes60,715ObservationsN/AResult dateAug 12, 2026
Rank08ModelMEMuse Spark 1.2MetaOrganizationmetaRating / score1485.1Votes3,259ObservationsN/AResult dateAug 12, 2026
Rank10ModelGOGemini 3 ProGoogleOrganizationgoogleRating / score1480.7Votes40,615ObservationsN/AResult dateAug 12, 2026
Rank11ModelACQwen3.8 MaxAlibaba Cloud / Qwen TeamOrganizationalibabaRating / score1480.6Votes6,908ObservationsN/AResult dateAug 12, 2026
Rank12ModelGOGemini 3.5 FlashGoogleOrganizationgoogleRating / score1480.0Votes25,720ObservationsN/AResult dateAug 12, 2026
Rank13ModelACQwen3.7 MaxAlibaba Cloud / Qwen TeamOrganizationalibabaRating / score1479.1Votes3,718ObservationsN/AResult dateAug 12, 2026
Rank17ModelANClaude Opus 4.7AnthropicOrganizationanthropicRating / score1474.1Votes61,247ObservationsN/AResult dateAug 12, 2026
Rank19ModelOPGPT-5.6 SolOpenAIOrganizationopenaiRating / score1472.8Votes15,419ObservationsN/AResult dateAug 12, 2026
Rank20ModelGOGemini 3.1 ProGoogleOrganizationgoogleRating / score1471.6Votes94,626ObservationsN/AResult dateAug 12, 2026
Rank21ModelMAKimi K3Moonshot AIOrganizationmoonshotRating / score1471.0Votes11,864ObservationsN/AResult dateAug 12, 2026
Rank23ModelGOGemini 3 FlashGoogleOrganizationgoogleRating / score1466.9Votes30,246ObservationsN/AResult dateAug 12, 2026
Rank24ModelXAGrok 4.5xAIOrganizationxaiRating / score1466.8Votes17,714ObservationsN/AResult dateAug 12, 2026
Rank25ModelMEMuse SparkMetaOrganizationmetaRating / score1466.2Votes13,579ObservationsN/AResult dateAug 12, 2026
Rank27ModelMEMuse Spark 1.1MetaOrganizationmetaRating / score1465.5Votes16,780ObservationsN/AResult dateAug 12, 2026
Rank28ModelXIMiMo-V2.5-ProXiaomiOrganizationxiaomiRating / score1465.2Votes50,527ObservationsN/AResult dateAug 12, 2026
Rank29ModelOPGPT-5.6 TerraOpenAIOrganizationopenaiRating / score1464.4Votes15,980ObservationsN/AResult dateAug 12, 2026
Rank30ModelANClaude Opus 4.8AnthropicOrganizationanthropicRating / score1463.7Votes41,146ObservationsN/AResult dateAug 12, 2026
Rank31ModelGOGemini 2.5 ProGoogleOrganizationgoogleRating / score1461.6Votes68,273ObservationsN/AResult dateAug 12, 2026
Rank32ModelANClaude Sonnet 4.6AnthropicOrganizationanthropicRating / score1460.0Votes66,315ObservationsN/AResult dateAug 12, 2026
Rank33ModelZAGLM-5.2Zhipu AIOrganizationzaiRating / score1459.6Votes26,846ObservationsN/AResult dateAug 12, 2026
Rank34ModelANClaude Opus 4.5AnthropicOrganizationanthropicRating / score1458.4Votes69,979ObservationsN/AResult dateAug 12, 2026
Rank35ModelOPGPT-5.1 HighOpenAIOrganizationopenaiRating / score1458.3Votes40,124ObservationsN/AResult dateAug 12, 2026
Rank38ModelZAGLM-5.1Zhipu AIOrganizationzaiRating / score1457.2Votes38,914ObservationsN/AResult dateAug 12, 2026
Rank39ModelXAGrok-4.20 Multi-Agent BetaxAIOrganizationxaiRating / score1456.5Votes60,851ObservationsN/AResult dateAug 12, 2026
Rank40ModelXAGrok-4.20 Beta ReasoningxAIOrganizationxaiRating / score1455.3Votes62,289ObservationsN/AResult dateAug 12, 2026
Rank41ModelMAKimi K2.6Moonshot AIOrganizationmoonshotRating / score1455.3Votes37,573ObservationsN/AResult dateAug 12, 2026
Rank42ModelOPGPT-5.6 LunaOpenAIOrganizationopenaiRating / score1455.3Votes16,387ObservationsN/AResult dateAug 12, 2026
Rank43ModelDEDeepSeek V4 ProDeepSeekOrganizationdeepseekRating / score1455.0Votes54,223ObservationsN/AResult dateAug 12, 2026
Rank45ModelACQwen3.7-PlusAlibaba Cloud / Qwen TeamOrganizationalibabaRating / score1453.8Votes30,714ObservationsN/AResult dateAug 12, 2026
Rank46ModelANClaude Sonnet 5AnthropicOrganizationanthropicRating / score1453.0Votes23,100ObservationsN/AResult dateAug 12, 2026
Rank47ModelTHInklingThinkingmachinesOrganizationthinkyRating / score1452.3Votes14,558ObservationsN/AResult dateAug 12, 2026
Rank49ModelALQwen3.6 Max PreviewAlibabaOrganizationalibabaRating / score1452.0Votes5,206ObservationsN/AResult dateAug 12, 2026
Rank50ModelOPGPT-5.2OpenAIOrganizationopenaiRating / score1451.5Votes34,074ObservationsN/AResult dateAug 12, 2026
Rank52ModelZAGLM-5Zhipu AIOrganizationzaiRating / score1451.1Votes27,671ObservationsN/AResult dateAug 12, 2026
Rank53ModelAMNova ProAmazonOrganizationamazonRating / score1450.0Votes3,409ObservationsN/AResult dateAug 12, 2026
Rank54ModelGOGemma 4 31BGoogleOrganizationgoogleRating / score1449.1Votes5,902ObservationsN/AResult dateAug 12, 2026
Rank55ModelOPGPT-5.4 miniOpenAIOrganizationopenaiRating / score1448.7Votes59,487ObservationsN/AResult dateAug 12, 2026
Rank56ModelGOGemini 3.5 Flash-LiteGoogleOrganizationgoogleRating / score1448.2Votes13,676ObservationsN/AResult dateAug 12, 2026
Rank57ModelTEHy3TencentOrganizationtencentRating / score1448.2Votes4,650ObservationsN/AResult dateAug 12, 2026
Rank58ModelANClaude Sonnet 4.5AnthropicOrganizationanthropicRating / score1448.0Votes75,728ObservationsN/AResult dateAug 12, 2026
Rank59ModelDEDeepSeek-V3.2-ExpDeepSeekOrganizationdeepseekRating / score1447.9Votes2,514ObservationsN/AResult dateAug 12, 2026
Rank60ModelDEDeepSeek-V4-Pro-MaxDeepSeekOrganizationdeepseekRating / score1447.7Votes51,585ObservationsN/AResult dateAug 12, 2026
Rank61ModelZAGLM-4.6Zhipu AIOrganizationzaiRating / score1447.1Votes28,633ObservationsN/AResult dateAug 12, 2026
Rank63ModelOPGPT-5.1OpenAIOrganizationopenaiRating / score1445.5Votes42,755ObservationsN/AResult dateAug 12, 2026
Rank64ModelGOGemma 4 26B-A4BGoogleOrganizationgoogleRating / score1445.1Votes5,811ObservationsN/AResult dateAug 12, 2026
Rank65ModelACQwen3.5-397B-A17BAlibaba Cloud / Qwen TeamOrganizationalibabaRating / score1445.1Votes66,310ObservationsN/AResult dateAug 12, 2026
Rank66ModelMAKimi K2.5Moonshot AIOrganizationmoonshotRating / score1444.8Votes70,661ObservationsN/AResult dateAug 12, 2026
Rank67ModelBAERNIE 5.0BaiduOrganizationbaiduRating / score1444.6Votes34,765ObservationsN/AResult dateAug 12, 2026
Rank68ModelOPGPT-5.5 InstantOpenAIOrganizationopenaiRating / score1444.3Votes25,900ObservationsN/AResult dateAug 12, 2026
Rank69ModelOPChatGPT-4o LatestOpenAIOrganizationopenaiRating / score1443.9Votes40,588ObservationsN/AResult dateAug 12, 2026
Rank70ModelXIMiMo-V2-ProXiaomiOrganizationxiaomiRating / score1443.7Votes24,386ObservationsN/AResult dateAug 12, 2026
Rank72ModelZAGLM-4.7Zhipu AIOrganizationzaiRating / score1443.2Votes11,742ObservationsN/AResult dateAug 12, 2026
Rank75ModelACQwen3 MaxAlibaba Cloud / Qwen TeamOrganizationalibabaRating / score1440.4Votes7,554ObservationsN/AResult dateAug 12, 2026
Rank76ModelZAGLM-5V-TurboZhipu AIOrganizationzaiRating / score1440.3Votes9,368ObservationsN/AResult dateAug 12, 2026
Rank78ModelXIMiMo-V2.5XiaomiOrganizationxiaomiRating / score1439.1Votes44,558ObservationsN/AResult dateAug 12, 2026
Rank79ModelDEDeepSeek V4 FlashDeepSeekOrganizationdeepseekRating / score1438.5Votes48,998ObservationsN/AResult dateAug 12, 2026
Rank80ModelACQwen3.6 PlusAlibaba Cloud / Qwen TeamOrganizationalibabaRating / score1437.6Votes45,381ObservationsN/AResult dateAug 12, 2026
Rank81ModelGOGemini 2.5 FlashGoogleOrganizationgoogleRating / score1437.1Votes68,907ObservationsN/AResult dateAug 12, 2026
Rank82ModelDEDeepSeek-V3.2DeepSeekOrganizationdeepseekRating / score1436.7Votes46,390ObservationsN/AResult dateAug 12, 2026
Rank84ModelMIMiniMax M3MiniMaxOrganizationminimaxRating / score1435.9Votes37,162ObservationsN/AResult dateAug 12, 2026
Rank85ModelXIMiMo-V2-OmniXiaomiOrganizationxiaomiRating / score1435.4Votes19,427ObservationsN/AResult dateAug 12, 2026
Rank86ModelANClaude Opus 4.1AnthropicOrganizationanthropicRating / score1435.0Votes41,258ObservationsN/AResult dateAug 12, 2026
Rank87ModelMAMistral Large 3Mistral AIOrganizationmistralRating / score1434.7Votes58,290ObservationsN/AResult dateAug 12, 2026
Rank88ModelDEDeepSeek-V4-Flash-0731DeepSeekOrganizationdeepseekRating / score1433.9Votes48,702ObservationsN/AResult dateAug 12, 2026
Rank89ModelXAGrok-4.1 ThinkingxAIOrganizationxaiRating / score1433.6Votes64,683ObservationsN/AResult dateAug 12, 2026
Rank90ModelGOGemini 3.1 Flash-LiteGoogleOrganizationgoogleRating / score1433.1Votes60,449ObservationsN/AResult dateAug 12, 2026
Rank91ModelDEDeepSeek-V3.2 (Thinking)DeepSeekOrganizationdeepseekRating / score1432.9Votes40,314ObservationsN/AResult dateAug 12, 2026
Rank93ModelACQwen3-235B-A22B-Instruct-2507Alibaba Cloud / Qwen TeamOrganizationalibabaRating / score1431.3Votes65,312ObservationsN/AResult dateAug 12, 2026
Rank94ModelMAMistral Medium 3.5Mistral AIOrganizationmistralRating / score1430.7Votes10,963ObservationsN/AResult dateAug 12, 2026
Rank95ModelXAGrok-4.1xAIOrganizationxaiRating / score1430.5Votes66,878ObservationsN/AResult dateAug 12, 2026
Rank96ModelNVNemotron 3 Ultra (550B A55B)NVIDIAOrganizationnvidiaRating / score1430.2Votes10,720ObservationsN/AResult dateAug 12, 2026
Rank99ModelXAGrok 4.3xAIOrganizationxaiRating / score1428.6Votes56,574ObservationsN/AResult dateAug 12, 2026
Rank100ModelACQwen3.5-122B-A10BAlibaba Cloud / Qwen TeamOrganizationalibabaRating / score1428.3Votes28,268ObservationsN/AResult dateAug 12, 2026
Rank101ModelMELongCat-Flash-ChatMeituanOrganizationmeituanRating / score1428.0Votes27,947ObservationsN/AResult dateAug 12, 2026
Rank104ModelMAKimi K2 Thinking TurboMoonshot AIOrganizationmoonshotRating / score1423.2Votes61,231ObservationsN/AResult dateAug 12, 2026
Rank105ModelOPGPT-5 HighOpenAIOrganizationopenaiRating / score1422.6Votes6,897ObservationsN/AResult dateAug 12, 2026
Rank106ModelXIMiMo-V2-FlashXiaomiOrganizationxiaomiRating / score1422.2Votes45,956ObservationsN/AResult dateAug 12, 2026
Rank107ModelOPGPT-5.3 ChatOpenAIOrganizationopenaiRating / score1422.1Votes7,761ObservationsN/AResult dateAug 12, 2026
Rank108ModelMIMiniMax M2.7MiniMaxOrganizationminimaxRating / score1422.0Votes58,216ObservationsN/AResult dateAug 12, 2026
Rank109ModelOPGPT-5.4 nanoOpenAIOrganizationopenaiRating / score1420.0Votes58,506ObservationsN/AResult dateAug 12, 2026
Rank110ModelACQwen3.5-27BAlibaba Cloud / Qwen TeamOrganizationalibabaRating / score1418.9Votes27,150ObservationsN/AResult dateAug 12, 2026
Rank112ModelACQwen3-Next-80B-A3B-InstructAlibaba Cloud / Qwen TeamOrganizationalibabaRating / score1418.4Votes7,699ObservationsN/AResult dateAug 12, 2026
Rank113ModelXAGrok-4xAIOrganizationxaiRating / score1418.4Votes10,658ObservationsN/AResult dateAug 12, 2026
Rank114ModelSTStep-3.5-FlashStepFunOrganizationstepfunRating / score1417.5Votes57,159ObservationsN/AResult dateAug 12, 2026
Rank115ModelBYSeed 2.0 ProByteDanceOrganizationbytedanceRating / score1417.4Votes74,314ObservationsN/AResult dateAug 12, 2026
Rank116ModelANClaude Haiku 4.5AnthropicOrganizationanthropicRating / score1416.4Votes111,658ObservationsN/AResult dateAug 12, 2026
Rank118ModelXAGrok-4 Fast ReasoningxAIOrganizationxaiRating / score1415.7Votes10,844ObservationsN/AResult dateAug 12, 2026
Rank120ModelALQwen3.5 FlashAlibabaOrganizationalibabaRating / score1414.9Votes58,209ObservationsN/AResult dateAug 12, 2026
Rank121ModelXAGrok-4.1 Fast ReasoningxAIOrganizationxaiRating / score1413.0Votes55,884ObservationsN/AResult dateAug 12, 2026
Rank122ModelMIMiniMax M2.1MiniMaxOrganizationminimaxRating / score1411.2Votes16,747ObservationsN/AResult dateAug 12, 2026
Rank124ModelACQwen3 VL 235B A22B InstructAlibaba Cloud / Qwen TeamOrganizationalibabaRating / score1410.0Votes3,112ObservationsN/AResult dateAug 12, 2026
Rank125ModelACQwen3.5-35B-A3BAlibaba Cloud / Qwen TeamOrganizationalibabaRating / score1408.7Votes28,941ObservationsN/AResult dateAug 12, 2026
Rank126ModelOPGPT-4.1OpenAIOrganizationopenaiRating / score1408.5Votes7,860ObservationsN/AResult dateAug 12, 2026
Rank129ModelOPo3OpenAIOrganizationopenaiRating / score1403.3Votes7,585ObservationsN/AResult dateAug 12, 2026
Rank130ModelMEMuse Glimmer-30BMetaOrganizationmetaRating / score1403.2Votes3,709ObservationsN/AResult dateAug 12, 2026
Rank131ModelACQwen3-Coder 480B A35B InstructAlibaba Cloud / Qwen TeamOrganizationalibabaRating / score1400.4Votes3,539ObservationsN/AResult dateAug 12, 2026

Arena highlights

Rank #1Claude Opus 51493.3 ratingRank #3Claude Opus 4.61487.1 ratingRank #4GPT-5.51485.9 ratingRank #5Claude Fable 51485.5 rating

Text Factuality Rating Distribution

A closer view of the leading model ratings.

Text Factuality

The Top AI Models for Text Factuality

The first five models in this source ranking, with price and output speed included when a canonical model match is available.

Ranking basisThis text factuality AI model leaderboard uses the source rating and Arena rank. The leaderboard ranking keeps matched price and speed data separate from benchmark evidence.

  1. 01
    AN
    Claude Opus 5Anthropic
    rating
    1,493
    Price
    $5.0 input / $25 output per 1M tokens
    Speed
    Up to 3.3 tok/s via Anthropic

    Strengths

    • Ranks #1 on Text Factuality
    • 9,559 votes support the result
    • Matched official PAYG token pricing is available

    Considerations

    • Arena results are independent from the LLMBoard capability score
  2. 03
    AN
    Claude Opus 4.6Anthropic
    rating
    1,487
    Price
    $5.0 input / $25 output per 1M tokens
    Speed
    Up to 17 tok/s via Anthropic

    Strengths

    • Ranks #3 on Text Factuality
    • 76,063 votes support the result
    • Matched official PAYG token pricing is available

    Considerations

    • Arena results are independent from the LLMBoard capability score
  3. 04
    OP
    GPT-5.5OpenAI
    rating
    1,486
    Price
    $5.0 input / $30 output per 1M tokens

    Strengths

    • Ranks #4 on Text Factuality
    • 55,244 votes support the result
    • Matched official PAYG token pricing is available

    Considerations

    • Arena results are independent from the LLMBoard capability score
  4. 05
    AN
    Claude Fable 5Anthropic
    rating
    1,485
    Price
    $10 input / $50 output per 1M tokens
    Speed
    Up to 9.1 tok/s via Anthropic

    Strengths

    • Ranks #5 on Text Factuality
    • 21,422 votes support the result
    • Matched official PAYG token pricing is available

    Considerations

    • Arena results are independent from the LLMBoard capability score
  5. 06
    OP
    GPT-5.4OpenAI
    rating
    1,485
    Price
    $2.5 input / $15 output per 1M tokens
    Speed
    Up to 9.1 tok/s via OpenAI

    Strengths

    • Ranks #6 on Text Factuality
    • 60,715 votes support the result
    • Matched official PAYG token pricing is available

    Considerations

    • Arena results are independent from the LLMBoard capability score

Selection summary

Best AI Models for Text Factuality

Claude Opus 5 currently leads Text Factuality at 1,493. The best AI model for this use case may change when price, speed and independent benchmark capability are considered.

Use this leaderboard with the supporting benchmark results and coverage details above. A leaderboard position summarizes the selected ranking signal; it does not replace workload-specific testing.

Arena rank #1Claude Opus 5$5.0 input / $25 output per 1M tokensArena rank #3Claude Opus 4.6$5.0 input / $25 output per 1M tokensArena rank #4GPT-5.5$5.0 input / $30 output per 1M tokens

What is the Text Factuality Arena?

What Text Factuality measures and how to read its results.

Text Factuality reports rating values and currently defines 29 evaluation categories.

Arena results are preference or task-outcome signals. They are not automatically equivalent to capability benchmark scores.

FAQ

Common questions about Text Factuality.

Which model leads Text Factuality?

Claude Opus 5 is currently ranked first.

What does Text Factuality measure?

This Arena reports rating values across 29 configured evaluation categories.

Does this result affect the LLMBoard score?

No. Arena results remain a separate preference or task-outcome signal.

How many models are included?

100 model results are currently shown.