llmboard.aiAI model intelligence
Home

Model Rankings

OverallOpen ModelsAgentCodingReasoningMathKnowledgeInstruction FollowingTextVision
Image GenerationImage Editing
Video GenerationImage to VideoVideo Editing
Text to SpeechSpeech to Text
Embeddings

Efficiency

Chat Token PricingImage PricingVideo PricingAudio Pricing
Chat Speed & LatencyProvider Reliability

Benchmarks

GPQAMMLU-ProAIME 2025SWE-Bench VerifiedMMLUHumanity's Last ExamLiveCodeBenchMATHHumanEvalMMMU-Pro
All Benchmarks

Tools

Model DirectoryCompare Models

Scoring & Data

Scoring & Data
393 models668 benchmarks

Leaderboard Center

Overall RankingCodingCore BenchmarksPrice & ValueRuntime Performance

Modalities

All ModelsImage GenerationImage EditingVideo GenerationImage-to-VideoVideo EditingText-to-SpeechSpeech-to-TextEmbeddings

Data & Methods

Scoring MethodAll BenchmarksReasoningMath

Vendors

All VendorsOpenAIAnthropicGoogle
llmboard.aiCopyright 2026 llmboard.ai

Evaluation directory

AI Benchmarks

Browse benchmark definitions, capability categories and model rankings.

Data as of 2026-08-17

Benchmarks708
Categories47
Score eligible361
With model coverage702

All benchmarks

Open any benchmark to inspect its leaderboard, scoring direction, evidence fields and programmatic FAQ.

30 of 167 rows
Columns

Show columns

Sort by
Benchmark
Category
Family
Metric
Coverage
Coverage tier
Evidence
Score eligible
BenchmarkMTEB(eng, v2) ClassificationCategoryclassificationFamilyMTEB(eng, v2):classificationMetricOfficial leaderboard task-type meanCoverage253Coverage tierfeaturedEvidenceAScore eligibleYes
BenchmarkLM ArenaCategoryhuman preferenceFamilyLM ArenaMetricrating / task scoreCoverage246Coverage tierfeaturedEvidencesourceScore eligibleNo
BenchmarkGPQACategoryphysicsFamilyGPQAMetricScoreCoverage239Coverage tierfeaturedEvidenceCScore eligibleYes
BenchmarkMTEB(eng, v2) RerankingCategoryrerankingFamilyMTEB(eng, v2):rerankingMetricOfficial leaderboard task-type meanCoverage237Coverage tierfeaturedEvidenceAScore eligibleYes
BenchmarkMTEB(eng, v2) ClusteringCategoryclusteringFamilyMTEB(eng, v2):clusteringMetricOfficial leaderboard task-type meanCoverage213Coverage tierfeaturedEvidenceAScore eligibleYes
BenchmarkMTEB(eng, v2) RetrievalCategoryretrievalFamilyMTEB(eng, v2):retrievalMetricOfficial leaderboard task-type meanCoverage208Coverage tierfeaturedEvidenceAScore eligibleYes
BenchmarkMTEB(eng, v2) Semantic SimilarityCategorysemantic similarityFamilyMTEB(eng, v2):semantic_similarityMetricOfficial leaderboard task-type meanCoverage207Coverage tierfeaturedEvidenceAScore eligibleYes
BenchmarkArtificial Analysis Text To ImageCategoryoverall qualityFamilyArtificial Analysis text-to-imageMetriceloCoverage148Coverage tierfeaturedEvidenceAScore eligibleYes
BenchmarkMMLU-ProCategorylegalFamilyMMLU-ProMetricScoreCoverage134Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkAIME 2025CategorymathFamilyAIME 2025MetricScoreCoverage115Coverage tierfeaturedEvidenceCScore eligibleYes
BenchmarkSWE-Bench VerifiedCategoryreasoningFamilySWE-Bench VerifiedMetricScoreCoverage111Coverage tierfeaturedEvidenceCScore eligibleYes
BenchmarkMMLUCategorylegalFamilyMMLUMetricScoreCoverage101Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkHumanity's Last ExamCategorymathFamilyHumanity's Last ExamMetricScoreCoverage99Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkArtificial Analysis Text To SpeechCategorynaturalnessFamilyArtificial Analysis text-to-speechMetriceloCoverage93Coverage tierfeaturedEvidenceAScore eligibleYes
BenchmarkMIEB(eng) MultimodalCategorymultimodalFamilyMIEB(eng):multimodalMetricOfficial leaderboard task-type meanCoverage83Coverage tierfeaturedEvidenceAScore eligibleYes
BenchmarkArtificial Analysis Text To VideoCategoryoverall qualityFamilyArtificial Analysis text-to-videoMetriceloCoverage78Coverage tierfeaturedEvidenceAScore eligibleYes
BenchmarkLiveCodeBenchCategoryreasoningFamilyLiveCodeBenchMetricScoreCoverage75Coverage tierfeaturedEvidenceCScore eligibleYes
BenchmarkArtificial Analysis Image To VideoCategoryoverall qualityFamilyArtificial Analysis image-to-videoMetriceloCoverage72Coverage tierfeaturedEvidenceAScore eligibleYes
BenchmarkMATHCategorymathFamilyMATHMetricScoreCoverage71Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkMMMU-ProCategorymultimodalFamilyMMMU-ProMetricScoreCoverage68Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkArtificial Analysis Image EditingCategoryedit qualityFamilyArtificial Analysis image-editingMetriceloCoverage67Coverage tierfeaturedEvidenceAScore eligibleYes
BenchmarkIFEvalCategorystructured outputFamilyIFEvalMetricScoreCoverage67Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkHumanEvalCategoryreasoningFamilyHumanEvalMetricScoreCoverage66Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkMMMUCategorymultimodalFamilyMMMUMetricScoreCoverage63Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkBrowseCompCategoryreasoningFamilyBrowseCompMetricScoreCoverage62Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkOpen ASR Leaderboard OverallCategoryaccuracyFamilyOpen ASR OverallMetricAverage WERCoverage60Coverage tierfeaturedEvidenceAScore eligibleYes
BenchmarkLiveCodeBench v6CategoryreasoningFamilyLiveCodeBench v6MetricScoreCoverage56Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkArtificial Analysis Speech To TextCategoryaccuracyFamilyArtificial Analysis speech-to-textMetricaa_wer_indexCoverage55Coverage tierfeaturedEvidenceAScore eligibleYes
BenchmarkAIME 2024CategorymathFamilyAIME 2024MetricScoreCoverage53Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarknolimaCategorylong contextFamilynolimaMetricScoreCoverage52Coverage tierfeaturedEvidenceCScore eligibleNo
BenchmarkCharXiv-RCategorymultimodalFamilyCharXiv-RMetricScoreCoverage51Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkTerminal-Bench 2.0CategoryreasoningFamilyTerminal-Bench 2.0MetricScoreCoverage51Coverage tierfeaturedEvidenceCScore eligibleYes
BenchmarkSWE-Bench ProCategoryreasoningFamilySWE-Bench ProMetricScoreCoverage50Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkMMMLUCategorymathFamilyMMMLUMetricScoreCoverage49Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkGSM8kCategorymathFamilyGSM8kMetricScoreCoverage48Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkMIEB(eng) ClassificationCategoryclassificationFamilyMIEB(eng):classificationMetricOfficial leaderboard task-type meanCoverage48Coverage tierfeaturedEvidenceAScore eligibleYes
BenchmarkMIEB(eng) ClusteringCategoryclusteringFamilyMIEB(eng):clusteringMetricOfficial leaderboard task-type meanCoverage48Coverage tierfeaturedEvidenceAScore eligibleYes
BenchmarkMIEB(eng) Semantic SimilarityCategorysemantic similarityFamilyMIEB(eng):semantic_similarityMetricOfficial leaderboard task-type meanCoverage48Coverage tierfeaturedEvidenceAScore eligibleYes
BenchmarkMMLU-ReduxCategorymathFamilyMMLU-ReduxMetricScoreCoverage48Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkSimpleQACategoryreasoningFamilySimpleQAMetricScoreCoverage47Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkMathVistaCategorymathFamilyMathVistaMetricScoreCoverage39Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkLiveBenchCategorymathFamilyLiveBenchMetricScoreCoverage38Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkSWE-bench MultilingualCategoryreasoningFamilySWE-bench MultilingualMetricScoreCoverage38Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkToolathlonCategoryreasoningFamilyToolathlonMetricScoreCoverage37Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkTau2 TelecomCategoryreasoningFamilyTau2 TelecomMetricScoreCoverage35Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkARC-CCategoryreasoningFamilyARC-CMetricScoreCoverage34Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkIFBenchCategoryinstruction followingFamilyIFBenchMetricScoreCoverage34Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkSuperGPQACategorylegalFamilySuperGPQAMetricScoreCoverage34Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkAI2DCategorymultimodalFamilyAI2DMetricScoreCoverage33Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkHMMT 2025CategorymathFamilyHMMT 2025MetricScoreCoverage33Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkMathVisionCategorymathFamilyMathVisionMetricScoreCoverage33Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkMBPPCategoryreasoningFamilyMBPPMetricPass@1Coverage33Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkMCP AtlasCategoryreasoningFamilyMCP AtlasMetricScoreCoverage33Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkMATH-500CategorymathFamilyMATH-500MetricScoreCoverage32Coverage tierfeaturedEvidenceCScore eligibleYes
BenchmarkMMLU-ProXCategorylegalFamilyMMLU-ProXMetricScoreCoverage32Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkIncludeCategorygeneralFamilyIncludeMetricScoreCoverage31Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkMGSMCategorymathFamilyMGSMMetricScoreCoverage31Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkDROPCategorymathFamilyDROPMetricScoreCoverage30Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkMulti-ChallengeCategoryreasoningFamilyMulti-ChallengeMetricScoreCoverage29Coverage tierfeaturedEvidenceCScore eligibleYes
BenchmarkRealWorldQACategoryspatial reasoningFamilyRealWorldQAMetricScoreCoverage29Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkDocVQACategorymultimodalFamilyDocVQAMetricScoreCoverage28Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkTerminal-Bench 2.1CategoryreasoningFamilyTerminal-Bench 2.1MetricScoreCoverage28Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkHellaSwagCategoryreasoningFamilyHellaSwagMetricScoreCoverage27Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkArena HardCategoryreasoningFamilyArena HardMetricScoreCoverage26Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkChartQACategorymultimodalFamilyChartQAMetricScoreCoverage26Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkFinance Agent v2CategoryreasoningFamilyFinance Agent v2MetricScoreCoverage26Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkTau2 RetailCategoryreasoningFamilyTau2 RetailMetricScoreCoverage26Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkVideoMMMUCategorymultimodalFamilyVideoMMMUMetricScoreCoverage26Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkDeepSWE 1.1CategoryagentsFamilyDeepSWE 1.1MetricScoreCoverage25Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkHMMT25CategorymathFamilyHMMT25MetricScoreCoverage25Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkLVBenchCategorylong contextFamilyLVBenchMetricScoreCoverage25Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkScreenSpot ProCategorymultimodalFamilyScreenSpot ProMetricScoreCoverage25Coverage tierfeaturedEvidenceCScore eligibleYes
BenchmarkTAU-bench RetailCategoryreasoningFamilyTAU-bench RetailMetricScoreCoverage25Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkTerminal-BenchCategoryreasoningFamilyTerminal-BenchMetricScoreCoverage25Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkERQACategoryreasoningFamilyERQAMetricScoreCoverage24Coverage tierfeaturedEvidenceCScore eligibleYes
BenchmarkMathVista-MiniCategorymathFamilyMathVista-MiniMetricScoreCoverage24Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkMMStarCategorymultimodalFamilyMMStarMetricScoreCoverage24Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkOCRBenchCategoryimage to textFamilyOCRBenchMetricScoreCoverage24Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkOSWorld-VerifiedCategorymultimodalFamilyOSWorld-VerifiedMetricScoreCoverage24Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkMRCR v2 (8-needle)Categorylong contextFamilyMRCR v2 (8-needle)MetricScoreCoverage23Coverage tierfeaturedEvidenceCScore eligibleYes
BenchmarkMulti-IFCategoryreasoningFamilyMulti-IFMetricScoreCoverage23Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkPolyMATHCategorymathFamilyPolyMATHMetricScoreCoverage23Coverage tierfeaturedEvidenceBScore eligibleYes
Benchmarkt2-benchCategoryreasoningFamilyt2-benchMetricScoreCoverage23Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkTAU-bench AirlineCategoryreasoningFamilyTAU-bench AirlineMetricScoreCoverage23Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkTau2 AirlineCategoryreasoningFamilyTau2 AirlineMetricScoreCoverage23Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkWMT24++CategorylanguageFamilyWMT24++MetricScoreCoverage23Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkAider-PolyglotCategorygeneralFamilyAider-PolyglotMetricScoreCoverage22Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkWinograndeCategoryreasoningFamilyWinograndeMetricScoreCoverage22Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkAIME 2026CategorymathFamilyAIME 2026MetricScoreCoverage21Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkBIG-Bench HardCategorymathFamilyBIG-Bench HardMetricScoreCoverage21Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkSciCodeCategorymathFamilySciCodeMetricScoreCoverage21Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkIMO-AnswerBenchCategorymathFamilyIMO-AnswerBenchMetricScoreCoverage20Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkMMBench-V1.1CategorymultimodalFamilyMMBench-V1.1MetricScoreCoverage20Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkOSWorldCategorymultimodalFamilyOSWorldMetricScoreCoverage20Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkBFCL-v3CategoryreasoningFamilyBFCL-v3MetricScoreCoverage19Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkAA-LCRCategorylong contextFamilyAA-LCRMetricScoreCoverage18Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkC-EvalCategoryreasoningFamilyC-EvalMetricScoreCoverage18Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkCC-OCRCategorymultimodalFamilyCC-OCRMetricScoreCoverage18Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkHallusion BenchCategoryreasoningFamilyHallusion BenchMetricScoreCoverage18Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkOmniDocBench 1.5CategorymultimodalFamilyOmniDocBench 1.5MetricScoreCoverage18Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkTriviaQACategoryreasoningFamilyTriviaQAMetricScoreCoverage18Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkTruthfulQACategorylegalFamilyTruthfulQAMetricScoreCoverage18Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkARC-AGI v2CategoryreasoningFamilyARC-AGI v2MetricScoreCoverage17Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkCharXiv-DCategorymultimodalFamilyCharXiv-DMetricScoreCoverage17Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkCodeForcesCategorymathFamilyCodeForcesMetricNormalized ratingCoverage17Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkFrontierMathCategorymathFamilyFrontierMathMetricScoreCoverage17Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkLongBench v2Categorylong contextFamilyLongBench v2MetricScoreCoverage17Coverage tierfeaturedEvidenceCScore eligibleYes
BenchmarkMM-MT-BenchCategorymultimodalFamilyMM-MT-BenchMetricScoreCoverage17Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkMVBenchCategorymultimodalFamilyMVBenchMetricScoreCoverage17Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkNL2RepoCategoryagentsFamilyNL2RepoMetricScoreCoverage17Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkVideo-MMECategorymultimodalFamilyVideo-MMEMetricScoreCoverage17Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkArena-Hard v2CategoryreasoningFamilyArena-Hard v2MetricScoreCoverage16Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkFrontierCode 1.1CategoryreasoningFamilyFrontierCode 1.1MetricScoreCoverage16Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkFrontierSWECategoryagentsFamilyFrontierSWEMetricScoreCoverage16Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkODinWCategoryvisionFamilyODinWMetricScoreCoverage16Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkScreenSpotCategorymultimodalFamilyScreenSpotMetricScoreCoverage16Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkTextVQACategorymultimodalFamilyTextVQAMetricScoreCoverage16Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkBFCL-V4CategoryagentsFamilyBFCL-V4MetricScoreCoverage15Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkBLINKCategorymultimodalFamilyBLINKMetricScoreCoverage15Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkGlobal-MMLU-LiteCategoryreasoningFamilyGlobal-MMLU-LiteMetricScoreCoverage15Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkWritingBenchCategorylegalFamilyWritingBenchMetricScoreCoverage15Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkClaw-EvalCategoryagentsFamilyClaw-EvalMetricScoreCoverage14Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkLiveBench 20241125CategorymathFamilyLiveBench 20241125MetricScoreCoverage14Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkOCRBench-V2 (en)Categoryimage to textFamilyOCRBench-V2 (en)MetricScoreCoverage14Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkSimpleVQACategorymultimodalFamilySimpleVQAMetricScoreCoverage14Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkBrowseComp-zhCategoryreasoningFamilyBrowseComp-zhMetricScoreCoverage13Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkCreative Writing v3CategorycreativityFamilyCreative Writing v3MetricScoreCoverage13Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkCyberGymCategorysafetyFamilyCyberGymMetricScoreCoverage13Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkFACTS GroundingCategoryreasoningFamilyFACTS GroundingMetricScoreCoverage13Coverage tierfeaturedEvidenceCScore eligibleYes
BenchmarkGlobal PIQACategoryphysicsFamilyGlobal PIQAMetricScoreCoverage13Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkHiddenMathCategorymathFamilyHiddenMathMetricScoreCoverage13Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkLegal Agent BenchmarkCategorylegalFamilyLegal Agent BenchmarkMetricScoreCoverage13Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkMMMU (val)CategorymultimodalFamilyMMMU (val)MetricScoreCoverage13Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkMultiPL-ECategorylanguageFamilyMultiPL-EMetricScoreCoverage13Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkAutomationBenchCategoryreasoningFamilyAutomationBenchMetricScoreCoverage12Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkBBHCategorymathFamilyBBHMetricScoreCoverage12Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkCharadesSTACategorymultimodalFamilyCharadesSTAMetricScoreCoverage12Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkHMMT Feb 26CategorymathFamilyHMMT Feb 26MetricScoreCoverage12Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkInfoVQAtestCategorymultimodalFamilyInfoVQAtestMetricScoreCoverage12Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkMedXpertQACategorymultimodalFamilyMedXpertQAMetricScoreCoverage12Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkMT-BenchCategoryreasoningFamilyMT-BenchMetricNormalized scoreCoverage12Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkMuirBenchCategorymultimodalFamilyMuirBenchMetricScoreCoverage12Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkOptimBenchCategoryuncategorizedFamilyOptimBenchMetricScoreCoverage12Coverage tierfeaturedEvidenceCScore eligibleNo
BenchmarkBFCLCategoryreasoningFamilyBFCLMetricScoreCoverage11Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkBIG-Bench Extra HardCategoryreasoningFamilyBIG-Bench Extra HardMetricScoreCoverage11Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkDeepSWECategoryagentsFamilyDeepSWEMetricScoreCoverage11Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkDocVQAtestCategorymultimodalFamilyDocVQAtestMetricScoreCoverage11Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkGraphwalks BFS <128kCategoryreasoningFamilyGraphwalks BFS <128kMetricScoreCoverage11Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkGraphwalks BFS >128kCategorylong contextFamilyGraphwalks BFS >128kMetricScoreCoverage11Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkGraphwalks parents <128kCategoryreasoningFamilyGraphwalks parents <128kMetricScoreCoverage11Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkMAXIFECategorygeneralFamilyMAXIFEMetricScoreCoverage11Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkNOVA-63CategorygeneralFamilyNOVA-63MetricScoreCoverage11Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkOCRBench-V2 (zh)Categoryimage to textFamilyOCRBench-V2 (zh)MetricScoreCoverage11Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkPIQACategoryphysicsFamilyPIQAMetricScoreCoverage11Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkAgents' Last ExamCategoryreasoningFamilyAgents' Last ExamMetricScoreCoverage10Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkAGIEvalCategorylegalFamilyAGIEvalMetricScoreCoverage10Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkAider-Polyglot EditCategorygeneralFamilyAider-Polyglot EditMetricScoreCoverage10Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkBabyVisionCategorymultimodalFamilyBabyVisionMetricScoreCoverage10Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkBoolQCategoryreasoningFamilyBoolQMetricScoreCoverage10Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkCOLLIECategoryreasoningFamilyCOLLIEMetricScoreCoverage10Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkHumanEval+CategoryreasoningFamilyHumanEval+MetricScoreCoverage10Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkInfoVQACategorymultimodalFamilyInfoVQAMetricScoreCoverage10Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkMLVUCategorylong contextFamilyMLVUMetricScoreCoverage10Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkVideoMME w sub.CategorymultimodalFamilyVideoMME w sub.MetricScoreCoverage10Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkVideoMME w/o sub.CategorymultimodalFamilyVideoMME w/o sub.MetricScoreCoverage10Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkVITA-BenchCategoryreasoningFamilyVITA-BenchMetricScoreCoverage10Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkWideSearchCategoryreasoningFamilyWideSearchMetricScoreCoverage10Coverage tierfeaturedEvidenceBScore eligibleYes

Benchmark and LM Arena values retain their original scales. Open a row to see its model results and scoring direction.

Capability categories

Open a category to compare its benchmarks and leading model results.

reasoning205 benchmarks
Score eligible
111
Top coverage
111
multimodal151 benchmarks
Score eligible
78
Top coverage
83
math74 benchmarks
Score eligible
46
Top coverage
115
agents55 benchmarks
Score eligible
18
Top coverage
25
long context54 benchmarks
Score eligible
23
Top coverage
52
legal21 benchmarks
Score eligible
11
Top coverage
134
safety18 benchmarks
Score eligible
9
Top coverage
13
code15 benchmarks
Score eligible
1
Top coverage
4
general15 benchmarks
Score eligible
9
Top coverage
31
language11 benchmarks
Score eligible
9
Top coverage
23
physics7 benchmarks
Score eligible
3
Top coverage
239
spatial reasoning7 benchmarks
Score eligible
6
Top coverage
29
healthcare6 benchmarks
Score eligible
4
Top coverage
9
productivity6 benchmarks
Score eligible
4
Top coverage
4
structured output5 benchmarks
Score eligible
2
Top coverage
67
image to text4 benchmarks
Score eligible
4
Top coverage
24
speech to text4 benchmarks
Score eligible
2
Top coverage
6
uncategorized4 benchmarks
Score eligible
0
Top coverage
12
memory3 benchmarks
Score eligible
0
Top coverage
1
overall quality3 benchmarks
Score eligible
3
Top coverage
148
task outcome3 benchmarks
Score eligible
0
Top coverage
0
accuracy2 benchmarks
Score eligible
2
Top coverage
60
audio2 benchmarks
Score eligible
0
Top coverage
1
classification2 benchmarks
Score eligible
2
Top coverage
253
clustering2 benchmarks
Score eligible
2
Top coverage
213
finance2 benchmarks
Score eligible
0
Top coverage
1
image-generation2 benchmarks
Score eligible
0
Top coverage
1
instruction following2 benchmarks
Score eligible
1
Top coverage
34
knowledge2 benchmarks
Score eligible
0
Top coverage
1
naturalness2 benchmarks
Score eligible
2
Top coverage
93
semantic similarity2 benchmarks
Score eligible
2
Top coverage
207
summarization2 benchmarks
Score eligible
0
Top coverage
1
3d1 benchmarks
Score eligible
0
Top coverage
1
creativity1 benchmarks
Score eligible
1
Top coverage
13
edit quality1 benchmarks
Score eligible
1
Top coverage
67
factuality1 benchmarks
Score eligible
0
Top coverage
1
frontend development1 benchmarks
Score eligible
1
Top coverage
3
medical1 benchmarks
Score eligible
0
Top coverage
1
psychology1 benchmarks
Score eligible
1
Top coverage
9
question answering1 benchmarks
Score eligible
0
Top coverage
1
reranking1 benchmarks
Score eligible
1
Top coverage
237
research1 benchmarks
Score eligible
0
Top coverage
1
retrieval1 benchmarks
Score eligible
1
Top coverage
208
robotics1 benchmarks
Score eligible
0
Top coverage
1
video1 benchmarks
Score eligible
0
Top coverage
1
vision1 benchmarks
Score eligible
1
Top coverage
16

Benchmark highlights

A quick view of benchmark breadth and current model coverage.

Highest model coverageMTEB(eng, v2) Classification253 modelsLargest categoryreasoning205 benchmarks
Scoring inputs361Eligible benchmark definitions
Total benchmarks70846 benchmark categories and 22 LM Arena dimensions