llmboard.aiAI model intelligence
Home

Model Rankings

OverallOpen ModelsAgentCodingReasoningMathKnowledgeInstruction FollowingTextVision
Image GenerationImage Editing
Video GenerationImage to VideoVideo Editing
Text to SpeechSpeech to Text
Embeddings

Efficiency

Chat Token PricingImage PricingVideo PricingAudio Pricing
Chat Speed & LatencyProvider Reliability

Benchmarks

GPQAMMLU-ProAIME 2025SWE-Bench VerifiedMMLUHumanity's Last ExamLiveCodeBenchMATHHumanEvalMMMU-Pro
All Benchmarks

Tools

Model DirectoryCompare Models

Scoring & Data

Scoring & Data
393 models668 benchmarks

Leaderboard Center

Overall RankingCodingCore BenchmarksPrice & ValueRuntime Performance

Modalities

All ModelsImage GenerationImage EditingVideo GenerationImage-to-VideoVideo EditingText-to-SpeechSpeech-to-TextEmbeddings

Data & Methods

Scoring MethodAll BenchmarksReasoningMath

Vendors

All VendorsOpenAIAnthropicGoogle
llmboard.aiCopyright 2026 llmboard.ai

Benchmark category

Math Benchmarks

Math evaluations, model coverage and rankings. Each benchmark keeps its original scale and methodology.

Data as of 2026-08-17

Benchmarks84
Highest coverage134
Score eligible52

Math Benchmark Directory

Select a benchmark to inspect model results, evidence fields and scoring direction.

30 of 32 rows
Columns

Show columns

Sort by
Benchmark
Family
Modality
Metric
Coverage
Coverage tier
Evidence
Score eligible
BenchmarkMMLU-ProFamilyMMLU-ProModalitytextMetricScoreCoverage134Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkAIME 2025FamilyAIME 2025ModalitytextMetricScoreCoverage115Coverage tierfeaturedEvidenceCScore eligibleYes
BenchmarkMMLUFamilyMMLUModalitytextMetricScoreCoverage101Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkHumanity's Last ExamFamilyHumanity's Last ExamModalitymultimodalMetricScoreCoverage99Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkMATHFamilyMATHModalitytextMetricScoreCoverage71Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkAIME 2024FamilyAIME 2024ModalitytextMetricScoreCoverage53Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkMMMLUFamilyMMMLUModalitytextMetricScoreCoverage49Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkGSM8kFamilyGSM8kModalitytextMetricScoreCoverage48Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkMMLU-ReduxFamilyMMLU-ReduxModalitytextMetricScoreCoverage48Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkMathVistaFamilyMathVistaModalitymultimodalMetricScoreCoverage39Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkLiveBenchFamilyLiveBenchModalitytextMetricScoreCoverage38Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkSuperGPQAFamilySuperGPQAModalitytextMetricScoreCoverage34Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkHMMT 2025FamilyHMMT 2025ModalitytextMetricScoreCoverage33Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkMathVisionFamilyMathVisionModalitymultimodalMetricScoreCoverage33Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkMATH-500FamilyMATH-500ModalitytextMetricScoreCoverage32Coverage tierfeaturedEvidenceCScore eligibleYes
BenchmarkMMLU-ProXFamilyMMLU-ProXModalitytextMetricScoreCoverage32Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkMGSMFamilyMGSMModalitytextMetricScoreCoverage31Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkDROPFamilyDROPModalitytextMetricScoreCoverage30Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkHMMT25FamilyHMMT25ModalitytextMetricScoreCoverage25Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkMathVista-MiniFamilyMathVista-MiniModalitymultimodalMetricScoreCoverage24Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkPolyMATHFamilyPolyMATHModalitymultimodalMetricScoreCoverage23Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkAIME 2026FamilyAIME 2026ModalitytextMetricScoreCoverage21Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkBIG-Bench HardFamilyBIG-Bench HardModalitytextMetricScoreCoverage21Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkSciCodeFamilySciCodeModalitytextMetricScoreCoverage21Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkIMO-AnswerBenchFamilyIMO-AnswerBenchModalitytextMetricScoreCoverage20Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkCodeForcesFamilyCodeForcesModalitytextMetricNormalized ratingCoverage17Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkFrontierMathFamilyFrontierMathModalitytextMetricScoreCoverage17Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkLiveBench 20241125FamilyLiveBench 20241125ModalitytextMetricScoreCoverage14Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkHiddenMathFamilyHiddenMathModalitytextMetricScoreCoverage13Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkBBHFamilyBBHModalitytextMetricScoreCoverage12Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkHMMT Feb 26FamilyHMMT Feb 26ModalitytextMetricScoreCoverage12Coverage tierfeaturedEvidenceBScore eligibleYes
BenchmarkAGIEvalFamilyAGIEvalModalitytextMetricScoreCoverage10Coverage tierfeaturedEvidenceBScore eligibleYes

Math Benchmark Rankings

Leading results from high-coverage benchmarks with at least two models.

MMLU-Pro

View benchmark

AIME 2025

View benchmark

MMLU

View benchmark

Humanity's Last Exam

View benchmark

What are math benchmarks?

How this category is assembled on llmboard.ai.

This page groups benchmarks whose primary or display category matches math. It does not average incompatible metrics into a new category score.

Open an individual benchmark to inspect score direction, evidence level, participant count and model results.

Benchmarks are grouped by their primary and display categories.