llmboard.aiAI model intelligence
Home

Model Rankings

OverallOpen ModelsAgentCodingReasoningMathKnowledgeInstruction FollowingTextVision
Image GenerationImage Editing
Video GenerationImage to VideoVideo Editing
Text to SpeechSpeech to Text
Embeddings

Efficiency

Chat Token PricingImage PricingVideo PricingAudio Pricing
Chat Speed & LatencyProvider Reliability

Benchmarks

GPQAMMLU-ProAIME 2025SWE-Bench VerifiedMMLUHumanity's Last ExamLiveCodeBenchMATHHumanEvalMMMU-Pro
All Benchmarks

Tools

Model DirectoryCompare Models

Scoring & Data

Scoring & Data
393 models668 benchmarks

Leaderboard Center

Overall RankingCodingCore BenchmarksPrice & ValueRuntime Performance

Modalities

All ModelsImage GenerationImage EditingVideo GenerationImage-to-VideoVideo EditingText-to-SpeechSpeech-to-TextEmbeddings

Data & Methods

Scoring MethodAll BenchmarksReasoningMath

Vendors

All VendorsOpenAIAnthropicGoogle
llmboard.aiCopyright 2026 llmboard.ai

Runtime performance

AI Model Speed and Latency Leaderboard

Use this runtime leaderboard to compare the current output-speed ranking, catalog latency, provider time to first token and reliability. Runtime remains independent from capability benchmark scores and price.

Data as of 2026-08-17

Model-provider records311184 canonical versions
Complete speed + latency301Comparable catalog records
Provider aggregates20Observed 7-day metrics
Fastest catalog speed2,220 tok/sLlama 3.3 70B Instruct via Cerebras

On this page

  • Model ranking
  • Speed vs. latency
  • Provider view
  • Top models
  • Definitions

Model-provider Runtime Leaderboard

This leaderboard ranking uses generated output tokens received per second. Sort by speed or catalog latency to match your workload; capability benchmark results do not change the order.

30 of 301 rows
Columns

Show columns

Sort by
Model
Provider
Output Speed
Catalog Latency
LLMBoard score
Official input / 1M
Max Input
Updated
ModelMELlama 3.3 70B InstructMetaProviderCerebrasOutput Speed2,220 tok/sCatalog Latency0.65 sLLMBoard score21.4Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelMELlama 3.1 8B InstructMetaProviderCerebrasOutput Speed2,047 tok/sCatalog Latency0.2 sLLMBoard scoreN/AOfficial input / 1MN/AMax Input131.1KUpdatedAug 17, 2026
ModelMAMin istral 3 (3B Reasoning 2512)Mistral AIProviderMistral AIOutput Speed1,222 tok/sCatalog Latency0.16 sLLMBoard score20.1Official input / 1M$0.04Max Input131.1KUpdatedAug 17, 2026
ModelMELlama 3.1 70B InstructMetaProviderCerebrasOutput Speed1,204 tok/sCatalog Latency0.2 sLLMBoard score12.6Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelMELlama 3.3 70B InstructMetaProviderSambanovaOutput Speed1,096 tok/sCatalog Latency0.65 sLLMBoard score21.4Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelMELlama 3.1 8B InstructMetaProviderSambanovaOutput Speed1,050 tok/sCatalog Latency0.5 sLLMBoard scoreN/AOfficial input / 1MN/AMax Input131.1KUpdatedAug 17, 2026
ModelINMercury 2InceptionProviderInceptionOutput Speed1,009 tok/sCatalog Latency1.7 sLLMBoard score38.7Official input / 1M$0.25Max Input128KUpdatedAug 17, 2026
ModelOPGPT OSS 20BOpenAIProviderGroqOutput Speed1,000 tok/sCatalog Latency0.38 sLLMBoard score45.9Official input / 1MN/AMax Input131KUpdatedAug 17, 2026
ModelMELlama 4 ScoutMetaProviderGroqOutput Speed776.1 tok/sCatalog Latency1.08 sLLMBoard score13.5Official input / 1MN/AMax Input10MUpdatedAug 17, 2026
ModelMELlama 3.1 8B InstructMetaProviderGroqOutput Speed750 tok/sCatalog Latency0.5 sLLMBoard scoreN/AOfficial input / 1MN/AMax Input131.1KUpdatedAug 17, 2026
ModelSTStep-3.5-FlashStepFunProviderStepFunOutput Speed711.842 tok/sCatalog Latency1.084 sLLMBoard score60.3Official input / 1M$0.10Max Input65.5KUpdatedAug 17, 2026
ModelMELlama 4 MaverickMetaProviderSambanovaOutput Speed638.7 tok/sCatalog Latency2.04 sLLMBoard score24.2Official input / 1MN/AMax Input1MUpdatedAug 17, 2026
ModelOPGPT-5 nanoOpenAIProviderOpenAIOutput Speed500 tok/sCatalog Latency0.3 sLLMBoard score30.3Official input / 1M$0.05Max Input400KUpdatedAug 17, 2026
ModelOPGPT OSS 120BOpenAIProviderGroqOutput Speed500 tok/sCatalog Latency0.5 sLLMBoard score43.2Official input / 1MN/AMax Input131KUpdatedAug 17, 2026
ModelMELongCat-Flash-LiteMeituanProviderMeituanOutput Speed500 tok/sCatalog Latency1.5 sLLMBoard score32.2Official input / 1MN/AMax Input256KUpdatedAug 17, 2026
ModelACQwen3 32BAlibaba Cloud / Qwen TeamProviderSambanovaOutput Speed327.7 tok/sCatalog Latency1.08 sLLMBoard score30.8Official input / 1M$0.70Max Input128KUpdatedAug 17, 2026
ModelMELlama 4 MaverickMetaProviderGroqOutput Speed307.3 tok/sCatalog Latency0.27 sLLMBoard score24.2Official input / 1MN/AMax Input1MUpdatedAug 17, 2026
ModelMELlama 3.1 8B InstructMetaProviderFireworksOutput Speed292 tok/sCatalog Latency0.5 sLLMBoard scoreN/AOfficial input / 1MN/AMax Input131.1KUpdatedAug 17, 2026
ModelMAKimi K2.6Moonshot AIProviderFireworksOutput Speed285.051 tok/sCatalog Latency0.369 sLLMBoard score75.1Official input / 1M$0.95Max Input262.1KUpdatedAug 17, 2026
ModelMELlama 3.3 70B InstructMetaProviderGroqOutput Speed268 tok/sCatalog Latency0.65 sLLMBoard score21.4Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelMELlama 3.1 70B InstructMetaProviderGroqOutput Speed250 tok/sCatalog Latency0.5 sLLMBoard score12.6Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelMAMinistral 3 (8B Reasoning 2512)Mistral AIProviderMistral AIOutput Speed237.5 tok/sCatalog Latency0.34 sLLMBoard score28.3Official input / 1M$0.10Max Input262.1KUpdatedAug 17, 2026
ModelMIMiniMax M3MiniMaxProviderTogetherOutput Speed213.561 tok/sCatalog Latency0.962 sLLMBoard score71.1Official input / 1M$0.30Max Input1MUpdatedAug 17, 2026
ModelOPGPT-4.1 nanoOpenAIProviderOpenAIOutput Speed200 tok/sCatalog Latency2 sLLMBoard score3.5Official input / 1M$0.10Max Input1MUpdatedAug 17, 2026
ModelOPGPT-5 miniOpenAIProviderOpenAIOutput Speed200 tok/sCatalog Latency1 sLLMBoard score44.7Official input / 1M$0.25Max Input400KUpdatedAug 17, 2026
ModelOPGPT-5.1 Codex MiniOpenAIProviderOpenAIOutput Speed200 tok/sCatalog Latency1 sLLMBoard scoreN/AOfficial input / 1MN/AMax Input400KUpdatedAug 17, 2026
ModelMELlama 3.1 8B InstructMetaProviderHyperbolicOutput Speed200 tok/sCatalog Latency0.5 sLLMBoard scoreN/AOfficial input / 1MN/AMax Input131.1KUpdatedAug 17, 2026
ModelMELlama 3.3 70B InstructMetaProviderFireworksOutput Speed197 tok/sCatalog Latency0.65 sLLMBoard score21.4Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelMELlama 3.1 8B InstructMetaProviderTogetherOutput Speed194 tok/sCatalog Latency0.5 sLLMBoard scoreN/AOfficial input / 1MN/AMax Input131.1KUpdatedAug 17, 2026
ModelGOGemini 2.0 FlashGoogleProviderGoogleOutput Speed183 tok/sCatalog Latency0.4 sLLMBoard score27.6Official input / 1MN/AMax Input1MUpdatedAug 17, 2026
ModelGOGemini 3.6 FlashGoogleProviderGoogleOutput Speed180.67 tok/sCatalog Latency1.51 sLLMBoard score73.8Official input / 1M$1.5Max Input1MUpdatedAug 17, 2026
ModelMELlama 3.2 3B InstructMetaProviderDeepInfraOutput Speed171.5 tok/sCatalog Latency0.24 sLLMBoard scoreN/AOfficial input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelMELlama 3.2 11B InstructMetaProviderTogetherOutput Speed168 tok/sCatalog Latency0.5 sLLMBoard scoreN/AOfficial input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelGOGemini 1.5 FlashGoogleProviderGoogleOutput Speed150 tok/sCatalog Latency0.3 sLLMBoard score10.4Official input / 1MN/AMax Input1MUpdatedAug 17, 2026
ModelGOGemini 1.5 Flash 8BGoogleProviderGoogleOutput Speed150 tok/sCatalog Latency0.3 sLLMBoard scoreN/AOfficial input / 1MN/AMax Input1MUpdatedAug 17, 2026
ModelMELlama 4 ScoutMetaProviderLambdaOutput Speed139.7 tok/sCatalog Latency0.43 sLLMBoard score13.5Official input / 1MN/AMax Input10MUpdatedAug 17, 2026
ModelACQwen2.5 7B InstructAlibaba Cloud / Qwen TeamProviderTogetherOutput Speed138 tok/sCatalog Latency0.5 sLLMBoard score5.7Official input / 1M$0.175Max Input131.1KUpdatedAug 17, 2026
ModelMADevstral MediumMistral AIProviderMistral AIOutput Speed137.1 tok/sCatalog Latency0.23 sLLMBoard score23.2Official input / 1M$0.40Max Input128KUpdatedAug 17, 2026
ModelMADevstral Small 1.1Mistral AIProviderMistral AIOutput Speed137.1 tok/sCatalog Latency0.23 sLLMBoard score16.5Official input / 1M$0.10Max Input128KUpdatedAug 17, 2026
ModelMAMistral Small 3.1 24B BaseMistral AIProviderMistral AIOutput Speed137.1 tok/sCatalog Latency0.23 sLLMBoard score7.8Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelMAMistral Small 3 24B InstructMistral AIProviderMistral AIOutput Speed134 tok/sCatalog Latency0.2 sLLMBoard score6.7Official input / 1MN/AMax Input32KUpdatedAug 17, 2026
ModelOPChatGPT-4o LatestOpenAIProviderOpenAIOutput Speed132 tok/sCatalog Latency0.5 sLLMBoard score23.3Official input / 1M$2.5Max Input128KUpdatedAug 17, 2026
ModelOPGPT-4oOpenAIProviderOpenAIOutput Speed132 tok/sCatalog Latency0.5 sLLMBoard score23.3Official input / 1M$2.5Max Input128KUpdatedAug 17, 2026
ModelMAMinistral 3 (14B Reasoning 2512)Mistral AIProviderMistral AIOutput Speed128.6 tok/sCatalog Latency0.23 sLLMBoard score28.3Official input / 1M$0.10Max Input262.1KUpdatedAug 17, 2026
ModelMELlama 3.2 11B InstructMetaProviderFireworksOutput Speed125 tok/sCatalog Latency0.2 sLLMBoard scoreN/AOfficial input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelACQwen3 30B A3BAlibaba Cloud / Qwen TeamProviderFireworksOutput Speed122.4 tok/sCatalog Latency0.66 sLLMBoard score28.2Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelMAKimi K2.6Moonshot AIProviderTogetherOutput Speed122.302 tok/sCatalog Latency0.972 sLLMBoard score75.1Official input / 1M$0.95Max Input262.1KUpdatedAug 17, 2026
ModelANClaude 3 OpusAnthropicProviderBedrockOutput Speed120 tok/sCatalog Latency0.5 sLLMBoard score16.1Official input / 1MN/AMax Input200KUpdatedAug 17, 2026
ModelANClaude 3 SonnetAnthropicProviderBedrockOutput Speed120 tok/sCatalog Latency0.5 sLLMBoard score3.1Official input / 1MN/AMax Input200KUpdatedAug 17, 2026
ModelANClaude Opus 4.1AnthropicProviderBedrockOutput Speed120 tok/sCatalog Latency0.5 sLLMBoard score52.1Official input / 1MN/AMax Input200KUpdatedAug 17, 2026
ModelANClaude Opus 4AnthropicProviderBedrockOutput Speed120 tok/sCatalog Latency0.5 sLLMBoard score45.3Official input / 1MN/AMax Input200KUpdatedAug 17, 2026
ModelGOGemini 1.0 ProGoogleProviderGoogleOutput Speed120 tok/sCatalog Latency0.4 sLLMBoard scoreN/AOfficial input / 1MN/AMax Input32.8KUpdatedAug 17, 2026
ModelMELlama 3.1 8B InstructMetaProviderDeepInfraOutput Speed118 tok/sCatalog Latency0.5 sLLMBoard scoreN/AOfficial input / 1MN/AMax Input131.1KUpdatedAug 17, 2026
ModelMELlama 4 ScoutMetaProviderFireworksOutput Speed116.1 tok/sCatalog Latency0.53 sLLMBoard score13.5Official input / 1MN/AMax Input10MUpdatedAug 17, 2026
ModelOPGPT OSS 120BOpenAIProviderOpenAIOutput Speed115 tok/sCatalog Latency5.2 sLLMBoard score43.2Official input / 1MN/AMax Input131.1KUpdatedAug 17, 2026
ModelOPGPT OSS 20BOpenAIProviderOpenAIOutput Speed115 tok/sCatalog Latency5.2 sLLMBoard score45.9Official input / 1MN/AMax Input131.1KUpdatedAug 17, 2026
ModelOPo1-miniOpenAIProviderOpenAIOutput Speed115 tok/sCatalog Latency5.2 sLLMBoard score16.1Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelOPo3-miniOpenAIProviderAzureOutput Speed115 tok/sCatalog Latency5.2 sLLMBoard score35.2Official input / 1M$1.1Max Input200KUpdatedAug 17, 2026
ModelOPo3-miniOpenAIProviderOpenAIOutput Speed115 tok/sCatalog Latency5.2 sLLMBoard score35.2Official input / 1M$1.1Max Input200KUpdatedAug 17, 2026
ModelOPo4-miniOpenAIProviderOpenAIOutput Speed115 tok/sCatalog Latency5.2 sLLMBoard score44.5Official input / 1M$1.1Max Input200KUpdatedAug 17, 2026
ModelACQwen2.5-Coder 32B InstructAlibaba Cloud / Qwen TeamProviderFireworksOutput Speed110 tok/sCatalog Latency0.26 sLLMBoard score4.9Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelMELlama 3.2 11B InstructMetaProviderDeepInfraOutput Speed108 tok/sCatalog Latency0.5 sLLMBoard scoreN/AOfficial input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelMELlama 4 ScoutMetaProviderTogetherOutput Speed106.9 tok/sCatalog Latency0.54 sLLMBoard score13.5Official input / 1MN/AMax Input10MUpdatedAug 17, 2026
ModelANClaude 3.5 HaikuAnthropicProviderBedrockOutput Speed104 tok/sCatalog Latency0.5 sLLMBoard score8.5Official input / 1MN/AMax Input200KUpdatedAug 17, 2026
ModelANClaude 3 HaikuAnthropicProviderBedrockOutput Speed104 tok/sCatalog Latency0.5 sLLMBoard scoreN/AOfficial input / 1MN/AMax Input200KUpdatedAug 17, 2026
ModelOPGPT-4OpenAIProviderAzureOutput Speed104 tok/sCatalog Latency0.3 sLLMBoard score3.5Official input / 1M$30Max Input32.8KUpdatedAug 17, 2026
ModelMIMiniMax M2MiniMaxProviderMiniMaxOutput Speed103.094 tok/sCatalog Latency1.795 sLLMBoard score44.3Official input / 1M$0.30Max Input1MUpdatedAug 17, 2026
ModelMIMiniMax M2.7MiniMaxProviderMiniMaxOutput Speed101.856 tok/sCatalog Latency1.579 sLLMBoard score59.1Official input / 1M$0.30Max Input204.8KUpdatedAug 17, 2026
ModelANClaude 3.5 SonnetAnthropicProviderBedrockOutput Speed101 tok/sCatalog Latency0.5 sLLMBoard score31.4Official input / 1MN/AMax Input200KUpdatedAug 17, 2026
ModelANClaude 3.5 SonnetAnthropicProviderBedrockOutput Speed101 tok/sCatalog Latency0.5 sLLMBoard score31.4Official input / 1MN/AMax Input200KUpdatedAug 17, 2026
ModelANClaude 3.7 SonnetAnthropicProviderBedrockOutput Speed101 tok/sCatalog Latency0.5 sLLMBoard score37.8Official input / 1MN/AMax Input200KUpdatedAug 17, 2026
ModelANClaude Sonnet 4AnthropicProviderBedrockOutput Speed101 tok/sCatalog Latency0.5 sLLMBoard score38.7Official input / 1MN/AMax Input200KUpdatedAug 17, 2026
ModelANClaude 3.5 HaikuAnthropicProviderAnthropicOutput Speed100 tok/sCatalog Latency0.3 sLLMBoard score8.5Official input / 1MN/AMax Input200KUpdatedAug 17, 2026
ModelANClaude 3.5 SonnetAnthropicProviderAnthropicOutput Speed100 tok/sCatalog Latency0.5 sLLMBoard score31.4Official input / 1MN/AMax Input200KUpdatedAug 17, 2026
ModelANClaude 3 HaikuAnthropicProviderAnthropicOutput Speed100 tok/sCatalog Latency0.5 sLLMBoard scoreN/AOfficial input / 1MN/AMax Input200KUpdatedAug 17, 2026
ModelANClaude 3 OpusAnthropicProviderAnthropicOutput Speed100 tok/sCatalog Latency0.5 sLLMBoard score16.1Official input / 1MN/AMax Input200KUpdatedAug 17, 2026
ModelANClaude 3 SonnetAnthropicProviderAnthropicOutput Speed100 tok/sCatalog Latency0.5 sLLMBoard score3.1Official input / 1MN/AMax Input200KUpdatedAug 17, 2026
ModelANClaude Haiku 4.5AnthropicProviderAnthropicOutput Speed100 tok/sCatalog Latency0.3 sLLMBoard score45.2Official input / 1M$1Max Input200KUpdatedAug 17, 2026
ModelANClaude Haiku 4.5AnthropicProviderVertex AIOutput Speed100 tok/sCatalog Latency0.3 sLLMBoard score45.2Official input / 1M$1Max Input200KUpdatedAug 17, 2026
ModelANClaude Opus 4.1AnthropicProviderAnthropicOutput Speed100 tok/sCatalog Latency0.5 sLLMBoard score52.1Official input / 1MN/AMax Input200KUpdatedAug 17, 2026
ModelANClaude Opus 4AnthropicProviderAnthropicOutput Speed100 tok/sCatalog Latency0.5 sLLMBoard score45.3Official input / 1MN/AMax Input200KUpdatedAug 17, 2026
ModelCOCommand R+CohereProviderBedrockOutput Speed100 tok/sCatalog Latency0.5 sLLMBoard scoreN/AOfficial input / 1M$2.5Max Input128KUpdatedAug 17, 2026
ModelDEDeepSeek-V2.5DeepSeekProviderDeepSeekOutput Speed100 tok/sCatalog Latency0.5 sLLMBoard score13.8Official input / 1MN/AMax Input8.2KUpdatedAug 17, 2026
ModelDEDeepSeek-V2.5DeepSeekProviderHyperbolicOutput Speed100 tok/sCatalog Latency0.5 sLLMBoard score13.8Official input / 1MN/AMax Input8.2KUpdatedAug 17, 2026
ModelDEDeepSeek-V3DeepSeekProviderDeepSeekOutput Speed100 tok/sCatalog Latency0.5 sLLMBoard score25.5Official input / 1MN/AMax Input131.1KUpdatedAug 17, 2026
ModelOPGPT-3.5 TurboOpenAIProviderOpenAIOutput Speed100 tok/sCatalog Latency0.5 sLLMBoard scoreN/AOfficial input / 1M$0.50Max Input16.4KUpdatedAug 17, 2026
ModelOPGPT-4OpenAIProviderOpenAIOutput Speed100 tok/sCatalog Latency0.5 sLLMBoard score3.5Official input / 1M$30Max Input32.8KUpdatedAug 17, 2026
ModelOPGPT-4 TurboOpenAIProviderOpenAIOutput Speed100 tok/sCatalog Latency0.5 sLLMBoard score14.0Official input / 1M$10Max Input128KUpdatedAug 17, 2026
ModelOPGPT-4.1OpenAIProviderOpenAIOutput Speed100 tok/sCatalog Latency10 sLLMBoard score31.3Official input / 1M$2Max Input1MUpdatedAug 17, 2026
ModelOPGPT-4oOpenAIProviderOpenAIOutput Speed100 tok/sCatalog Latency0.5 sLLMBoard score23.3Official input / 1M$2.5Max Input128KUpdatedAug 17, 2026
ModelOPGPT-5OpenAIProviderOpenAIOutput Speed100 tok/sCatalog Latency2 sLLMBoard score49.5Official input / 1M$1.25Max Input400KUpdatedAug 17, 2026
ModelOPGPT-5.1OpenAIProviderOpenAIOutput Speed100 tok/sCatalog Latency2 sLLMBoard score62.2Official input / 1M$1.25Max Input400KUpdatedAug 17, 2026
ModelOPGPT-5.1 InstantOpenAIProviderOpenAIOutput Speed100 tok/sCatalog Latency2 sLLMBoard score61.1Official input / 1MN/AMax Input400KUpdatedAug 17, 2026
ModelOPGPT-5.2OpenAIProviderOpenAIOutput Speed100 tok/sCatalog Latency2 sLLMBoard score70.0Official input / 1M$1.75Max Input400KUpdatedAug 17, 2026
ModelOPGPT-5.3 ChatOpenAIProviderOpenAIOutput Speed100 tok/sCatalog Latency2 sLLMBoard score39.7Official input / 1M$1.75Max Input128KUpdatedAug 17, 2026
ModelOPGPT-5.5 InstantOpenAIProviderOpenAIOutput Speed100 tok/sCatalog Latency2 sLLMBoard score53.5Official input / 1MN/AMax Input400KUpdatedAug 17, 2026
ModelOPGPT OSS 120B HighOpenAIProviderOpenAIOutput Speed100 tok/sCatalog Latency6.5 sLLMBoard score43.2Official input / 1MN/AMax Input131.1KUpdatedAug 17, 2026
ModelOPGPT OSS 20B HighOpenAIProviderOpenAIOutput Speed100 tok/sCatalog Latency6.5 sLLMBoard score45.9Official input / 1MN/AMax Input131.1KUpdatedAug 17, 2026
ModelXAGrok-3xAIProviderxAIOutput Speed100 tok/sCatalog Latency0.7 sLLMBoard score54.5Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelXAGrok-3 MinixAIProviderxAIOutput Speed100 tok/sCatalog Latency0.7 sLLMBoard score47.9Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelXAGrok-4xAIProviderxAIOutput Speed100 tok/sCatalog Latency0.7 sLLMBoard score56.1Official input / 1MN/AMax Input256KUpdatedAug 17, 2026
ModelXAGrok-4.1xAIProviderxAIOutput Speed100 tok/sCatalog Latency0.7 sLLMBoard score46.5Official input / 1MN/AMax Input256KUpdatedAug 17, 2026
ModelALJamba 1.5 LargeAI21 LabsProviderBedrockOutput Speed100 tok/sCatalog Latency0.5 sLLMBoard score2.0Official input / 1MN/AMax Input256KUpdatedAug 17, 2026
ModelALJamba 1.5 MiniAI21 LabsProviderBedrockOutput Speed100 tok/sCatalog Latency0.5 sLLMBoard scoreN/AOfficial input / 1MN/AMax Input256.1KUpdatedAug 17, 2026
ModelALJamba 1.5 MiniAI21 LabsProviderGoogleOutput Speed100 tok/sCatalog Latency0.3 sLLMBoard scoreN/AOfficial input / 1MN/AMax Input256.1KUpdatedAug 17, 2026
ModelMELlama 3.1 405B InstructMetaProviderBedrockOutput Speed100 tok/sCatalog Latency0.5 sLLMBoard score23.9Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelMELlama 3.1 70B InstructMetaProviderHyperbolicOutput Speed100 tok/sCatalog Latency0.5 sLLMBoard score12.6Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelMELlama 3.1 70B InstructMetaProviderBedrockOutput Speed100 tok/sCatalog Latency0.5 sLLMBoard score12.6Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelMELlama 3.1 8B InstructMetaProviderBedrockOutput Speed100 tok/sCatalog Latency0.5 sLLMBoard scoreN/AOfficial input / 1MN/AMax Input131.1KUpdatedAug 17, 2026
ModelMELlama 3.2 11B InstructMetaProviderSambanovaOutput Speed100 tok/sCatalog Latency0.5 sLLMBoard scoreN/AOfficial input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelMELlama 3.2 11B InstructMetaProviderBedrockOutput Speed100 tok/sCatalog Latency0.5 sLLMBoard scoreN/AOfficial input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelMELlama 3.2 11B InstructMetaProviderGroqOutput Speed100 tok/sCatalog Latency0.5 sLLMBoard scoreN/AOfficial input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelMELlama 3.2 90B InstructMetaProviderBedrockOutput Speed100 tok/sCatalog Latency0.5 sLLMBoard score9.9Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelMELlama 3.3 70B InstructMetaProviderBedrockOutput Speed100 tok/sCatalog Latency0.5 sLLMBoard score21.4Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelMELongCat-Flash-ChatMeituanProviderMeituanOutput Speed100 tok/sCatalog Latency3 sLLMBoard score36.1Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelMELongCat-Flash-ThinkingMeituanProviderMeituanOutput Speed100 tok/sCatalog Latency3 sLLMBoard score60.3Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelMELongCat-Flash-Thinking-2601MeituanProviderMeituanOutput Speed100 tok/sCatalog Latency3 sLLMBoard score60.3Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelMIMiniMax M2.1MiniMaxProviderMiniMaxOutput Speed100 tok/sCatalog Latency3 sLLMBoard score53.3Official input / 1M$0.30Max Input1MUpdatedAug 17, 2026
ModelMIMiniMax M2.5MiniMaxProviderMiniMaxOutput Speed100 tok/sCatalog Latency3 sLLMBoard score55.7Official input / 1M$0.30Max Input1MUpdatedAug 17, 2026
ModelAMNova LiteAmazonProviderBedrockOutput Speed100 tok/sCatalog Latency0.5 sLLMBoard score12.7Official input / 1M$0.06Max Input300KUpdatedAug 17, 2026
ModelAMNova MicroAmazonProviderBedrockOutput Speed100 tok/sCatalog Latency0.5 sLLMBoard score3.8Official input / 1M$0.035Max Input128KUpdatedAug 17, 2026
ModelAMNova ProAmazonProviderBedrockOutput Speed100 tok/sCatalog Latency0.5 sLLMBoard score20.3Official input / 1M$0.80Max Input300KUpdatedAug 17, 2026
ModelOPo1-miniOpenAIProviderAzureOutput Speed100 tok/sCatalog Latency0.5 sLLMBoard score16.1Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelACQwen2.5 72B InstructAlibaba Cloud / Qwen TeamProviderHyperbolicOutput Speed100 tok/sCatalog Latency0.5 sLLMBoard score20.7Official input / 1M$1.4Max Input131.1KUpdatedAug 17, 2026
ModelACQwen2.5-Coder 32B InstructAlibaba Cloud / Qwen TeamProviderHyperbolicOutput Speed100 tok/sCatalog Latency0.5 sLLMBoard score4.9Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelACQwQ-32B-PreviewAlibaba Cloud / Qwen TeamProviderFireworksOutput Speed99.15 tok/sCatalog Latency0.53 sLLMBoard score24.2Official input / 1M$0.287Max Input32.8KUpdatedAug 17, 2026
ModelOPGPT-4oOpenAIProviderAzureOutput Speed99 tok/sCatalog Latency0.53 sLLMBoard score23.3Official input / 1M$2.5Max Input128KUpdatedAug 17, 2026
ModelMELlama 4 MaverickMetaProviderTogetherOutput Speed97.93 tok/sCatalog Latency0.2 sLLMBoard score24.2Official input / 1MN/AMax Input1MUpdatedAug 17, 2026
ModelDEDeepSeek-V3.2DeepSeekProviderDeepInfraOutput Speed97 tok/sCatalog Latency0.82 sLLMBoard score57.5Official input / 1M$0.14Max Input163.8KUpdatedAug 17, 2026
ModelOPGPT-4 TurboOpenAIProviderAzureOutput Speed97 tok/sCatalog Latency0.6 sLLMBoard score14.0Official input / 1M$10Max Input128KUpdatedAug 17, 2026
ModelMELlama 3.1 70B InstructMetaProviderTogetherOutput Speed94 tok/sCatalog Latency0.5 sLLMBoard score12.6Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelMELlama 4 MaverickMetaProviderLambdaOutput Speed93.69 tok/sCatalog Latency0.65 sLLMBoard score24.2Official input / 1MN/AMax Input1MUpdatedAug 17, 2026
ModelOPGPT-4oOpenAIProviderAzureOutput Speed92 tok/sCatalog Latency0.54 sLLMBoard score23.3Official input / 1M$2.5Max Input128KUpdatedAug 17, 2026
ModelOPGPT-4o miniOpenAIProviderAzureOutput Speed92 tok/sCatalog Latency0.52 sLLMBoard score7.5Official input / 1M$0.15Max Input128KUpdatedAug 17, 2026
ModelGOGemini 3 ProGoogleProviderGoogleOutput Speed90 tok/sCatalog Latency0.6 sLLMBoard score67.1Official input / 1MN/AMax Input1MUpdatedAug 17, 2026
ModelOPGPT-3.5 TurboOpenAIProviderAzureOutput Speed90 tok/sCatalog Latency0.8 sLLMBoard scoreN/AOfficial input / 1M$0.50Max Input16.4KUpdatedAug 17, 2026
ModelOPGPT-5 MediumOpenAIProviderOpenAIOutput Speed90 tok/sCatalog Latency2.5 sLLMBoard score49.5Official input / 1M$1.25Max Input400KUpdatedAug 17, 2026
ModelOPGPT-5.1 MediumOpenAIProviderOpenAIOutput Speed90 tok/sCatalog Latency2.5 sLLMBoard score62.2Official input / 1M$1.25Max Input400KUpdatedAug 17, 2026
ModelACQwen3 30B A3BAlibaba Cloud / Qwen TeamProviderNovitaOutput Speed88.84 tok/sCatalog Latency0.73 sLLMBoard score28.2Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelXIMiMo-V2.5XiaomiProviderNovitaOutput Speed87.039 tok/sCatalog Latency2.231 sLLMBoard score61.6Official input / 1M$0.14Max Input1MUpdatedAug 17, 2026
ModelGOGemini 2.5 ProGoogleProviderGoogleOutput Speed86.301 tok/sCatalog Latency8.059 sLLMBoard score49.8Official input / 1M$1.25Max Input1MUpdatedAug 17, 2026
ModelGOGemini 1.5 ProGoogleProviderGoogleOutput Speed85 tok/sCatalog Latency0.7 sLLMBoard score20.0Official input / 1MN/AMax Input2.1MUpdatedAug 17, 2026
ModelGOGemini 2.0 Flash-LiteGoogleProviderGoogleOutput Speed85 tok/sCatalog Latency0.7 sLLMBoard score20.4Official input / 1MN/AMax Input1MUpdatedAug 17, 2026
ModelGOGemini 2.5 FlashGoogleProviderGoogleOutput Speed85 tok/sCatalog Latency0.7 sLLMBoard score38.5Official input / 1M$0.30Max Input1MUpdatedAug 17, 2026
ModelGOGemini 2.5 Pro Preview 06-05GoogleProviderGoogleOutput Speed85 tok/sCatalog Latency0.7 sLLMBoard score49.8Official input / 1M$1.25Max Input1MUpdatedAug 17, 2026
ModelZAGLM-4.6Zhipu AIProviderDeepInfraOutput Speed85 tok/sCatalog Latency0.7 sLLMBoard score53.6Official input / 1M$0.60Max Input131.1KUpdatedAug 17, 2026
ModelXAGrok-2xAIProviderxAIOutput Speed85 tok/sCatalog Latency0.7 sLLMBoard score20.4Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelMELlama 4 MaverickMetaProviderDeepInfraOutput Speed83.59 tok/sCatalog Latency0.38 sLLMBoard score24.2Official input / 1MN/AMax Input1MUpdatedAug 17, 2026
ModelACQwen3 30B A3BAlibaba Cloud / Qwen TeamProviderDeepInfraOutput Speed82.57 tok/sCatalog Latency0.84 sLLMBoard score28.2Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelOPGPT-5 HighOpenAIProviderOpenAIOutput Speed80 tok/sCatalog Latency3 sLLMBoard score49.5Official input / 1M$1.25Max Input400KUpdatedAug 17, 2026
ModelOPGPT-5.1 HighOpenAIProviderOpenAIOutput Speed80 tok/sCatalog Latency3.5 sLLMBoard score62.2Official input / 1M$1.25Max Input400KUpdatedAug 17, 2026
ModelOPGPT-5.1 ThinkingOpenAIProviderOpenAIOutput Speed80 tok/sCatalog Latency3 sLLMBoard score62.2Official input / 1M$1.25Max Input400KUpdatedAug 17, 2026
ModelXAGrok-4.1 ThinkingxAIProviderxAIOutput Speed80 tok/sCatalog Latency1.2 sLLMBoard score50.8Official input / 1MN/AMax Input256KUpdatedAug 17, 2026
ModelMELlama 3.1 405B InstructMetaProviderFireworksOutput Speed78 tok/sCatalog Latency0.5 sLLMBoard score23.9Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelXAGrok Code Fast 1xAIProviderxAIOutput Speed76.41 tok/sCatalog Latency1.38 sLLMBoard score35.4Official input / 1MN/AMax Input256KUpdatedAug 17, 2026
ModelMELlama 4 ScoutMetaProviderDeepInfraOutput Speed76.1 tok/sCatalog Latency0.31 sLLMBoard score13.5Official input / 1MN/AMax Input10MUpdatedAug 17, 2026
ModelACQwQ-32B-PreviewAlibaba Cloud / Qwen TeamProviderDeepInfraOutput Speed76.04 tok/sCatalog Latency0.44 sLLMBoard score24.2Official input / 1M$0.287Max Input32.8KUpdatedAug 17, 2026
ModelMELlama 3.1 70B InstructMetaProviderSambanovaOutput Speed74 tok/sCatalog Latency0.5 sLLMBoard score12.6Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelMELlama 4 ScoutMetaProviderNovitaOutput Speed69.82 tok/sCatalog Latency0.85 sLLMBoard score13.5Official input / 1MN/AMax Input10MUpdatedAug 17, 2026
ModelMELlama 4 MaverickMetaProviderNovitaOutput Speed69.42 tok/sCatalog Latency0.62 sLLMBoard score24.2Official input / 1MN/AMax Input1MUpdatedAug 17, 2026
ModelOPGPT-4.1 miniOpenAIProviderOpenAIOutput Speed68.886 tok/sCatalog Latency5 sLLMBoard score24.1Official input / 1M$0.40Max Input1MUpdatedAug 17, 2026
ModelXIMiMo-V2.5-ProXiaomiProviderNovitaOutput Speed68.716 tok/sCatalog Latency4.348 sLLMBoard score46.2Official input / 1M$0.435Max Input1MUpdatedAug 17, 2026
ModelACQwen3 235B A22BAlibaba Cloud / Qwen TeamProviderFireworksOutput Speed68.17 tok/sCatalog Latency0.78 sLLMBoard score41.9Official input / 1M$0.70Max Input128KUpdatedAug 17, 2026
ModelOPo1OpenAIProviderOpenAIOutput Speed66 tok/sCatalog Latency16.2 sLLMBoard score35.9Official input / 1M$15Max Input200KUpdatedAug 17, 2026
ModelOPo1-previewOpenAIProviderOpenAIOutput Speed66 tok/sCatalog Latency16.2 sLLMBoard score35.9Official input / 1M$15Max Input128KUpdatedAug 17, 2026
ModelGOGemini 3 FlashGoogleProviderGoogleOutput Speed65.14 tok/sCatalog Latency5.259 sLLMBoard score64.6Official input / 1M$0.50Max Input1MUpdatedAug 17, 2026
ModelMELlama 3.3 70B InstructMetaProviderTogetherOutput Speed65 tok/sCatalog Latency0.65 sLLMBoard score21.4Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelMELlama 4 MaverickMetaProviderFireworksOutput Speed63.03 tok/sCatalog Latency0.62 sLLMBoard score24.2Official input / 1MN/AMax Input1MUpdatedAug 17, 2026
ModelDEDeepSeek-V2.5DeepSeekProviderDeepInfraOutput Speed63 tok/sCatalog Latency0.5 sLLMBoard score13.8Official input / 1MN/AMax Input8.2KUpdatedAug 17, 2026
ModelACQwQ-32B-PreviewAlibaba Cloud / Qwen TeamProviderTogetherOutput Speed62.14 tok/sCatalog Latency0.74 sLLMBoard score24.2Official input / 1M$0.287Max Input32.8KUpdatedAug 17, 2026
ModelCOCommand R+CohereProviderCohereOutput Speed59 tok/sCatalog Latency0.65 sLLMBoard scoreN/AOfficial input / 1M$2.5Max Input128KUpdatedAug 17, 2026
ModelACQwen2.5 72B InstructAlibaba Cloud / Qwen TeamProviderFireworksOutput Speed59 tok/sCatalog Latency0.37 sLLMBoard score20.7Official input / 1M$1.4Max Input131.1KUpdatedAug 17, 2026
ModelMELlama 3.2 90B InstructMetaProviderTogetherOutput Speed57 tok/sCatalog Latency0.5 sLLMBoard score9.9Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelMIMiniMax M3MiniMaxProviderMiniMaxOutput Speed55.078 tok/sCatalog Latency0.891 sLLMBoard score71.1Official input / 1M$0.30Max Input1MUpdatedAug 17, 2026
ModelDEDeepSeek-V3.2 (Thinking)DeepSeekProviderDeepSeekOutput Speed50 tok/sCatalog Latency0.5 sLLMBoard score57.5Official input / 1M$0.14Max Input131.1KUpdatedAug 17, 2026
ModelZAGLM-4.7-FlashZhipu AIProviderZAIOutput Speed50 tok/sCatalog Latency2 sLLMBoard score37.9Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelOPGPT-4.5OpenAIProviderOpenAIOutput Speed50 tok/sCatalog Latency20 sLLMBoard score35.7Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelOPGPT-5.1 CodexOpenAIProviderOpenAIOutput Speed50 tok/sCatalog Latency3 sLLMBoard score49.6Official input / 1MN/AMax Input400KUpdatedAug 17, 2026
ModelOPGPT-5.1 Codex HighOpenAIProviderOpenAIOutput Speed50 tok/sCatalog Latency3.5 sLLMBoard score49.6Official input / 1MN/AMax Input400KUpdatedAug 17, 2026
ModelOPGPT-5.2 CodexOpenAIProviderOpenAIOutput Speed50 tok/sCatalog Latency3 sLLMBoard score59.2Official input / 1MN/AMax Input400KUpdatedAug 17, 2026
ModelIBGranite 3.3 8B InstructIBMProviderReplicateOutput Speed50 tok/sCatalog Latency0.3 sLLMBoard score3.0Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelLAK-EXAONE-236B-A23BLG AI ResearchProviderFriendliAIOutput Speed50 tok/sCatalog Latency0.4 sLLMBoard score44.3Official input / 1MN/AMax Input32.8KUpdatedAug 17, 2026
ModelMELlama 3.2 90B InstructMetaProviderFireworksOutput Speed50 tok/sCatalog Latency0.5 sLLMBoard score9.9Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelOPo3OpenAIProviderOpenAIOutput Speed50 tok/sCatalog Latency20 sLLMBoard score52.4Official input / 1M$2Max Input200KUpdatedAug 17, 2026
ModelMAMistral Small 3 24B InstructMistral AIProviderDeepInfraOutput Speed49 tok/sCatalog Latency0.2 sLLMBoard score6.7Official input / 1MN/AMax Input32KUpdatedAug 17, 2026
ModelOPGPT-5.6 LunaOpenAIProviderOpenAIOutput Speed48.852 tok/sCatalog Latency5.239 sLLMBoard score76.8Official input / 1M$0.20Max Input1.1MUpdatedAug 17, 2026
ModelACQwen2.5 72B InstructAlibaba Cloud / Qwen TeamProviderTogetherOutput Speed47 tok/sCatalog Latency0.5 sLLMBoard score20.7Official input / 1M$1.4Max Input131.1KUpdatedAug 17, 2026
ModelANClaude Opus 4.8AnthropicProviderAnthropicOutput Speed45.954 tok/sCatalog Latency1.29 sLLMBoard score87.1Official input / 1M$5Max Input1MUpdatedAug 17, 2026
ModelDEDeepSeek-R1-0528DeepSeekProviderDeepInfraOutput Speed45.04 tok/sCatalog Latency0.61 sLLMBoard score43.5Official input / 1MN/AMax Input131.1KUpdatedAug 17, 2026
ModelMAKimi K2 InstructMoonshot AIProviderNovitaOutput Speed45 tok/sCatalog Latency0.95 sLLMBoard score36.6Official input / 1M$0.60Max Input131.1KUpdatedAug 17, 2026
ModelACQwen2.5-Coder 32B InstructAlibaba Cloud / Qwen TeamProviderDeepInfraOutput Speed44 tok/sCatalog Latency0.5 sLLMBoard score4.9Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelGOGemma 3n E4B InstructedGoogleProviderTogetherOutput Speed42.09 tok/sCatalog Latency0.43 sLLMBoard scoreN/AOfficial input / 1MN/AMax Input32KUpdatedAug 17, 2026
ModelANClaude 3.5 HaikuAnthropicProviderGoogleOutput Speed42 tok/sCatalog Latency0.4 sLLMBoard score8.5Official input / 1MN/AMax Input200KUpdatedAug 17, 2026
ModelANClaude 3.5 SonnetAnthropicProviderGoogleOutput Speed42 tok/sCatalog Latency0.4 sLLMBoard score31.4Official input / 1MN/AMax Input200KUpdatedAug 17, 2026
ModelANClaude 3.5 SonnetAnthropicProviderGoogleOutput Speed42 tok/sCatalog Latency0.4 sLLMBoard score31.4Official input / 1MN/AMax Input200KUpdatedAug 17, 2026
ModelANClaude 3.7 SonnetAnthropicProviderAnthropicOutput Speed42 tok/sCatalog Latency0.4 sLLMBoard score37.8Official input / 1MN/AMax Input200KUpdatedAug 17, 2026
ModelANClaude 3.7 SonnetAnthropicProviderGoogleOutput Speed42 tok/sCatalog Latency0.4 sLLMBoard score37.8Official input / 1MN/AMax Input200KUpdatedAug 17, 2026
ModelANClaude 3 HaikuAnthropicProviderGoogleOutput Speed42 tok/sCatalog Latency0.4 sLLMBoard scoreN/AOfficial input / 1MN/AMax Input200KUpdatedAug 17, 2026
ModelANClaude 3 OpusAnthropicProviderGoogleOutput Speed42 tok/sCatalog Latency0.4 sLLMBoard score16.1Official input / 1MN/AMax Input200KUpdatedAug 17, 2026
ModelANClaude 3 SonnetAnthropicProviderGoogleOutput Speed42 tok/sCatalog Latency0.4 sLLMBoard score3.1Official input / 1MN/AMax Input200KUpdatedAug 17, 2026
ModelANClaude Opus 4.1AnthropicProviderGoogleOutput Speed42 tok/sCatalog Latency0.4 sLLMBoard score52.1Official input / 1MN/AMax Input200KUpdatedAug 17, 2026
ModelANClaude Opus 4AnthropicProviderGoogleOutput Speed42 tok/sCatalog Latency0.4 sLLMBoard score45.3Official input / 1MN/AMax Input200KUpdatedAug 17, 2026
ModelANClaude Opus 4.5AnthropicProviderAnthropicOutput Speed42 tok/sCatalog Latency0.5 sLLMBoard score69.3Official input / 1M$5Max Input200KUpdatedAug 17, 2026
ModelANClaude Opus 4.7AnthropicProviderAnthropicOutput Speed42 tok/sCatalog Latency0.5 sLLMBoard score84.0Official input / 1M$5Max Input1MUpdatedAug 17, 2026
ModelANClaude Opus 4.7AnthropicProviderVertex AIOutput Speed42 tok/sCatalog Latency0.5 sLLMBoard score84.0Official input / 1M$5Max Input1MUpdatedAug 17, 2026
ModelANClaude Opus 4.8AnthropicProviderVertex AIOutput Speed42 tok/sCatalog Latency0.5 sLLMBoard score87.1Official input / 1M$5Max Input1MUpdatedAug 17, 2026
ModelANClaude Sonnet 4AnthropicProviderAnthropicOutput Speed42 tok/sCatalog Latency0.4 sLLMBoard score38.7Official input / 1MN/AMax Input200KUpdatedAug 17, 2026
ModelANClaude Sonnet 4AnthropicProviderGoogleOutput Speed42 tok/sCatalog Latency0.4 sLLMBoard score38.7Official input / 1MN/AMax Input200KUpdatedAug 17, 2026
ModelANClaude Sonnet 4.5AnthropicProviderAnthropicOutput Speed42 tok/sCatalog Latency0.4 sLLMBoard score56.6Official input / 1M$3Max Input200KUpdatedAug 17, 2026
ModelALJamba 1.5 LargeAI21 LabsProviderGoogleOutput Speed42 tok/sCatalog Latency0.3 sLLMBoard score2.0Official input / 1MN/AMax Input256KUpdatedAug 17, 2026
ModelMELlama 3.1 405B InstructMetaProviderLambdaOutput Speed42 tok/sCatalog Latency0.5 sLLMBoard score23.9Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelMELlama 3.1 405B InstructMetaProviderGoogleOutput Speed42 tok/sCatalog Latency0.4 sLLMBoard score23.9Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelMELlama 3.1 70B InstructMetaProviderLambdaOutput Speed42 tok/sCatalog Latency0.5 sLLMBoard score12.6Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelMELlama 3.1 8B InstructMetaProviderLambdaOutput Speed42 tok/sCatalog Latency0.5 sLLMBoard scoreN/AOfficial input / 1MN/AMax Input131.1KUpdatedAug 17, 2026
ModelMELlama 3.2 90B InstructMetaProviderHyperbolicOutput Speed42 tok/sCatalog Latency0.5 sLLMBoard score9.9Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelMELlama 3.3 70B InstructMetaProviderLambdaOutput Speed42 tok/sCatalog Latency0.65 sLLMBoard score21.4Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelMELlama 3.3 70B InstructMetaProviderHyperbolicOutput Speed42 tok/sCatalog Latency0.65 sLLMBoard score21.4Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelMAMistral Large 2Mistral AIProviderGoogleOutput Speed42 tok/sCatalog Latency0.4 sLLMBoard score6.4Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelMAMistral NeMo InstructMistral AIProviderGoogleOutput Speed42 tok/sCatalog Latency0.4 sLLMBoard scoreN/AOfficial input / 1M$0.15Max Input128KUpdatedAug 17, 2026
ModelACQwen2.5-Coder 32B InstructAlibaba Cloud / Qwen TeamProviderLambdaOutput Speed42 tok/sCatalog Latency0.5 sLLMBoard score4.9Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelMIMiniMax M2.7MiniMaxProviderFireworksOutput Speed41.825 tok/sCatalog Latency0.903 sLLMBoard score59.1Official input / 1M$0.30Max Input196.6KUpdatedAug 17, 2026
ModelMELlama 3.1 405B InstructMetaProviderHyperbolicOutput Speed40 tok/sCatalog Latency0.5 sLLMBoard score23.9Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelACQwen3 235B A22BAlibaba Cloud / Qwen TeamProviderNovitaOutput Speed38.51 tok/sCatalog Latency1.02 sLLMBoard score41.9Official input / 1M$0.70Max Input128KUpdatedAug 17, 2026
ModelDEDeepSeek-R1-0528DeepSeekProviderNovitaOutput Speed37.96 tok/sCatalog Latency1.18 sLLMBoard score43.5Official input / 1MN/AMax Input131.1KUpdatedAug 17, 2026
ModelDEDeepSeek R1 Distill Llama 70BDeepSeekProviderDeepInfraOutput Speed37 tok/sCatalog Latency0.65 sLLMBoard score11.6Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelDEDeepSeek R1 Distill Qwen 32BDeepSeekProviderDeepInfraOutput Speed37 tok/sCatalog Latency0.65 sLLMBoard score14.8Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelMELlama 3.3 70B InstructMetaProviderDeepInfraOutput Speed37 tok/sCatalog Latency0.65 sLLMBoard score21.4Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelMELlama 3.1 405B InstructMetaProviderTogetherOutput Speed35 tok/sCatalog Latency0.5 sLLMBoard score23.9Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelOPGPT-5.6 TerraOpenAIProviderOpenAIOutput Speed34.885 tok/sCatalog Latency6.852 sLLMBoard score87.7Official input / 1M$2Max Input1.1MUpdatedAug 17, 2026
ModelDEDeepSeek-V4-Pro-0813DeepSeekProviderDeepSeekOutput Speed33.196 tok/sCatalog Latency3.185 sLLMBoard score90.0Official input / 1M$0.435Max Input1MUpdatedAug 17, 2026
ModelGOGemma 3 12BGoogleProviderDeepInfraOutput Speed33 tok/sCatalog Latency0.2 sLLMBoard score10.4Official input / 1MN/AMax Input131.1KUpdatedAug 17, 2026
ModelGOGemma 3 27BGoogleProviderDeepInfraOutput Speed33 tok/sCatalog Latency0.2 sLLMBoard score15.0Official input / 1MN/AMax Input131.1KUpdatedAug 17, 2026
ModelGOGemma 3 27BGoogleProviderNovitaOutput Speed33 tok/sCatalog Latency0.2 sLLMBoard score15.0Official input / 1MN/AMax Input131.1KUpdatedAug 17, 2026
ModelGOGemma 3 4BGoogleProviderDeepInfraOutput Speed33 tok/sCatalog Latency0.2 sLLMBoard scoreN/AOfficial input / 1MN/AMax Input131.1KUpdatedAug 17, 2026
ModelMIPhi 4MicrosoftProviderDeepInfraOutput Speed33 tok/sCatalog Latency0.2 sLLMBoard score8.6Official input / 1M$0.125Max Input16KUpdatedAug 17, 2026
ModelACQwen3 32BAlibaba Cloud / Qwen TeamProviderNovitaOutput Speed32.43 tok/sCatalog Latency0.93 sLLMBoard score30.8Official input / 1M$0.70Max Input128KUpdatedAug 17, 2026
ModelMELlama 3.1 70B InstructMetaProviderFireworksOutput Speed32 tok/sCatalog Latency0.5 sLLMBoard score12.6Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelACQwQ-32B-PreviewAlibaba Cloud / Qwen TeamProviderHyperbolicOutput Speed31.9 tok/sCatalog Latency1.05 sLLMBoard score24.2Official input / 1M$0.287Max Input32.8KUpdatedAug 17, 2026
ModelDEDeepSeek-V3.2-SpecialeDeepSeekProviderDeepSeekOutput Speed30 tok/sCatalog Latency1 sLLMBoard score57.5Official input / 1M$0.14Max Input131.1KUpdatedAug 17, 2026
ModelZAGLM-5Zhipu AIProviderZAIOutput Speed30 tok/sCatalog Latency3 sLLMBoard score67.1Official input / 1M$1Max Input200KUpdatedAug 17, 2026
ModelMELlama 3.1 405B InstructMetaProviderDeepInfraOutput Speed27 tok/sCatalog Latency0.5 sLLMBoard score23.9Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelACQwen3 32BAlibaba Cloud / Qwen TeamProviderDeepInfraOutput Speed26.95 tok/sCatalog Latency1.19 sLLMBoard score30.8Official input / 1M$0.70Max Input128KUpdatedAug 17, 2026
ModelOPGPT-5.6 SolOpenAIProviderOpenAIOutput Speed26.723 tok/sCatalog Latency9.743 sLLMBoard score95.3Official input / 1M$5Max Input1.1MUpdatedAug 17, 2026
ModelMAKimi K3Moonshot AIProviderFireworksOutput Speed25.734 tok/sCatalog Latency4.248 sLLMBoard score92.0Official input / 1M$3Max Input1MUpdatedAug 17, 2026
ModelOPGPT-5.2 ProOpenAIProviderOpenAIOutput Speed25 tok/sCatalog Latency30 sLLMBoard score72.1Official input / 1M$21Max Input400KUpdatedAug 17, 2026
ModelMELlama 3.1 70B InstructMetaProviderDeepInfraOutput Speed25 tok/sCatalog Latency0.5 sLLMBoard score12.6Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelOPo3-proOpenAIProviderOpenAIOutput Speed25 tok/sCatalog Latency30 sLLMBoard scoreN/AOfficial input / 1M$20Max Input200KUpdatedAug 17, 2026
ModelMIPhi-4-multimodal-instructMicrosoftProviderDeepInfraOutput Speed25 tok/sCatalog Latency0.5 sLLMBoard score6.0Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelXIMiMo-V2.5XiaomiProviderDeepInfraOutput Speed24.571 tok/sCatalog Latency3.783 sLLMBoard score61.6Official input / 1M$0.14Max Input262.1KUpdatedAug 17, 2026
ModelMELlama 3.2 90B InstructMetaProviderDeepInfraOutput Speed24 tok/sCatalog Latency0.5 sLLMBoard score9.9Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelACQwen3 235B A22BAlibaba Cloud / Qwen TeamProviderTogetherOutput Speed23.74 tok/sCatalog Latency0.79 sLLMBoard score41.9Official input / 1M$0.70Max Input128KUpdatedAug 17, 2026
ModelMAKimi K3Moonshot AIProviderTogetherOutput Speed23.56 tok/sCatalog Latency13.029 sLLMBoard score92.0Official input / 1M$3Max Input1MUpdatedAug 17, 2026
ModelMIPhi-3.5-mini-instructMicrosoftProviderAzureOutput Speed23 tok/sCatalog Latency0.52 sLLMBoard scoreN/AOfficial input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelGOGemini 3.1 ProGoogleProviderGoogleOutput Speed22.824 tok/sCatalog Latency11.149 sLLMBoard score77.5Official input / 1M$2Max Input1MUpdatedAug 17, 2026
ModelMEMuse Spark 1.2MetaProviderMeta Model APIOutput Speed22.636 tok/sCatalog Latency2.993 sLLMBoard score81.6Official input / 1M$1.25Max Input1MUpdatedAug 17, 2026
ModelDEDeepSeek VL2DeepSeekProviderReplicateOutput Speed22 tok/sCatalog Latency0.5 sLLMBoard scoreN/AOfficial input / 1MN/AMax Input129.3KUpdatedAug 17, 2026
ModelMELlama 3.1 405B InstructMetaProviderReplicateOutput Speed22 tok/sCatalog Latency0.5 sLLMBoard score23.9Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelXAGrok-4 Fast ReasoningxAIProviderxAIOutput Speed21.769 tok/sCatalog Latency1.483 sLLMBoard scoreN/AOfficial input / 1MN/AMax Input2MUpdatedAug 17, 2026
ModelACQwen3 235B A22BAlibaba Cloud / Qwen TeamProviderDeepInfraOutput Speed21.74 tok/sCatalog Latency1.23 sLLMBoard score41.9Official input / 1M$0.70Max Input128KUpdatedAug 17, 2026
ModelDEDeepSeek-V4-Flash-0731DeepSeekProviderNovitaOutput Speed19.447 tok/sCatalog Latency4.368 sLLMBoard score77.4Official input / 1M$0.14Max Input1MUpdatedAug 17, 2026
ModelANClaude Opus 4.6AnthropicProviderAnthropicOutput Speed17.479 tok/sCatalog Latency3.855 sLLMBoard score79.4Official input / 1M$5Max Input1MUpdatedAug 17, 2026
ModelOPo1OpenAIProviderAzureOutput Speed16 tok/sCatalog Latency0.54 sLLMBoard score35.9Official input / 1M$15Max Input200KUpdatedAug 17, 2026
ModelOPo1-previewOpenAIProviderAzureOutput Speed16 tok/sCatalog Latency0.54 sLLMBoard score35.9Official input / 1M$15Max Input128KUpdatedAug 17, 2026
ModelACQwen3.6 PlusAlibaba Cloud / Qwen TeamProviderTogetherOutput Speed15.66 tok/sCatalog Latency3.221 sLLMBoard score67.0Official input / 1M$0.50Max Input1MUpdatedAug 17, 2026
ModelANClaude Sonnet 4.6AnthropicProviderAnthropicOutput Speed14.831 tok/sCatalog Latency0.4 sLLMBoard score72.6Official input / 1M$3Max Input200KUpdatedAug 17, 2026
ModelGOGemini 3.7 FlashGoogleProviderGoogleOutput Speed12.652 tok/sCatalog Latency8.955 sLLMBoard score85.0Official input / 1M$0.75Max Input1MUpdatedAug 17, 2026
ModelANClaude Sonnet 5AnthropicProviderAnthropicOutput Speed10.589 tok/sCatalog Latency4.967 sLLMBoard score83.2Official input / 1M$2Max Input1MUpdatedAug 17, 2026
ModelACQwen2.5 72B InstructAlibaba Cloud / Qwen TeamProviderDeepInfraOutput Speed10 tok/sCatalog Latency0.5 sLLMBoard score20.7Official input / 1M$1.4Max Input131.1KUpdatedAug 17, 2026
ModelOPGPT-5.4OpenAIProviderOpenAIOutput Speed9.147 tok/sCatalog Latency1.87 sLLMBoard score76.6Official input / 1M$2.5Max Input1MUpdatedAug 17, 2026
ModelANClaude Fable 5AnthropicProviderAnthropicOutput Speed9.081 tok/sCatalog Latency28.237 sLLMBoard score95.2Official input / 1M$10Max Input1MUpdatedAug 17, 2026
ModelDEDeepSeek-R1DeepSeekProviderDeepSeekOutput Speed9 tok/sCatalog Latency0.3 sLLMBoard score43.5Official input / 1MN/AMax Input131.1KUpdatedAug 17, 2026
ModelDEDeepSeek-R1-0528DeepSeekProviderDeepSeekOutput Speed9 tok/sCatalog Latency0.3 sLLMBoard score43.5Official input / 1MN/AMax Input131.1KUpdatedAug 17, 2026
ModelGOGemma 4 31BGoogleProviderFriendliAIOutput Speed8.296 tok/sCatalog Latency2.909 sLLMBoard score59.7Official input / 1MN/AMax Input262.1KUpdatedAug 17, 2026
ModelDEDeepSeek-V3.2 (Non-thinking)DeepSeekProviderDeepSeekOutput Speed7.85 tok/sCatalog Latency1.996 sLLMBoard score57.5Official input / 1M$0.14Max Input131.1KUpdatedAug 17, 2026
ModelACQwen3.5-27BAlibaba Cloud / Qwen TeamProviderNovitaOutput Speed6.736 tok/sCatalog Latency15.588 sLLMBoard score56.8Official input / 1M$0.30Max Input262.1KUpdatedAug 17, 2026
ModelMEMuse Spark 1.1MetaProviderMeta Model APIOutput Speed6.152 tok/sCatalog Latency4.643 sLLMBoard score88.4Official input / 1M$1.25Max Input1MUpdatedAug 17, 2026
ModelACQwen3.6-27BAlibaba Cloud / Qwen TeamProviderNovitaOutput Speed6.118 tok/sCatalog Latency7.065 sLLMBoard score59.9Official input / 1M$0.60Max Input262.1KUpdatedAug 17, 2026
ModelDEDeepSeek-V4-Flash-0731DeepSeekProviderDeepInfraOutput Speed5.85 tok/sCatalog Latency17.843 sLLMBoard score77.4Official input / 1M$0.14Max Input1MUpdatedAug 17, 2026
ModelACQwen3.7 MaxAlibaba Cloud / Qwen TeamProviderTogetherOutput Speed5.805 tok/sCatalog Latency4.161 sLLMBoard score78.3Official input / 1M$2.5Max Input1MUpdatedAug 17, 2026
ModelGOGemini 2.5 Flash-LiteGoogleProviderGoogleOutput Speed5.69 tok/sCatalog Latency0.44 sLLMBoard score18.3Official input / 1M$0.10Max Input1MUpdatedAug 17, 2026
ModelBYSeed 2.0 ProByteDanceProviderDeepInfraOutput Speed5.594 tok/sCatalog Latency4.022 sLLMBoard score69.0Official input / 1MN/AMax Input256KUpdatedAug 17, 2026
ModelXAGrok 4.6xAIProviderxAIOutput Speed4.688 tok/sCatalog Latency7.024 sLLMBoard score78.7Official input / 1M$2Max Input500KUpdatedAug 17, 2026
ModelMAMistral Small 4Mistral AIProviderMistral AIOutput Speed4.301 tok/sCatalog Latency0.441 sLLMBoard score32.6Official input / 1M$0.15Max Input256KUpdatedAug 17, 2026
ModelXAGrok 4.5xAIProviderxAIOutput Speed4.268 tok/sCatalog Latency1.989 sLLMBoard score80.3Official input / 1M$2Max Input500KUpdatedAug 17, 2026
ModelMAKimi K3Moonshot AIProviderMoonshot AIOutput Speed4.128 tok/sCatalog Latency6.861 sLLMBoard score92.0Official input / 1M$3Max Input1MUpdatedAug 17, 2026
ModelDEDeepSeek-R1DeepSeekProviderTogetherOutput Speed4 tok/sCatalog Latency0.6 sLLMBoard score43.5Official input / 1MN/AMax Input131.1KUpdatedAug 17, 2026
ModelANClaude Opus 5AnthropicProviderAnthropicOutput Speed3.319 tok/sCatalog Latency5.51 sLLMBoard score96.5Official input / 1M$5Max Input1MUpdatedAug 17, 2026
ModelOPGPT-5.3 CodexOpenAIProviderOpenAIOutput Speed2.395 tok/sCatalog Latency7.363 sLLMBoard score62.9Official input / 1M$1.75Max Input400KUpdatedAug 17, 2026
ModelDEDeepSeek-R1DeepSeekProviderFireworksOutput Speed2.1 tok/sCatalog Latency0.3 sLLMBoard score43.5Official input / 1MN/AMax Input131.1KUpdatedAug 17, 2026
ModelGOGemini 3.5 FlashGoogleProviderGoogleOutput Speed1.218 tok/sCatalog Latency1.68 sLLMBoard score78.4Official input / 1M$1.5Max Input1MUpdatedAug 17, 2026
ModelMAMistral Medium 3.5Mistral AIProviderMistral AIOutput Speed0.961 tok/sCatalog Latency10.401 sLLMBoard score48.7Official input / 1M$1.5Max Input256KUpdatedAug 17, 2026
ModelDEDeepSeek-R1DeepSeekProviderDeepInfraOutput Speed0.9 tok/sCatalog Latency0.3 sLLMBoard score43.5Official input / 1MN/AMax Input131.1KUpdatedAug 17, 2026
ModelDEDeepSeek-V4-Flash-0731DeepSeekProviderFireworksOutput Speed0.879 tok/sCatalog Latency8.101 sLLMBoard score77.4Official input / 1M$0.14Max Input1MUpdatedAug 17, 2026
ModelMAMistral Large 3 (675B Instruct 2512)Mistral AIProviderMistral AIOutput Speed0.778 tok/sCatalog Latency2.523 sLLMBoard score15.3Official input / 1M$0.50Max Input262.1KUpdatedAug 17, 2026
ModelMAKimi K3Moonshot AIProviderNovitaOutput Speed0.196 tok/sCatalog Latency9.84 sLLMBoard score92.0Official input / 1M$3Max Input1MUpdatedAug 17, 2026
ModelMAMinistral 8B InstructMistral AIProviderMistral AIOutput Speed0.1 tok/sCatalog Latency0.18 sLLMBoard scoreN/AOfficial input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelMAMistral Large 2Mistral AIProviderMistral AIOutput Speed0.1 tok/sCatalog Latency0.5 sLLMBoard score6.4Official input / 1MN/AMax Input128KUpdatedAug 17, 2026
ModelMAMistral NeMo InstructMistral AIProviderMistral AIOutput Speed0.1 tok/sCatalog Latency0.5 sLLMBoard scoreN/AOfficial input / 1M$0.15Max Input128KUpdatedAug 17, 2026
ModelMAMistral SmallMistral AIProviderMistral AIOutput Speed0.1 tok/sCatalog Latency0.5 sLLMBoard scoreN/AOfficial input / 1MN/AMax Input32.8KUpdatedAug 17, 2026
ModelMAPixtral-12BMistral AIProviderMistral AIOutput Speed0.1 tok/sCatalog Latency0.5 sLLMBoard scoreN/AOfficial input / 1M$0.15Max Input128KUpdatedAug 17, 2026
ModelMAPixtral LargeMistral AIProviderMistral AIOutput Speed0.1 tok/sCatalog Latency0.5 sLLMBoard score20.6Official input / 1MN/AMax Input128KUpdatedAug 17, 2026

Lowest catalog latency in the current records: Min istral 3 (3B Reasoning 2512) via Mistral AI at 0.16s.

Output speed vs. catalog latency

Each point is one canonical model version offered by one provider in the runtime leaderboard. Upper-left is generally preferable: higher token generation speed with lower catalog latency.

0.1 tok/s0.5 tok/s2.0 tok/s10 tok/s20 tok/s100 tok/s500 tok/s2,000 tok/s0.20s0.50s1.00s2.00s5.00s10.0s20.0sFFFFFFFFFFFFFFFFFFOutput speedCatalog latency
Each mark is one model-provider record301 records

Provider runtime: observed over 7 days

This provider ranking uses observed character throughput and time to first token. Character throughput is not converted into model token throughput or benchmark capability.

20 rows
Columns

Show columns

Sort by
Provider
P50 TTFT
P95 TTFT
P50 Throughput
P5 Throughput
7d Calls
Success Rate
Error Rate
Updated
ProviderStepFunP50 TTFT970 msP95 TTFT1,084.3 msP50 Throughput812.731 char/sP5 Throughput711.842 char/s7d Calls2Success Rate100.0%Error Rate0.0%UpdatedAug 17, 2026
ProviderMeta Model APIP50 TTFT1,011 msP95 TTFT4,579 msP50 Throughput49.463 char/sP5 Throughput6.307 char/s7d Calls341Success Rate100.0%Error Rate0.0%UpdatedAug 17, 2026
ProviderxAIP50 TTFT1,460.5 msP95 TTFT6,371.5 msP50 Throughput38.327 char/sP5 Throughput4.929 char/s7d Calls439Success Rate95.0%Error Rate5.0%UpdatedAug 17, 2026
ProviderMiniMaxP50 TTFT1,579 msP95 TTFT1,773.4 msP50 Throughput102.475 char/sP5 Throughput54.491 char/s7d Calls4Success Rate100.0%Error Rate0.0%UpdatedAug 17, 2026
ProviderDeepSeekP50 TTFT1,855 msP95 TTFT3,184.75 msP50 Throughput207.459 char/sP5 Throughput32.999 char/s7d Calls1,945Success Rate96.8%Error Rate3.2%UpdatedAug 17, 2026
ProviderGoogleP50 TTFT1,871 msP95 TTFT9,237.4 msP50 Throughput293.394 char/sP5 Throughput12.697 char/s7d Calls471Success Rate92.4%Error Rate7.6%UpdatedAug 17, 2026
ProviderFireworksP50 TTFT1,992 msP95 TTFT7,786.5 msP50 Throughput104.102 char/sP5 Throughput0.901 char/s7d Calls764Success Rate80.9%Error Rate19.1%UpdatedAug 17, 2026
ProviderNovitaP50 TTFT2,062 msP95 TTFT4,682 msP50 Throughput140.871 char/sP5 Throughput16.646 char/s7d Calls5,048Success Rate99.7%Error Rate0.3%UpdatedAug 17, 2026
ProviderDeepInfraP50 TTFT2,104 msP95 TTFT17,235.6 msP50 Throughput74.304 char/sP5 Throughput4.471 char/s7d Calls695Success Rate100.0%Error Rate0.0%UpdatedAug 17, 2026
ProviderOpenAIP50 TTFT2,638.5 msP95 TTFT8,351.9 msP50 Throughput96.988 char/sP5 Throughput15.341 char/s7d Calls3,653Success Rate97.9%Error Rate2.1%UpdatedAug 17, 2026
ProviderAnthropicP50 TTFT2,650 msP95 TTFT7,485.1 msP50 Throughput53.679 char/sP5 Throughput3.941 char/s7d Calls418Success Rate94.7%Error Rate5.3%UpdatedAug 17, 2026
ProviderFriendliAIP50 TTFT2,909 msP95 TTFT2,909 msP50 Throughput25.184 char/sP5 Throughput8.296 char/s7d Calls13Success Rate30.8%Error Rate69.2%UpdatedAug 17, 2026
ProviderTogetherP50 TTFT2,963 msP95 TTFT4,208.6 msP50 Throughput87.578 char/sP5 Throughput3.285 char/s7d Calls105Success Rate98.1%Error Rate1.9%UpdatedAug 17, 2026
ProviderMistral AIP50 TTFT3,496 msP95 TTFT10,062.75 msP50 Throughput7.541 char/sP5 Throughput0.791 char/s7d Calls16Success Rate100.0%Error Rate0.0%UpdatedAug 17, 2026
ProviderMoonshot AIP50 TTFT5,639 msP95 TTFT6,861 msP50 Throughput32.125 char/sP5 Throughput4.128 char/s7d Calls28Success Rate100.0%Error Rate0.0%UpdatedAug 17, 2026
ProviderAzureP50 TTFTN/AP95 TTFTN/AP50 ThroughputN/AP5 ThroughputN/A7d Calls0Success RateN/AError RateN/AUpdatedAug 17, 2026
ProviderZAIP50 TTFTN/AP95 TTFTN/AP50 ThroughputN/AP5 ThroughputN/A7d Calls0Success RateN/AError RateN/AUpdatedAug 17, 2026
ProviderSambanovaP50 TTFTN/AP95 TTFTN/AP50 ThroughputN/AP5 ThroughputN/A7d Calls0Success RateN/AError RateN/AUpdatedAug 17, 2026
ProviderMeituanP50 TTFTN/AP95 TTFTN/AP50 ThroughputN/AP5 ThroughputN/A7d Calls0Success RateN/AError RateN/AUpdatedAug 17, 2026
ProviderInceptionP50 TTFTN/AP95 TTFTN/AP50 ThroughputN/AP5 ThroughputN/A7d Calls0Success RateN/AError RateN/AUpdatedAug 17, 2026
10 char/s20 char/s50 char/s100 char/s200 char/s500 char/s1,000ms2,000ms5,000ms7PMedian observed throughputMedian TTFT
Each mark is one provider aggregate15 records

The Top AI Models for Speed and Latency

The five fastest records in the current runtime leaderboard, with catalog latency, official token price and independent benchmark context shown where available.

Ranking basisThis speed and latency AI model leaderboard uses descending provider catalog output speed in generated tokens per second. The leaderboard ranking keeps matched price and speed data separate from benchmark evidence.

  1. 01
    ME
    Llama 3.3 70B InstructMeta
    Output speed
    2,220 tok/s
    Speed
    2,220 tok/s via Cerebras

    Strengths

    • Ranks #1 by output tokens per second
    • 0.65s catalog latency in the same provider record
    • 128K maximum input tokens

    Considerations

    • This speed is provider-specific and does not measure model capability
    • Catalog latency is not the same as observed 7-day TTFT
  2. 02
    ME
    Llama 3.1 8B InstructMeta
    Output speed
    2,047 tok/s
    Speed
    2,047 tok/s via Cerebras

    Strengths

    • Ranks #2 by output tokens per second
    • 0.20s catalog latency in the same provider record
    • 131K maximum input tokens

    Considerations

    • This speed is provider-specific and does not measure model capability
    • Catalog latency is not the same as observed 7-day TTFT
  3. 03
    MA
    Min istral 3 (3B Reasoning 2512)Mistral AI
    Output speed
    1,222 tok/s
    Price
    $0.04 input / $0.04 output per 1M tokens
    Speed
    1,222 tok/s via Mistral AI

    Strengths

    • Ranks #3 by output tokens per second
    • 0.16s catalog latency in the same provider record
    • 131K maximum input tokens

    Considerations

    • This speed is provider-specific and does not measure model capability
    • Catalog latency is not the same as observed 7-day TTFT
  4. 04
    ME
    Llama 3.1 70B InstructMeta
    Output speed
    1,204 tok/s
    Speed
    1,204 tok/s via Cerebras

    Strengths

    • Ranks #4 by output tokens per second
    • 0.20s catalog latency in the same provider record
    • 128K maximum input tokens

    Considerations

    • This speed is provider-specific and does not measure model capability
    • Catalog latency is not the same as observed 7-day TTFT
  5. 05
    ME
    Llama 3.3 70B InstructMeta
    Output speed
    1,096 tok/s
    Speed
    1,096 tok/s via Sambanova

    Strengths

    • Ranks #5 by output tokens per second
    • 0.65s catalog latency in the same provider record
    • 128K maximum input tokens

    Considerations

    • This speed is provider-specific and does not measure model capability
    • Catalog latency is not the same as observed 7-day TTFT

Selection summary

Best AI Models for Speed and Latency

Llama 3.3 70B Instruct has the fastest current catalog record at 2,220 tok/s. The best AI model for runtime-sensitive work also depends on latency, provider reliability, price and workload-specific quality.

Use this leaderboard with the supporting benchmark results and coverage details above. A leaderboard position summarizes the selected ranking signal; it does not replace workload-specific testing.

Speed rank #1Llama 3.3 70B Instruct2,220 tok/s via CerebrasSpeed rank #2Llama 3.1 8B Instruct2,047 tok/s via CerebrasSpeed rank #3Min istral 3 (3B Reasoning 2512)1,222 tok/s via Mistral AI ยท $0.04 input / $0.04 output per 1M tokens

How to read the runtime leaderboard

Runtime leaderboard metrics answer deployment questions and should not be read as model capability scores or a quality benchmark ranking.

Output SpeedGenerated output tokens received per second. Higher is faster.
Catalog LatencyProvider catalog latency in seconds. Lower is faster; it is not the 7-day TTFT measure.
TTFTTime to first token from observed provider calls. P50 is typical; P95 shows slower-tail behavior.
Observed ThroughputCharacters per second across a 7-day provider window. It remains separate from output tokens per second.
ReliabilityCalls, success rate, and error rate describe the observed provider window, not model capability.
Independent SignalRuntime does not change the LLMBoard capability leaderboard, ranking bands, or benchmark evidence coverage.

Runtime source: LLM Stats / ZeroEval snapshot. Speed follows the public output-tokens-per-second convention. Read the source definition.