llmboard.aiLeaderboard Center
Overall
Overall RankingOpen Models
Tools
Model DirectoryCompare Models
Capabilities
CodingReasoningMathKnowledgeInstruction Following
Price & Efficiency
Price & ValueCapability vs. PriceRuntime Performance
Modalities
Image GenerationVideo GenerationSpeech ModelsEmbeddings
Core Benchmarks
GPQAMMLU-ProAIME 2025SWE-Bench VerifiedMMLUHumanity's Last ExamLiveCodeBenchMATHHumanEvalMMMU-ProView all benchmarks
Methods
Scoring & Data
393 models668 benchmarks

Leaderboard Center

Overall RankingCodingCore BenchmarksPrice & ValueRuntime Performance

Modalities

All ModelsImage GenerationImage EditingVideo GenerationImage-to-VideoVideo EditingText-to-SpeechSpeech-to-TextEmbeddings

Data & Methods

Scoring MethodAll BenchmarksReasoningMath

Vendors

All VendorsOpenAIAnthropicGoogle
llmboard.aiCopyright 2026 llmboard.ai

instruction following benchmark

IFEval

Instruction-Following Evaluation (IFEval) benchmark for large language models, focusing on verifiable instructions with 25 types of instructions and around 500 prompts containing one or more verifiable constraints

Updated Aug 11, 2026

Models65
Model coverage65
MetricScore
EvidenceB

On this page

  • Ranking
  • Distribution
  • Highlights
  • About
  • FAQ

IFEval Ranking

Higher score ranks better on this benchmark.

65 rows
Columns

Show columns

01ACQwen3.5-27BAlibaba Cloud / Qwen Team95.0%100.0%65CAug 11, 2026
02ACQwen3.7-PlusAlibaba Cloud / Qwen Team94.6%98.4%65CAug 11, 2026
03ACQwen3.6 PlusAlibaba Cloud / Qwen Team94.3%96.9%65CAug 11, 2026
04ACQwen3.7 MaxAlibaba Cloud / Qwen Team94.3%95.3%65CAug 11, 2026
05OPo3-miniOpenAI93.9%93.8%65CAug 11, 2026
06ACQwen3.5-122B-A10BAlibaba Cloud / Qwen Team93.4%92.2%65CAug 11, 2026
07ANClaude 3.7 SonnetAnthropic93.2%90.6%65CAug 11, 2026
08ACQwen3.5-397B-A17BAlibaba Cloud / Qwen Team92.6%89.1%65CAug 11, 2026
09MELlama 3.3 70B InstructMeta92.1%87.5%65CAug 11, 2026
10AMNova ProAmazon92.1%85.9%65CAug 11, 2026
11ACQwen3.5-35B-A3BAlibaba Cloud / Qwen Team91.9%84.4%65CAug 11, 2026
12ACQwen3.5-9BAlibaba Cloud / Qwen Team91.5%82.8%65CAug 11, 2026
13GOGemma 3 27BGoogle90.4%81.3%65CAug 11, 2026
14NVNemotron Nano 9B v2NVIDIA90.3%79.7%65CAug 11, 2026
15GOGemma 3 4BGoogle90.2%78.1%65CAug 11, 2026
16MAKimi K2 InstructMoonshot AI89.8%76.6%65CAug 11, 2026
17MAKimi K2-Instruct-0905Moonshot AI89.8%75.0%65CAug 11, 2026
18ACQwen3.5-4BAlibaba Cloud / Qwen Team89.8%73.4%65CAug 11, 2026
19AMNova LiteAmazon89.7%71.9%65CAug 11, 2026
20MELongCat-Flash-ChatMeituan89.6%70.3%65CAug 11, 2026
21NVLlama 3.1 Nemotron Ultra 253B v1NVIDIA89.5%68.8%65CAug 11, 2026
22GOGemma 3 12BGoogle88.9%67.2%65CAug 11, 2026
23ACQwen3-Next-80B-A3B-ThinkingAlibaba Cloud / Qwen Team88.9%65.6%65CAug 11, 2026
24ACQwen3-235B-A22B-Instruct-2507Alibaba Cloud / Qwen Team88.7%64.1%65CAug 11, 2026
25MELlama 3.1 405B InstructMeta88.6%62.5%65CAug 11, 2026
26OPGPT-4.5OpenAI88.2%60.9%65CAug 11, 2026
27ACQwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team88.2%59.4%65CAug 11, 2026
28ACQwen3-235B-A22B-Thinking-2507Alibaba Cloud / Qwen Team87.8%57.8%65CAug 11, 2026
29ACQwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team87.8%56.3%65CAug 11, 2026
30ACQwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team87.8%54.7%65CAug 11, 2026
31ACQwen3-Next-80B-A3B-InstructAlibaba Cloud / Qwen Team87.6%53.1%65CAug 11, 2026
32MELlama 3.1 70B InstructMeta87.5%51.6%65CAug 11, 2026
33OPGPT-4.1OpenAI87.4%50.0%65CAug 11, 2026
34MAKimi-k1.5Moonshot AI87.2%48.4%65CAug 11, 2026
35AMNova MicroAmazon87.2%46.9%65CAug 11, 2026
36DEDeepSeek-V3DeepSeek86.1%45.3%65CAug 11, 2026
37ACQwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team85.8%43.8%65CAug 11, 2026
38MIPhi 4 Reasoning PlusMicrosoft84.9%42.2%65CAug 11, 2026
39SASarvam-105BSarvam AI84.8%40.6%65CAug 11, 2026
40ACQwen3 VL 32B InstructAlibaba Cloud / Qwen Team84.7%39.1%65CAug 11, 2026
41OPGPT-4.1 miniOpenAI84.1%37.5%65CAug 11, 2026
42ACQwen2.5 72B InstructAlibaba Cloud / Qwen Team84.1%35.9%65CAug 11, 2026
43ACQwQ-32BAlibaba Cloud / Qwen Team83.9%34.4%65CAug 11, 2026
44ACQwen3 VL 8B InstructAlibaba Cloud / Qwen Team83.7%32.8%65CAug 11, 2026
45MIPhi 4 ReasoningMicrosoft83.4%31.3%65CAug 11, 2026
46ACQwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team83.2%29.7%65CAug 11, 2026
47MAMistral Small 3 24B InstructMistral AI82.9%28.1%65CAug 11, 2026
48ACQwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team82.6%26.6%65CAug 11, 2026
49ACQwen3 VL 4B InstructAlibaba Cloud / Qwen Team82.3%25.0%65CAug 11, 2026
50ACQwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team81.7%23.4%65CAug 11, 2026
51OPGPT-4oOpenAI81.0%21.9%65CAug 11, 2026
52MELlama 3.1 8B InstructMeta80.4%20.3%65CAug 11, 2026
53GOGemma 3 1BGoogle80.2%18.8%65CAug 11, 2026
54NVLlama 3.1 Nemotron Nano 8B V1NVIDIA79.3%17.2%65CAug 11, 2026
55ACQwen3.5-2BAlibaba Cloud / Qwen Team78.6%15.6%65CAug 11, 2026
56MELlama 3.2 3B InstructMeta77.4%14.1%65CAug 11, 2026
57OPMiniCPM-SALAOpenBMB76.3%12.5%65CAug 11, 2026
58IBGranite 3.3 8B BaseIBM74.8%10.9%65CAug 11, 2026
59IBGranite 3.3 8B InstructIBM74.8%9.4%65CAug 11, 2026
60OPGPT-4.1 nanoOpenAI74.5%7.8%65CAug 11, 2026
61ACQwen2.5 7B InstructAlibaba Cloud / Qwen Team71.2%6.3%65CAug 11, 2026
62IBIBM Granite 4.0 Tiny PreviewIBM63.0%4.7%65CAug 11, 2026
63MIPhi 4Microsoft63.0%3.1%65CAug 11, 2026
64MAPixtral-12BMistral AI61.3%1.6%65CAug 11, 2026
65ACQwen3.5-0.8BAlibaba Cloud / Qwen Team44.0%0.0%65CAug 11, 2026

IFEval Score Distribution

A closer view of the leading scores on this benchmark.

IFEval

IFEval Highlights

The leading models and scores on this benchmark.

Rank #1Qwen3.5-27B95.0%Rank #2Qwen3.7-Plus94.6%Rank #3Qwen3.6 Plus94.3%Rank #4Qwen3.7 Max94.3%

What is IFEval?

What IFEval measures and how its scores work.

Instruction-Following Evaluation (IFEval) benchmark for large language models, focusing on verifiable instructions with 25 types of instructions and around 500 prompts containing one or more verifiable constraints

Scores are shown in ratio. This benchmark is not independently verified and has an evidence level of B.

Family
IFEval
Modality
text
Primary category
instruction following
Score direction
higher
LLMBoard eligible
Yes
Evaluation key
ifeval|llm-stats-current

Benchmark scores retain their original unit. Overall score eligibility is shown separately.

FAQ

Common questions about IFEval.

Which model scores highest on IFEval?

Qwen3.5-27B is currently ranked first with 95.0%.

What does IFEval measure?

Instruction-Following Evaluation (IFEval) benchmark for large language models, focusing on verifiable instructions with 25 types of instructions and around 500 prompts containing one or more verifiable constraints

Is a higher score better?

Yes. Higher values rank better for this benchmark.

How many models are compared?

65 model results are currently shown.

Does this benchmark affect the overall score?

Yes. This benchmark can contribute to the current LLMBoard capability score.