IFEval scores whether a model's response obeys objectively checkable instructions, such as word counts or keyword frequency, using code rather than human or LLM judgment.
unassessed
| Category | instruction-following |
|---|---|
| Subcategory | objectively verifiable natural-language instruction compliance |
| Page status | active |
| Metric | instruction-following accuracy (strict and loose, at the prompt level and the instruction level) |
| Direction | higher_is_better |
| Unit | % |
| Dataset size | 500 |
| Dataset licence | CC BY 4.0 |
| Publisher | Google Research |
IFEval tests whether a model follows explicit, machine-checkable instructions layered onto a prompt, such as "write more than 400 words," "mention the keyword 'AI' at least 3 times," or "wrap your answer in double quotation marks." Each of the roughly 500 prompts combines one or more of 25 instruction types covering things like length, keyword use, formatting, punctuation and casing. Because every instruction can be checked by a program rather than a human or another model, scoring needs no subjective judgment call, unlike most instruction-following or helpfulness evaluations.
A model is given a prompt containing one or more verifiable instructions and generates a free-form response in a single turn, zero-shot, with no few-shot examples. A separate verification function checks the response against each instruction mechanically (for example, counting words or scanning for a keyword) and returns pass/fail per instruction.
| Model | Provider | Score | Card as of |
|---|---|---|---|
| GPT-5.1 | OpenAI | 92.5 | 2026-04 |
| GPT-5.1 Chat | OpenAI | 92.5 | 2026-04 |
| GPT-5.1 Codex | OpenAI | 92.5 | 2026-04 |
| GPT-5.1 Codex Max | OpenAI | 92.5 | 2026-04 |
| GPT-5.1 Codex mini | OpenAI | 92.5 | 2026-04 |
| Claude Mythos Preview | Anthropic | 92.1 | 2026-04 |
| Claude Opus 4 | Anthropic | 92.1 | 2026-04 |
| Claude Opus 4.6 | Anthropic | 92.1 | 2026-04 |
| o3-pro | OpenAI | 92 | 2026-04 |
| GPT-5 | OpenAI | 91.8 | 2026-04 |
| GPT-5 Chat (latest) | OpenAI | 91.8 | 2026-04 |
| GPT-5 Pro | OpenAI | 91.8 | 2026-04 |
| GPT-5-Codex | OpenAI | 91.8 | 2026-04 |
| GPT-5.2 | OpenAI | 91.8 | 2026-04 |
| GPT-5.2 Chat | OpenAI | 91.8 | 2026-04 |
| GPT-5.2 Codex | OpenAI | 91.8 | 2026-04 |
| GPT-5.2 Pro | OpenAI | 91.8 | 2026-04 |
| GPT-5.3 Chat (latest) | OpenAI | 91.8 | 2026-04 |
| GPT-5.3 Codex | OpenAI | 91.8 | 2026-04 |
| GPT-5.3 Codex Spark | OpenAI | 91.8 | 2026-04 |
| GPT-5.4 | OpenAI | 91.8 | 2026-04 |
| GPT-5.4 mini | OpenAI | 91.8 | 2026-04 |
| GPT-5.4 nano | OpenAI | 91.8 | 2026-04 |
| GPT-5.4 Pro | OpenAI | 91.8 | 2026-04 |
| Claude Opus 4.5 | Anthropic | 91.5 | 2026-04 |
| Claude Opus 4.5 (latest) | Anthropic | 91.5 | 2026-04 |
| Claude Opus 4.1 | Anthropic | 91.0 | 2026-04 |
| Claude Opus 4.1 (latest) | Anthropic | 91.0 | 2026-04 |
| Gemini 2.5 Pro | Google DeepMind | 91.0 | 2026-04 |
| Gemini 2.5 Pro Preview 05-06 | Google DeepMind | 91.0 | 2026-04 |
| Gemini 2.5 Pro Preview 06-05 | Google DeepMind | 91.0 | 2026-04 |
| Gemini 2.5 Pro Preview TTS | Google DeepMind | 91.0 | 2026-04 |
| o3 | OpenAI | 91.0 | 2026-04 |
| o3-deep-research | OpenAI | 91 | 2026-04 |
| Claude Sonnet 4 | Anthropic | 90.4 | 2026-04 |
| Claude Sonnet 4.6 | Anthropic | 90.4 | 2026-04 |
| Grok 4 | xAI | 90.0 | 2026-04 |
| Grok 4 Fast | xAI | 90.0 | 2026-04 |
| Grok 4 Fast (Non-Reasoning) | xAI | 90.0 | 2026-04 |
| Grok 4.1 Fast | xAI | 90.0 | 2026-04 |
| Grok 4.1 Fast (Non-Reasoning) | xAI | 90.0 | 2026-04 |
| Grok 4.20 (Non-Reasoning) | xAI | 90.0 | 2026-04 |
| Grok 4.20 (Reasoning) | xAI | 90.0 | 2026-04 |
| Grok 4.20 Multi-Agent | xAI | 90.0 | 2026-04 |
| Claude Opus 4 (latest) | Anthropic | 89.7 | 2026-04 |
| GPT-4.1 | OpenAI | 89.5 | 2026-04 |
| Claude Sonnet 4.5 | Anthropic | 89.3 | 2026-04 |
| Claude Sonnet 4.5 (latest) | Anthropic | 89.3 | 2026-04 |
| o4-mini | OpenAI | 89.0 | 2026-04 |
| o4-mini-deep-research | OpenAI | 89.0 | 2026-04 |
| o1-pro | OpenAI | 88.5 | 2026-04 |
| Qwen3 235B-A22B | Alibaba / Qwen Team | 88.5 | 2026-04 |
| DeepSeek R1 0528 | DeepSeek | 88.0 | 2026-04 |
| DeepSeek R1 0528 NVFP4 v2 | NVIDIA | 88.0 | 2026-04 |
| GPT-5 Mini | OpenAI | 88.0 | 2026-04 |
| Qwen3-Coder 480B-A35B Instruct | Alibaba / Qwen Team | 88.0 | 2026-04 |
| Gemini 2.5 Flash | Google DeepMind | 87.5 | 2026-04 |
| Gemini 2.5 Flash Image | Google DeepMind | 87.5 | 2026-04 |
| Gemini 2.5 Flash Image (Preview) | Google DeepMind | 87.5 | 2026-04 |
| Gemini 2.5 Flash Lite | Google DeepMind | 87.5 | 2026-04 |
| Gemini 2.5 Flash Lite Preview 06-17 | Google DeepMind | 87.5 | 2026-04 |
| Gemini 2.5 Flash Lite Preview 09-25 | Google DeepMind | 87.5 | 2026-04 |
| Gemini 2.5 Flash Preview 04-17 | Google DeepMind | 87.5 | 2026-04 |
| Gemini 2.5 Flash Preview 05-20 | Google DeepMind | 87.5 | 2026-04 |
| Gemini 2.5 Flash Preview 09-25 | Google DeepMind | 87.5 | 2026-04 |
| Gemini 2.5 Flash Preview TTS | Google DeepMind | 87.5 | 2026-04 |
| Claude Sonnet 4 (latest) | Anthropic | 87.2 | 2026-04 |
| Claude Sonnet 3.7 | Anthropic | 87.0 | 2026-04 |
| DeepSeek V3.2 | DeepSeek | 87.0 | 2026-04 |
| DeepSeek V3.2 Exp | DeepSeek | 87.0 | 2026-04 |
| DeepSeek R1 | DeepSeek | 86.5 | 2026-04 |
| DeepSeek Reasoner | DeepSeek | 86.5 | 2026-04 |
| o3-mini | OpenAI | 86.5 | 2026-04 |
| o1 | OpenAI | 86.0 | 2026-04 |
| o1-preview | OpenAI | 86.0 | 2026-04 |
| DeepSeek V3.1 | DeepSeek | 85.5 | 2026-04 |
| Claude Sonnet 3.5 | Anthropic | 85.4 | 2026-04 |
| Claude Sonnet 3.5 v2 | Anthropic | 85.4 | 2026-04 |
| Claude Haiku 4.5 | Anthropic | 85.0 | 2026-04 |
| Claude Haiku 4.5 (latest) | Anthropic | 85.0 | 2026-04 |
| GPT-4.1 mini | OpenAI | 85.0 | 2026-04 |
| Grok 3 | xAI | 85.0 | 2026-04 |
| Grok 3 Fast | xAI | 85.0 | 2026-04 |
| Grok 3 Fast Latest | xAI | 85.0 | 2026-04 |
| Grok 3 Latest | xAI | 85.0 | 2026-04 |
| Magistral Medium (latest) | Mistral AI | 85.0 | 2026-04 |
| GPT-4o | OpenAI | 84.3 | 2026-04 |
| GPT-4o (2024-05-13) | OpenAI | 84.3 | 2026-04 |
| GPT-4o (2024-08-06) | OpenAI | 84.3 | 2026-04 |
| GPT-4o (2024-11-20) | OpenAI | 84.3 | 2026-04 |
| DeepSeek Chat | DeepSeek | 84.0 | 2026-04 |
| DeepSeek V2 | DeepSeek | 84 | 2026-04 |
| DeepSeek V2 Lite | DeepSeek | 84 | 2026-04 |
| DeepSeek V2 Lite Chat | DeepSeek | 84 | 2026-04 |
| DeepSeek V3 | DeepSeek | 84.0 | 2026-04 |
| DeepSeek V3 0324 | DeepSeek | 84.0 | 2026-04 |
| Gemini 2.0 Flash | Google DeepMind | 84.0 | 2026-04 |
| Qwen3 32B | Alibaba / Qwen Team | 84.0 | 2026-04 |
| Qwen3 32B AWQ | Alibaba / Qwen Team | 84.0 | 2026-04 |
| Qwen3 32B NVFP4 | NVIDIA | 84.0 | 2026-04 |
| Gemma 4 31B | Google DeepMind | 83.0 | 2026-04 |
| gemma 4 31B it | Google DeepMind | 83.0 | 2026-04 |
| gemma 4 31B it GGUF | Unsloth | 83.0 | 2026-04 |
| Gemma 4 31B IT NVFP4 | NVIDIA | 83.0 | 2026-04 |
| Llama 4 Maverick 17B 128E Instruct | Meta | 83.0 | 2026-04 |
| Llama-4-Maverick-17B-128E-Instruct-FP8 | Meta | 83.0 | 2026-04 |
| GPT-5 Nano | OpenAI | 82.5 | 2026-04 |
| Gemini 1.5 Pro | Google DeepMind | 82.0 | 2026-04 |
| GPT-4 Turbo | OpenAI | 82.0 | 2026-04 |
| Mistral Large (latest) | Mistral AI | 82.0 | 2026-04 |
| Mistral Large 2.1 | Mistral AI | 82.0 | 2026-04 |
| Mistral Large 3 | Mistral AI | 82.0 | 2026-04 |
| o1-mini | OpenAI | 82.0 | 2026-04 |
| Qwen2.5 72B Instruct | Alibaba / Qwen Team | 82.0 | 2026-04 |
| Gemma 4 26B | Google DeepMind | 81.5 | 2026-04 |
| gemma 4 26B A4B it | Google DeepMind | 81.5 | 2026-04 |
| gemma 4 26B A4B it GGUF | Unsloth | 81.5 | 2026-04 |
| Claude Opus 3 | Anthropic | 81.0 | 2026-04 |
| Meta Llama 3 70B Instruct | Meta | 81.0 | 2026-04 |
| Meta Llama 3 70B Instruct | Nous Research | 81.0 | 2026-04 |
| Claude Haiku 3.5 | Anthropic | 80.5 | 2026-04 |
| Claude Haiku 3.5 (latest) | Anthropic | 80.5 | 2026-04 |
| GPT-4o mini | OpenAI | 80.5 | 2026-04 |
| Grok 3 Mini | xAI | 80.5 | 2026-04 |
| Grok 3 Mini Fast | xAI | 80.5 | 2026-04 |
| Grok 3 Mini Fast Latest | xAI | 80.5 | 2026-04 |
| Grok 3 Mini Latest | xAI | 80.5 | 2026-04 |
| Llama 3.1 405B | Meta | 80.0 | 2026-04 |
| Llama 3.1 405B FP8 | Meta | 80.0 | 2026-04 |
| Llama 3.1 405B Instruct | Meta | 80.0 | 2026-04 |
| Llama 3.1 405B Instruct FP8 | Meta | 80.0 | 2026-04 |
| Qwen3 30B A3B Instruct 2507 | Alibaba / Qwen Team | 80.0 | 2026-04 |
| Qwen3 30B A3B NVFP4 | NVIDIA | 80.0 | 2026-04 |
| Qwen3 30B-A3B | Alibaba / Qwen Team | 80.0 | 2026-04 |
| QwQ Plus | Alibaba / Qwen Team | 80 | 2026-04 |
| Gemma 3 27B | Google DeepMind | 79.0 | 2026-04 |
| Llama 4 Scout 17B 16E | Meta | 79.0 | 2026-04 |
| Llama 4 Scout 17B 16E Instruct | Meta | 79.0 | 2026-04 |
| Llama-4-Scout-17B-16E-Instruct-FP8 | Meta | 79.0 | 2026-04 |
| Gemini 2.0 Flash Lite | Google DeepMind | 78.5 | 2026-04 |
| Llama 3.3 70B Instruct NVFP4 | NVIDIA | 78.5 | 2026-04 |
| Llama-3.3-70B-Instruct | Meta | 78.5 | 2026-04 |
| Command A | Cohere | 78 | 2026-04 |
| Command A Reasoning | Cohere | 78 | 2026-04 |
| DeepSeek R1 Distill Llama 70B | DeepSeek | 78.0 | 2026-04 |
| GPT-4.1 nano | OpenAI | 78.0 | 2026-04 |
| Grok 2 | xAI | 78 | 2026-04 |
| Grok 2 (1212) | xAI | 78 | 2026-04 |
| Grok 2 Latest | xAI | 78 | 2026-04 |
| Grok 2 Vision | xAI | 78 | 2026-04 |
| Grok 2 Vision (1212) | xAI | 78 | 2026-04 |
| Grok 2 Vision Latest | xAI | 78 | 2026-04 |
| Magistral Small | Mistral AI | 78.0 | 2026-04 |
| Magistral Small 2506 | Mistral AI | 78.0 | 2026-04 |
| phi 4 | Microsoft | 78.0 | 2026-04 |
| Phi 4 multimodal instruct | Microsoft | 78 | 2026-04 |
| Qwen2.5 32B Instruct | Alibaba / Qwen Team | 78 | 2026-04 |
| Qwen2.5 32B Instruct AWQ | Alibaba / Qwen Team | 78 | 2026-04 |
| Mixtral 8x22B | Mistral AI | 77.8 | 2026-04 |
| Mixtral 8x22B Instruct v0.1 | Mistral AI | 77.8 | 2026-04 |
| Yi 1.5 34B | 01.AI | 77.3 | 2026-04 |
| Yi 1.5 34B Chat | 01.AI | 77.3 | 2026-04 |
| Gemini 1.5 Flash | Google DeepMind | 77.0 | 2026-04 |
| Gemini 1.5 Flash-8B | Google DeepMind | 77.0 | 2026-04 |
| Qwen3 14B | Alibaba / Qwen Team | 77 | 2026-04 |
| Qwen3 14B AWQ | Alibaba / Qwen Team | 77 | 2026-04 |
| Qwen3 14B NVFP4 | NVIDIA | 77 | 2026-04 |
| GPT-4 | OpenAI | 76.5 | 2026-04 |
| Falcon3 7B Instruct | TII | 76.1 | 2025-03 |
| DeepSeek R1 Distill Qwen 32B | DeepSeek | 76.0 | 2026-04 |
| Llama 3.1 70B | Meta | 76.0 | 2026-04 |
| Llama 3.1 70B Instruct | Meta | 76.0 | 2026-04 |
| Qwen2.5 Coder 32B Instruct | Alibaba / Qwen Team | 76.0 | 2026-04 |
| Qwen2.5 Coder 32B Instruct AWQ | Alibaba / Qwen Team | 76.0 | 2026-04 |
| Claude Sonnet 3 | Anthropic | 75.5 | 2026-04 |
| Mistral Nemo | Mistral AI | 75.1 | 2026-04 |
| Mistral Nemo Base 2407 | Mistral AI | 75.1 | 2026-04 |
| Mistral Nemo Instruct 2407 | Mistral AI | 75.1 | 2026-04 |
| Command R+ | Cohere | 75.0 | 2026-04 |
| gemma 2 27B it | Google DeepMind | 75.0 | 2026-04 |
| Codestral (latest) | Mistral AI | 74.0 | 2026-04 |
| Qwen2.5 14B Instruct | Alibaba / Qwen Team | 74 | 2026-04 |
| Qwen2.5 14B Instruct AWQ | Alibaba / Qwen Team | 74 | 2026-04 |
| Llama 3.2 3B Instruct | Meta | 73.9 | 2026-04 |
| Gemma 3 12B | Google DeepMind | 73.0 | 2026-04 |
| Qwen3 8B | Alibaba / Qwen Team | 73 | 2026-04 |
| Qwen3 8B AWQ | Alibaba / Qwen Team | 73 | 2026-04 |
| Qwen3 8B Base | Alibaba / Qwen Team | 73 | 2026-04 |
| OLMo 2 1124 7B | Allen AI | 72.4 | 2025-03 |
| Phi 3.5 mini instruct | Microsoft | 72.4 | 2026-04 |
| granite 3.1 8B instruct | IBM | 72.1 | 2026-04 |
| Claude Haiku 3 | Anthropic | 72.0 | 2026-04 |
| DeepSeek R1 Distill Qwen 14B | DeepSeek | 72.0 | 2026-04 |
| Phi 4 mini instruct | Microsoft | 72.0 | 2026-04 |
| Falcon3 Mamba 7B Instruct | TII | 71.7 | 2025-03 |
| Command R | Cohere | 70 | 2026-04 |
| Falcon3 3B Instruct | TII | 69.8 | 2025-03 |
| Mixtral 8x7B | Mistral AI | 69.5 | 2026-04 |
| Mixtral 8x7B Instruct v0.1 | Mistral AI | 69.5 | 2026-04 |
| Mixtral 8x7B v0.1 | Mistral AI | 69.5 | 2026-04 |