A 23-task suite pulled from BIG-Bench specifically because prior language models failed to beat average human raters on them.
unassessed
| Category | reasoning |
|---|---|
| Subcategory | multi-step reasoning suite |
| Page status | active |
| Metric | accuracy (exact match), averaged across the 23 tasks |
| Direction | higher_is_better |
| Unit | % |
| Dataset size | 6511 |
| Dataset licence | MIT |
| Publisher | Google Research |
BIG-Bench Hard bundles 23 tasks selected from the much larger BIG-Bench collection, chosen because, at the time of selection, no language model in the original BIG-Bench evaluation had outperformed the average human rater on them. The tasks span logical deduction, causal judgement, object tracking and counting, date and arithmetic reasoning, and several language-understanding puzzles such as disambiguation and sarcasm detection (snarks), so the suite is best read as a stress test of multi-step reasoning under diverse, individually simple-looking task formats rather than a single coherent skill.
A mix of multiple-choice and short free-response prompts, varying by task; most are answered directly or via chain-of-thought prompting before a final answer.
| Model | Provider | Score | Card as of |
|---|---|---|---|
| DeepSeek R1 | DeepSeek | 68.7 | 2026-04 |
| DeepSeek R1 0528 | DeepSeek | 68.7 | 2026-04 |
| DeepSeek R1 0528 NVFP4 v2 | NVIDIA | 68.7 | 2026-04 |
| DeepSeek Reasoner | DeepSeek | 68.7 | 2026-04 |
| Qwen2.5 72B Instruct | Alibaba / Qwen Team | 66.3 | 2026-04 |
| Qwen2.5 Coder 32B Instruct | Alibaba / Qwen Team | 66.3 | 2026-04 |
| Meta Llama 3 70B Instruct | Meta | 65.5 | 2026-04 |
| Meta Llama 3 70B Instruct | Nous Research | 65.5 | 2026-04 |
| Meta Llama 3 70B | Meta | 64.6 | 2024-07 |
| DeepSeek Chat | DeepSeek | 64.1 | 2026-04 |
| DeepSeek V2 | DeepSeek | 64.1 | 2026-04 |
| DeepSeek V2 Lite | DeepSeek | 64.1 | 2026-04 |
| DeepSeek V2 Lite Chat | DeepSeek | 64.1 | 2026-04 |
| DeepSeek V3 | DeepSeek | 64.1 | 2026-04 |
| DeepSeek V3 0324 | DeepSeek | 64.1 | 2026-04 |
| DeepSeek V3.1 | DeepSeek | 64.1 | 2026-04 |
| DeepSeek V3.2 | DeepSeek | 64.1 | 2026-04 |
| DeepSeek V3.2 Exp | DeepSeek | 64.1 | 2026-04 |
| Qwen2.5 Coder 32B Instruct AWQ | Alibaba / Qwen Team | 64.0 | 2026-04 |
| Qwen3 32B | Alibaba / Qwen Team | 62.8 | 2026-04 |
| Qwen3 32B AWQ | Alibaba / Qwen Team | 62.8 | 2026-04 |
| Qwen3 32B NVFP4 | NVIDIA | 62.8 | 2026-04 |
| Gemma 4 31B | Google DeepMind | 62.3 | 2026-04 |
| gemma 4 31B it | Google DeepMind | 62.3 | 2026-04 |
| gemma 4 31B it GGUF | Unsloth | 62.3 | 2026-04 |
| Gemma 4 31B IT NVFP4 | NVIDIA | 62.3 | 2026-04 |
| Qwen2.5 Coder 14B Instruct | Alibaba / Qwen Team | 61.4 | 2026-04 |
| Yi 1.5 34B Chat 16K | 01.AI | 61.0 | 2024-07 |
| Yi 1.5 34B 32K | 01.AI | 60.2 | 2024-07 |
| Gemma 4 26B | Google DeepMind | 60.1 | 2026-04 |
| Mistral Large (latest) | Mistral AI | 58.9 | 2026-04 |
| Mistral Large 2.1 | Mistral AI | 58.9 | 2026-04 |
| Mistral Large 3 | Mistral AI | 58.9 | 2026-04 |
| Qwen2.5 32B Instruct | Alibaba / Qwen Team | 58.4 | 2026-04 |
| Qwen2.5 32B Instruct AWQ | Alibaba / Qwen Team | 58.4 | 2026-04 |
| Llama 3.3 70B Instruct NVFP4 | NVIDIA | 58.1 | 2026-04 |
| Llama-3.3-70B-Instruct | Meta | 58.1 | 2026-04 |
| DeepSeek R1 Distill Llama 70B | DeepSeek | 57.2 | 2026-04 |
| Phi 4 mini instruct | Microsoft | 56.9 | 2026-04 |
| Falcon3 7B Instruct | TII | 56.3 | 2025-03 |
| Gemma 3 27B | Google DeepMind | 56.2 | 2026-04 |
| Llama 3.1 70B | Meta | 55.8 | 2026-04 |
| Llama 3.1 70B Instruct | Meta | 55.8 | 2026-04 |
| Phi 3 mini 128K instruct | Microsoft | 55.7 | 2024-07 |
| Yi 1.5 9B Chat | 01.AI | 55.6 | 2024-07 |
| Yi 34B Chat | 01.AI | 55.6 | 2024-07 |
| Nous Hermes 2 Mixtral 8x7B DPO | Nous Research | 55.4 | 2024-07 |
| glm 4 9B | Zhipu AI | 55.3 | 2025-03 |
| GLM 4 9B 0414 | Zhipu AI | 55.3 | 2025-03 |
| Infinity Instruct 3M 0625 Yi 1.5 9B | BAAI | 55.1 | 2025-03 |
| Qwen3 14B | Alibaba / Qwen Team | 55.1 | 2026-04 |
| Qwen3 14B AWQ | Alibaba / Qwen Team | 55.1 | 2026-04 |
| Qwen3 14B NVFP4 | NVIDIA | 55.1 | 2026-04 |
| Phi 3 mini 4K instruct | Microsoft | 55.0 | 2024-07 |
| Llama 2 70B hf | Meta | 54.7 | 2024-07 |
| Qwen2 VL 7B Instruct | Alibaba / Qwen Team | 54.6 | 2025-03 |
| Qwen2 VL 7B Instruct AWQ | Alibaba / Qwen Team | 54.6 | 2025-03 |
| Yi 34B | 01.AI | 54.6 | 2024-07 |
| Yi 34B 200K | 01.AI | 54.4 | 2024-07 |
| phi 4 | Microsoft | 54.3 | 2026-04 |
| Phi 4 multimodal instruct | Microsoft | 54.3 | 2026-04 |
| Nous Hermes 2 SOLAR 10.7B | Nous Research | 54.1 | 2024-07 |
| gemma 2 27B it | Google DeepMind | 52.4 | 2026-04 |
| Hermes 2 Theta Llama 3 8B | Nous Research | 52.1 | 2024-07 |
| granite 3.0 8B instruct | IBM | 51.9 | 2025-03 |
| Hermes 3 Llama 3.1 8B | Nous Research | 51.8 | 2025-03 |
| Hermes 3 Llama 3.1 8B GGUF | Nous Research | 51.8 | 2025-03 |
| Yi 1.5 9B Chat 16K | 01.AI | 51.5 | 2024-07 |
| Yi 1.5 9B | 01.AI | 51.4 | 2024-07 |
| Qwen2.5 14B Instruct | Alibaba / Qwen Team | 51.2 | 2026-04 |
| Qwen2.5 14B Instruct AWQ | Alibaba / Qwen Team | 51.2 | 2026-04 |
| Falcon3 7B Base | TII | 51.0 | 2025-03 |
| Infinity Instruct 7M Gen Llama3 1 8B | BAAI | 50.8 | 2025-03 |
| Hermes 2 Pro Llama 3 8B | Nous Research | 50.7 | 2024-07 |
| Qwen3 30B A3B Instruct 2507 | Alibaba / Qwen Team | 50.5 | 2026-04 |
| Qwen3 30B A3B NVFP4 | NVIDIA | 50.5 | 2026-04 |
| Qwen3 30B-A3B | Alibaba / Qwen Team | 50.5 | 2026-04 |
| DeepSeek R1 Distill Qwen 32B | DeepSeek | 50.1 | 2026-04 |
| Qwen2.5 Coder 7B Instruct | Alibaba / Qwen Team | 50.0 | 2026-04 |
| Yi 1.5 9B 32K | 01.AI | 49.6 | 2024-07 |
| Infinity Instruct 3M 0625 Llama3 8B | BAAI | 49.5 | 2025-03 |
| OpenHermes 2 Mistral 7B | Teknium | 49.5 | 2025-03 |
| Yi 9B | 01.AI | 49.4 | 2024-07 |
| Meta Llama 3 8B Instruct | Meta | 49.1 | 2024-07 |
| Meta Llama 3 8B Instruct | Nous Research | 49.1 | 2024-07 |
| phi 2 | Microsoft | 48.8 | 2024-07 |
| Gemma 3 12B | Google DeepMind | 48.7 | 2026-04 |
| OpenHermes 2.5 Mistral 7B | Teknium | 48.7 | 2025-03 |
| Qwen2.5 Coder 7B Instruct GPTQ Int4 | Alibaba / Qwen Team | 48.6 | 2026-04 |
| Mixtral 8x22B | Mistral AI | 48.5 | 2026-04 |
| Mixtral 8x22B Instruct v0.1 | Mistral AI | 48.5 | 2026-04 |
| Qwen3 8B | Alibaba / Qwen Team | 48.3 | 2026-04 |
| Qwen3 8B AWQ | Alibaba / Qwen Team | 48.3 | 2026-04 |
| Qwen3 8B Base | Alibaba / Qwen Team | 48.3 | 2026-04 |
| Yi 1.5 34B | 01.AI | 48.2 | 2026-04 |
| Yi 1.5 34B Chat | 01.AI | 48.2 | 2026-04 |
| Yi Coder 9B | 01.AI | 48.1 | 2025-03 |
| Yi Coder 9B Chat | 01.AI | 48.1 | 2025-03 |
| Yi 9B 200K | 01.AI | 47.9 | 2025-03 |
| Llama 3.1 8B | Cerebras | 47.8 | 2025-03 |
| Ministral 8B Instruct 2410 | Mistral AI | 47.6 | 2025-03 |
| Falcon3 3B Instruct | TII | 47.5 | 2025-03 |
| glm 4 9B chat | Zhipu AI | 47.4 | 2025-03 |
| Command R+ | Cohere | 47.3 | 2026-04 |
| Mistral 7B Instruct v0.3 | Mistral AI | 47.2 | 2025-03 |
| Qwen2.5 3B Instruct | Alibaba / Qwen Team | 46.9 | 2025-03 |
| Falcon3 Mamba 7B Instruct | TII | 46.8 | 2025-03 |
| Llama 3.2 3B Instruct | Meta | 46.1 | 2026-04 |
| Meta Llama 3 8B | Meta | 46.0 | 2024-07 |
| Meta Llama 3 8B | Nous Research | 46.0 | 2024-07 |
| Yi 1.5 6B Chat | 01.AI | 45.7 | 2024-07 |
| flan t5 xl | Google DeepMind | 45.4 | 2025-03 |
| Mistral 7B v0.3 | Mistral AI | 45.2 | 2024-07 |
| mistral 7B v0.3 bnb 4bit | Unsloth | 45.2 | 2024-07 |
| Yi 1.5 6B | 01.AI | 44.9 | 2024-07 |
| Mistral 7B Instruct v0.2 | Mistral AI | 44.6 | 2024-07 |
| glm 4 9B chat hf | Zhipu AI | 44.3 | 2025-03 |
| Falcon3 3B Base | TII | 44.2 | 2025-03 |
| Mistral 7B v0.1 | Mistral AI | 44.2 | 2024-07 |
| Mistral Nemo | Mistral AI | 44.2 | 2026-04 |
| Mistral Nemo Base 2407 | Mistral AI | 44.2 | 2026-04 |
| Mistral Nemo Instruct 2407 | Mistral AI | 44.2 | 2026-04 |
| granite 3.1 2B instruct | IBM | 44.1 | 2025-03 |
| gemma 2 2B it | Google DeepMind | 44.0 | 2025-03 |
| falcon 11B | TII | 43.9 | 2024-07 |
| Qwen2.5 7B | Alibaba / Qwen Team | 43.8 | 2026-04 |
| Qwen2.5 7B Instruct | Alibaba / Qwen Team | 43.8 | 2026-04 |
| Qwen2.5 7B Instruct AWQ | Alibaba / Qwen Team | 43.8 | 2026-04 |
| DeepSeek R1 Distill Qwen 14B | DeepSeek | 43.5 | 2026-04 |
| Hermes 3 Llama 3.2 3B | Nous Research | 43.5 | 2025-03 |
| Yi 6B | 01.AI | 43.1 | 2024-07 |
| Qwen2.5 1.5B Instruct | Alibaba / Qwen Team | 42.9 | 2025-03 |
| Yi 6B 200K | 01.AI | 42.9 | 2024-07 |
| falcon mamba 7B | TII | 42.8 | 2025-03 |
| falcon mamba 7B instruct | TII | 42.8 | 2025-03 |
| falcon mamba 7B instruct Q4 K M GGUF | TII | 42.8 | 2025-03 |
| gemma 2 9B | Google DeepMind | 42.8 | 2026-04 |
| gemma 2 9B it | Google DeepMind | 42.8 | 2026-04 |
| OpenHermes 13B | Teknium | 42.1 | 2025-03 |
| glm 4 9B chat 1M | Zhipu AI | 41.8 | 2025-03 |
| flan t5 large | Google DeepMind | 41.5 | 2025-03 |
| Llama 2 13B hf | Meta | 41.3 | 2024-07 |
| Llama 2 13B hf | Nous Research | 41.3 | 2024-07 |
| Yi 6B Chat | 01.AI | 41.3 | 2024-07 |
| Yi 6B Chat 4bits | 01.AI | 41.3 | 2025-03 |
| Qwen2.5 1.5B | Alibaba / Qwen Team | 40.8 | 2025-03 |
| Qwen2.5 1.5B Instruct AWQ | Alibaba / Qwen Team | 40.8 | 2025-03 |
| falcon 40B instruct | TII | 40.5 | 2024-07 |
| falcon 40B | TII | 40.2 | 2024-07 |
| OLMo 2 1124 7B | Allen AI | 40.2 | 2025-03 |
| DeepSeek R1 Distill Llama 8B | DeepSeek | 39.8 | 2026-04 |
| granite 3.1 8B instruct | IBM | 39.5 | 2026-04 |
| Llama 3.1 8B | Meta | 39.2 | 2026-04 |
| Llama 3.1 8B Instruct | Meta | 39.2 | 2026-04 |
| Llama 3.1 8B Instruct | Unsloth | 39.2 | 2026-04 |
| Llama 3.1 8B Instruct FP8 | NVIDIA | 39.2 | 2026-04 |
| Llama 3.1 8B Instruct NVFP4 | NVIDIA | 39.2 | 2026-04 |
| Llama 3.2 3B | Meta | 39.1 | 2026-04 |
| stablelm zephyr 3B | Stability AI | 38.7 | 2025-03 |
| Command R | Cohere | 38.5 | 2026-04 |
| Qwen2 1.5B Instruct | Alibaba / Qwen Team | 38.5 | 2024-07 |
| DeepSeek R1 Distill Qwen 7B | DeepSeek | 38.2 | 2026-04 |
| Nous Hermes llama 2 7B | Nous Research | 38.2 | 2024-07 |
| OLMoE 1B 7B 0125 | Allen AI | 38.2 | 2025-03 |
| OLMoE 1B 7B 0125 Instruct | Allen AI | 38.2 | 2025-03 |
| Phi 3.5 mini instruct | Microsoft | 38.1 | 2026-04 |
| Qwen2.5 Math 1.5B | Alibaba / Qwen Team | 37.5 | 2025-03 |
| Falcon3 1B Instruct | TII | 37.4 | 2025-03 |
| gemma 2 2B | Google DeepMind | 37.1 | 2025-03 |
| Mixtral 8x7B | Mistral AI | 36.8 | 2026-04 |
| Mixtral 8x7B Instruct v0.1 | Mistral AI | 36.8 | 2026-04 |
| Mixtral 8x7B v0.1 | Mistral AI | 36.8 | 2026-04 |
| Falcon3 10B Base | TII | 36.5 | 2026-04 |
| Falcon3 10B Instruct | TII | 36.5 | 2026-04 |
| gemma 7B it | Google DeepMind | 36.5 | 2024-07 |
| deepseek llm 7B chat | DeepSeek | 36.3 | 2024-07 |
| Jamba v0.1 | AI21 Labs | 36.0 | 2025-03 |
| Falcon3 1B Base | TII | 35.7 | 2025-03 |
| flan t5 base | Google DeepMind | 35.3 | 2025-03 |
| deepseek llm 7B base | DeepSeek | 35.0 | 2024-07 |
| Llama 2 7B hf | Meta | 35.0 | 2024-07 |
| Llama 2 7B hf | Nous Research | 35.0 | 2024-07 |
| stablelm 3B 4e1t | Stability AI | 35.0 | 2025-03 |
| Llama 3.2 1B Instruct | Meta | 34.8 | 2025-03 |
| Llama 2 7B 32K Instruct | Together AI | 34.4 | 2025-03 |
| deepseek moe 16B base | DeepSeek | 34.1 | 2025-03 |
| LLaMA 2 7B 32K | Together AI | 34.0 | 2025-03 |
| OLMoE 1B 7B 0924 | Allen AI | 33.9 | 2025-03 |
| RedPajama INCITE 7B Instruct | Together AI | 33.8 | 2025-03 |
| stablelm 2 1 6B | Stability AI | 33.8 | 2025-03 |
| gemma 2B | Google DeepMind | 33.7 | 2024-07 |
| Mistral 7B Instruct v0.1 | Mistral AI | 33.5 | 2024-07 |
| Llama 2 13B chat hf | Meta | 33.4 | 2024-07 |
| GPT NeoXT Chat Base 20B | Together AI | 33.2 | 2025-03 |
| Qwen2.5 0.5B Instruct | Alibaba / Qwen Team | 33.2 | 2025-03 |
| rwkv raven 14B | RWKV Foundation | 33.1 | 2025-03 |
| GPT JT 6B v1 | Together AI | 33.0 | 2025-03 |
| falcon 7B | TII | 32.9 | 2024-07 |
| flan t5 small | Google DeepMind | 32.8 | 2025-03 |
| granite 3.1 1B a400m instruct | IBM | 32.8 | 2025-03 |