The Perl subset of MultiPL-E: HumanEval and MBPP function-completion problems translated into Perl and scored with pass@1.
unassessed
| Category | coding |
|---|---|
| Subcategory | multilingual code generation |
| Page status | active |
| Metric | pass@1 |
| Direction | higher_is_better |
| Unit | % |
| Dataset licence | MIT |
| Publisher | Northeastern University Programming Research Lab (nuprl) |
This subset translates the HumanEval and MBPP prompts into Perl by rewriting each problem's function signature, docstring and tests with Perl syntax and typing, then asks the model to complete the function body in Perl. The underlying algorithmic problem is unchanged from the Python original; only the surface language differs.
Function completion in Perl: given a translated signature, docstring and (for HumanEval-derived items) doctests, the model generates a function body, which is compiled or interpreted with a real Perl toolchain inside a container and checked against translated unit tests.
| Model | Provider | Score | Card as of |
|---|---|---|---|
| GPT-5.1 | OpenAI | 63.5 | 2026-04 |
| GPT-5.1 Chat | OpenAI | 63.5 | 2026-04 |
| GPT-5.1 Codex | OpenAI | 63.5 | 2026-04 |
| GPT-5.1 Codex Max | OpenAI | 63.5 | 2026-04 |
| GPT-5.1 Codex mini | OpenAI | 63.5 | 2026-04 |
| GPT-5 | OpenAI | 62.8 | 2026-04 |
| GPT-5 Chat (latest) | OpenAI | 62.8 | 2026-04 |
| GPT-5 Mini | OpenAI | 62.8 | 2026-04 |
| GPT-5 Nano | OpenAI | 62.8 | 2026-04 |
| GPT-5 Pro | OpenAI | 62.8 | 2026-04 |
| GPT-5-Codex | OpenAI | 62.8 | 2026-04 |
| GPT-5.2 | OpenAI | 62.8 | 2026-04 |
| GPT-5.2 Chat | OpenAI | 62.8 | 2026-04 |
| GPT-5.2 Codex | OpenAI | 62.8 | 2026-04 |
| GPT-5.2 Pro | OpenAI | 62.8 | 2026-04 |
| GPT-5.3 Chat (latest) | OpenAI | 62.8 | 2026-04 |
| GPT-5.3 Codex | OpenAI | 62.8 | 2026-04 |
| GPT-5.3 Codex Spark | OpenAI | 62.8 | 2026-04 |
| GPT-5.4 | OpenAI | 62.8 | 2026-04 |
| GPT-5.4 mini | OpenAI | 62.8 | 2026-04 |
| GPT-5.4 nano | OpenAI | 62.8 | 2026-04 |
| GPT-5.4 Pro | OpenAI | 62.8 | 2026-04 |
| Claude Opus 4 | Anthropic | 62.5 | 2026-04 |
| Claude Opus 4.6 | Anthropic | 62.5 | 2026-04 |
| o3 | OpenAI | 62.1 | 2026-04 |
| Claude Opus 4.5 | Anthropic | 61.2 | 2026-04 |
| Claude Opus 4.5 (latest) | Anthropic | 61.2 | 2026-04 |
| Claude Sonnet 4.6 | Anthropic | 60.5 | 2026-04 |
| Claude Opus 4.1 | Anthropic | 60.2 | 2026-04 |
| Claude Opus 4.1 (latest) | Anthropic | 60.2 | 2026-04 |
| Claude Sonnet 4 | Anthropic | 58.8 | 2026-04 |
| Claude Sonnet 4.5 | Anthropic | 58.8 | 2026-04 |
| Claude Sonnet 4.5 (latest) | Anthropic | 58.8 | 2026-04 |
| Qwen3-Coder 480B-A35B Instruct | Alibaba / Qwen Team | 58.8 | 2026-04 |
| Gemini 2.5 Pro | Google DeepMind | 58.5 | 2026-04 |
| GPT-4.1 | OpenAI | 58.2 | 2026-04 |
| Claude Opus 4 (latest) | Anthropic | 57.8 | 2026-04 |
| Grok 4 | xAI | 57.5 | 2026-04 |
| Grok 4 Fast | xAI | 57.5 | 2026-04 |
| Grok 4 Fast (Non-Reasoning) | xAI | 57.5 | 2026-04 |
| Grok 4.1 Fast | xAI | 57.5 | 2026-04 |
| Grok 4.1 Fast (Non-Reasoning) | xAI | 57.5 | 2026-04 |
| Grok 4.20 (Non-Reasoning) | xAI | 57.5 | 2026-04 |
| Grok 4.20 (Reasoning) | xAI | 57.5 | 2026-04 |
| Grok 4.20 Multi-Agent | xAI | 57.5 | 2026-04 |
| o4-mini | OpenAI | 57.2 | 2026-04 |
| o4-mini-deep-research | OpenAI | 57.2 | 2026-04 |
| Claude Sonnet 4 (latest) | Anthropic | 55.5 | 2026-04 |
| GPT-4o | OpenAI | 55.2 | 2026-04 |
| GPT-4o (2024-05-13) | OpenAI | 55.2 | 2026-04 |
| GPT-4o (2024-08-06) | OpenAI | 55.2 | 2026-04 |
| GPT-4o (2024-11-20) | OpenAI | 55.2 | 2026-04 |
| Qwen3 235B-A22B | Alibaba / Qwen Team | 55.2 | 2026-04 |
| Claude Sonnet 3.7 | Anthropic | 54.5 | 2026-04 |
| o3-mini | OpenAI | 54.2 | 2026-04 |
| DeepSeek V3.2 Exp | DeepSeek | 53.8 | 2026-04 |
| DeepSeek V3.2 | DeepSeek | 52.8 | 2026-04 |
| DeepSeek R1 0528 | DeepSeek | 52.5 | 2026-04 |
| DeepSeek R1 0528 NVFP4 v2 | NVIDIA | 52.5 | 2026-04 |
| GPT-4 Turbo | OpenAI | 52.5 | 2026-04 |
| Claude Sonnet 3.5 | Anthropic | 52.2 | 2026-04 |
| Claude Sonnet 3.5 v2 | Anthropic | 52.2 | 2026-04 |
| Claude Haiku 4.5 | Anthropic | 50.5 | 2026-04 |
| Claude Haiku 4.5 (latest) | Anthropic | 50.5 | 2026-04 |
| DeepSeek R1 | DeepSeek | 50.2 | 2026-04 |
| DeepSeek Reasoner | DeepSeek | 50.2 | 2026-04 |
| DeepSeek V3.1 | DeepSeek | 49.5 | 2026-04 |
| Gemini 2.5 Flash | Google DeepMind | 49.5 | 2026-04 |
| Gemini 2.5 Flash Image | Google DeepMind | 49.5 | 2026-04 |
| Gemini 2.5 Flash Image (Preview) | Google DeepMind | 49.5 | 2026-04 |
| Gemini 2.5 Flash Lite | Google DeepMind | 49.5 | 2026-04 |
| Gemini 2.5 Flash Lite Preview 06-17 | Google DeepMind | 49.5 | 2026-04 |
| Gemini 2.5 Flash Lite Preview 09-25 | Google DeepMind | 49.5 | 2026-04 |
| Gemini 2.5 Flash Preview 04-17 | Google DeepMind | 49.5 | 2026-04 |
| Gemini 2.5 Flash Preview 05-20 | Google DeepMind | 49.5 | 2026-04 |
| Gemini 2.5 Flash Preview 09-25 | Google DeepMind | 49.5 | 2026-04 |
| Gemini 2.5 Flash Preview TTS | Google DeepMind | 49.5 | 2026-04 |
| Grok 3 | xAI | 49.2 | 2026-04 |
| Grok 3 Fast | xAI | 49.2 | 2026-04 |
| Grok 3 Fast Latest | xAI | 49.2 | 2026-04 |
| Grok 3 Latest | xAI | 49.2 | 2026-04 |
| Grok 3 Mini | xAI | 49.2 | 2026-04 |
| Grok 3 Mini Fast | xAI | 49.2 | 2026-04 |
| Grok 3 Mini Fast Latest | xAI | 49.2 | 2026-04 |
| Grok 3 Mini Latest | xAI | 49.2 | 2026-04 |
| Mistral Large (latest) | Mistral AI | 48.5 | 2026-04 |
| Mistral Large 2.1 | Mistral AI | 48.5 | 2026-04 |
| Mistral Large 3 | Mistral AI | 48.5 | 2026-04 |
| Qwen3 32B | Alibaba / Qwen Team | 48.5 | 2026-04 |
| Qwen3 32B AWQ | Alibaba / Qwen Team | 48.5 | 2026-04 |
| Qwen3 32B NVFP4 | NVIDIA | 48.5 | 2026-04 |
| DeepSeek V3 0324 | DeepSeek | 47.5 | 2026-04 |
| GPT-4 | OpenAI | 46.5 | 2026-04 |
| GPT-4.1 mini | OpenAI | 46.5 | 2026-04 |
| GPT-4.1 nano | OpenAI | 46.5 | 2026-04 |
| Claude Opus 3 | Anthropic | 46.2 | 2026-04 |
| DeepSeek Chat | DeepSeek | 45.2 | 2026-04 |
| DeepSeek V3 | DeepSeek | 45.2 | 2026-04 |
| Llama 4 Maverick 17B 128E Instruct | Meta | 44.5 | 2026-04 |
| Llama-4-Maverick-17B-128E-Instruct-FP8 | Meta | 44.5 | 2026-04 |
| GPT-4o mini | OpenAI | 44.2 | 2026-04 |
| Qwen2.5 72B Instruct | Alibaba / Qwen Team | 44.2 | 2026-04 |
| Claude Haiku 3.5 | Anthropic | 42.5 | 2026-04 |
| Claude Haiku 3.5 (latest) | Anthropic | 42.5 | 2026-04 |
| Gemma 4 31B | Google DeepMind | 42.5 | 2026-04 |
| gemma 4 31B it | Google DeepMind | 42.5 | 2026-04 |
| gemma 4 31B it GGUF | Unsloth | 42.5 | 2026-04 |
| Gemma 4 31B IT NVFP4 | NVIDIA | 42.5 | 2026-04 |
| Mistral Medium (latest) | Mistral AI | 42.5 | 2026-04 |
| Mistral Medium 3 | Mistral AI | 42.5 | 2026-04 |
| Mistral Medium 3.1 | Mistral AI | 42.5 | 2026-04 |
| Llama 4 Scout 17B 16E | Meta | 41.2 | 2026-04 |
| Llama 4 Scout 17B 16E Instruct | Meta | 41.2 | 2026-04 |
| Llama-4-Scout-17B-16E-Instruct-FP8 | Meta | 41.2 | 2026-04 |
| phi 4 | Microsoft | 40.8 | 2026-04 |
| Gemma 4 26B | Google DeepMind | 40.5 | 2026-04 |
| Llama 3.3 70B Instruct NVFP4 | NVIDIA | 40.5 | 2026-04 |
| Llama-3.3-70B-Instruct | Meta | 40.5 | 2026-04 |
| Llama 3.1 70B | Meta | 38.5 | 2026-04 |
| Llama 3.1 70B Instruct | Meta | 38.5 | 2026-04 |
| Mistral Small (latest) | Mistral AI | 35.2 | 2026-04 |
| Mistral Small 24B Instruct 2501 | Mistral AI | 35.2 | 2026-04 |
| Mistral Small 3.1 24B Instruct 2503 | Mistral AI | 35.2 | 2026-04 |
| Mistral Small 3.2 | Mistral AI | 35.2 | 2026-04 |
| Mistral Small 3.2 24B Instruct 2506 | Mistral AI | 35.2 | 2026-04 |
| Mistral Small 4 | Mistral AI | 35.2 | 2026-04 |
| Mistral Small 4 119B 2603 | Mistral AI | 35.2 | 2026-04 |
| Phi 4 mini instruct | Microsoft | 30.5 | 2026-04 |
| CodeLlama 34B Instruct hf | Meta | 25.2 | 2026-04 |