The Julia subset of MultiPL-E: HumanEval and MBPP function-completion problems translated into Julia and scored with pass@1.
unassessed
| Category | coding |
|---|---|
| Subcategory | multilingual code generation |
| Page status | active |
| Metric | pass@1 |
| Direction | higher_is_better |
| Unit | % |
| Dataset licence | MIT |
| Publisher | Northeastern University Programming Research Lab (nuprl) |
This subset translates the HumanEval and MBPP prompts into Julia by rewriting each problem's function signature, docstring and tests with Julia syntax and typing, then asks the model to complete the function body in Julia. The underlying algorithmic problem is unchanged from the Python original; only the surface language differs.
Function completion in Julia: given a translated signature, docstring and (for HumanEval-derived items) doctests, the model generates a function body, which is compiled or interpreted with a real Julia toolchain inside a container and checked against translated unit tests.
| Model | Provider | Score | Card as of |
|---|---|---|---|
| GPT-5.1 | OpenAI | 71.8 | 2026-04 |
| GPT-5.1 Chat | OpenAI | 71.8 | 2026-04 |
| GPT-5.1 Codex | OpenAI | 71.8 | 2026-04 |
| GPT-5.1 Codex Max | OpenAI | 71.8 | 2026-04 |
| GPT-5.1 Codex mini | OpenAI | 71.8 | 2026-04 |
| GPT-5 | OpenAI | 70.5 | 2026-04 |
| GPT-5 Chat (latest) | OpenAI | 70.5 | 2026-04 |
| GPT-5 Mini | OpenAI | 70.5 | 2026-04 |
| GPT-5 Nano | OpenAI | 70.5 | 2026-04 |
| GPT-5 Pro | OpenAI | 70.5 | 2026-04 |
| GPT-5-Codex | OpenAI | 70.5 | 2026-04 |
| GPT-5.2 | OpenAI | 70.5 | 2026-04 |
| GPT-5.2 Chat | OpenAI | 70.5 | 2026-04 |
| GPT-5.2 Codex | OpenAI | 70.5 | 2026-04 |
| GPT-5.2 Pro | OpenAI | 70.5 | 2026-04 |
| GPT-5.3 Chat (latest) | OpenAI | 70.5 | 2026-04 |
| GPT-5.3 Codex | OpenAI | 70.5 | 2026-04 |
| GPT-5.3 Codex Spark | OpenAI | 70.5 | 2026-04 |
| GPT-5.4 | OpenAI | 70.5 | 2026-04 |
| GPT-5.4 mini | OpenAI | 70.5 | 2026-04 |
| GPT-5.4 nano | OpenAI | 70.5 | 2026-04 |
| GPT-5.4 Pro | OpenAI | 70.5 | 2026-04 |
| Claude Opus 4 | Anthropic | 70.2 | 2026-04 |
| Claude Opus 4.6 | Anthropic | 70.2 | 2026-04 |
| o3 | OpenAI | 69.8 | 2026-04 |
| Claude Opus 4.5 | Anthropic | 69.5 | 2026-04 |
| Claude Opus 4.5 (latest) | Anthropic | 69.5 | 2026-04 |
| Qwen3-Coder 480B-A35B Instruct | Alibaba / Qwen Team | 69.2 | 2026-04 |
| Claude Sonnet 4.6 | Anthropic | 68.5 | 2026-04 |
| Claude Opus 4.1 | Anthropic | 68.2 | 2026-04 |
| Claude Opus 4.1 (latest) | Anthropic | 68.2 | 2026-04 |
| Grok 4 | xAI | 67.8 | 2026-04 |
| Grok 4 Fast | xAI | 67.8 | 2026-04 |
| Grok 4 Fast (Non-Reasoning) | xAI | 67.8 | 2026-04 |
| Grok 4.1 Fast | xAI | 67.8 | 2026-04 |
| Grok 4.1 Fast (Non-Reasoning) | xAI | 67.8 | 2026-04 |
| Grok 4.20 (Non-Reasoning) | xAI | 67.8 | 2026-04 |
| Grok 4.20 (Reasoning) | xAI | 67.8 | 2026-04 |
| Grok 4.20 Multi-Agent | xAI | 67.8 | 2026-04 |
| Claude Sonnet 4 | Anthropic | 67.5 | 2026-04 |
| Claude Sonnet 4.5 | Anthropic | 67.5 | 2026-04 |
| Claude Sonnet 4.5 (latest) | Anthropic | 67.5 | 2026-04 |
| Gemini 2.5 Pro | Google DeepMind | 67.2 | 2026-04 |
| o4-mini | OpenAI | 67.2 | 2026-04 |
| o4-mini-deep-research | OpenAI | 67.2 | 2026-04 |
| Claude Opus 4 (latest) | Anthropic | 66.5 | 2026-04 |
| GPT-4.1 | OpenAI | 65.8 | 2026-04 |
| Qwen3 235B-A22B | Alibaba / Qwen Team | 65.8 | 2026-04 |
| DeepSeek V3.2 Exp | DeepSeek | 65.5 | 2026-04 |
| Claude Sonnet 4 (latest) | Anthropic | 64.5 | 2026-04 |
| DeepSeek R1 0528 | DeepSeek | 64.5 | 2026-04 |
| DeepSeek R1 0528 NVFP4 v2 | NVIDIA | 64.5 | 2026-04 |
| DeepSeek V3.2 | DeepSeek | 64.2 | 2026-04 |
| o3-mini | OpenAI | 64.2 | 2026-04 |
| Claude Sonnet 3.7 | Anthropic | 63.2 | 2026-04 |
| GPT-4o | OpenAI | 62.8 | 2026-04 |
| GPT-4o (2024-05-13) | OpenAI | 62.8 | 2026-04 |
| GPT-4o (2024-08-06) | OpenAI | 62.8 | 2026-04 |
| GPT-4o (2024-11-20) | OpenAI | 62.8 | 2026-04 |
| DeepSeek R1 | DeepSeek | 62.1 | 2026-04 |
| DeepSeek Reasoner | DeepSeek | 62.1 | 2026-04 |
| GPT-4 Turbo | OpenAI | 61.8 | 2026-04 |
| Claude Sonnet 3.5 | Anthropic | 61.5 | 2026-04 |
| Claude Sonnet 3.5 v2 | Anthropic | 61.5 | 2026-04 |
| Gemini 2.5 Flash | Google DeepMind | 60.5 | 2026-04 |
| Gemini 2.5 Flash Image | Google DeepMind | 60.5 | 2026-04 |
| Gemini 2.5 Flash Image (Preview) | Google DeepMind | 60.5 | 2026-04 |
| Gemini 2.5 Flash Lite | Google DeepMind | 60.5 | 2026-04 |
| Gemini 2.5 Flash Lite Preview 06-17 | Google DeepMind | 60.5 | 2026-04 |
| Gemini 2.5 Flash Lite Preview 09-25 | Google DeepMind | 60.5 | 2026-04 |
| Gemini 2.5 Flash Preview 04-17 | Google DeepMind | 60.5 | 2026-04 |
| Gemini 2.5 Flash Preview 05-20 | Google DeepMind | 60.5 | 2026-04 |
| Gemini 2.5 Flash Preview 09-25 | Google DeepMind | 60.5 | 2026-04 |
| Gemini 2.5 Flash Preview TTS | Google DeepMind | 60.5 | 2026-04 |
| Claude Haiku 4.5 | Anthropic | 60.2 | 2026-04 |
| Claude Haiku 4.5 (latest) | Anthropic | 60.2 | 2026-04 |
| DeepSeek V3.1 | DeepSeek | 60.2 | 2026-04 |
| Grok 3 | xAI | 60.2 | 2026-04 |
| Grok 3 Fast | xAI | 60.2 | 2026-04 |
| Grok 3 Fast Latest | xAI | 60.2 | 2026-04 |
| Grok 3 Latest | xAI | 60.2 | 2026-04 |
| Grok 3 Mini | xAI | 60.2 | 2026-04 |
| Grok 3 Mini Fast | xAI | 60.2 | 2026-04 |
| Grok 3 Mini Fast Latest | xAI | 60.2 | 2026-04 |
| Grok 3 Mini Latest | xAI | 60.2 | 2026-04 |
| Qwen3 32B | Alibaba / Qwen Team | 59.2 | 2026-04 |
| Qwen3 32B AWQ | Alibaba / Qwen Team | 59.2 | 2026-04 |
| Qwen3 32B NVFP4 | NVIDIA | 59.2 | 2026-04 |
| Mistral Large (latest) | Mistral AI | 58.8 | 2026-04 |
| Mistral Large 2.1 | Mistral AI | 58.8 | 2026-04 |
| Mistral Large 3 | Mistral AI | 58.8 | 2026-04 |
| DeepSeek V3 0324 | DeepSeek | 58.5 | 2026-04 |
| DeepSeek Chat | DeepSeek | 56.8 | 2026-04 |
| DeepSeek V3 | DeepSeek | 56.8 | 2026-04 |
| GPT-4 | OpenAI | 56.2 | 2026-04 |
| GPT-4.1 mini | OpenAI | 56.2 | 2026-04 |
| GPT-4.1 nano | OpenAI | 56.2 | 2026-04 |
| Claude Opus 3 | Anthropic | 55.8 | 2026-04 |
| Llama 4 Maverick 17B 128E Instruct | Meta | 55.8 | 2026-04 |
| Llama-4-Maverick-17B-128E-Instruct-FP8 | Meta | 55.8 | 2026-04 |
| Qwen2.5 72B Instruct | Alibaba / Qwen Team | 54.8 | 2026-04 |
| Gemma 4 31B | Google DeepMind | 54.2 | 2026-04 |
| gemma 4 31B it | Google DeepMind | 54.2 | 2026-04 |
| gemma 4 31B it GGUF | Unsloth | 54.2 | 2026-04 |
| Gemma 4 31B IT NVFP4 | NVIDIA | 54.2 | 2026-04 |
| GPT-4o mini | OpenAI | 53.5 | 2026-04 |
| Gemma 4 26B | Google DeepMind | 52.5 | 2026-04 |
| Llama 4 Scout 17B 16E | Meta | 52.5 | 2026-04 |
| Llama 4 Scout 17B 16E Instruct | Meta | 52.5 | 2026-04 |
| Llama-4-Scout-17B-16E-Instruct-FP8 | Meta | 52.5 | 2026-04 |
| Mistral Medium (latest) | Mistral AI | 52.5 | 2026-04 |
| Mistral Medium 3 | Mistral AI | 52.5 | 2026-04 |
| Mistral Medium 3.1 | Mistral AI | 52.5 | 2026-04 |
| phi 4 | Microsoft | 52.5 | 2026-04 |
| Llama 3.3 70B Instruct NVFP4 | NVIDIA | 52.2 | 2026-04 |
| Llama-3.3-70B-Instruct | Meta | 52.2 | 2026-04 |
| Claude Haiku 3.5 | Anthropic | 51.8 | 2026-04 |
| Claude Haiku 3.5 (latest) | Anthropic | 51.8 | 2026-04 |
| Llama 3.1 70B | Meta | 50.5 | 2026-04 |
| Llama 3.1 70B Instruct | Meta | 50.5 | 2026-04 |
| Mistral Small (latest) | Mistral AI | 44.2 | 2026-04 |
| Mistral Small 24B Instruct 2501 | Mistral AI | 44.2 | 2026-04 |
| Mistral Small 3.1 24B Instruct 2503 | Mistral AI | 44.2 | 2026-04 |
| Mistral Small 3.2 | Mistral AI | 44.2 | 2026-04 |
| Mistral Small 3.2 24B Instruct 2506 | Mistral AI | 44.2 | 2026-04 |
| Mistral Small 4 | Mistral AI | 44.2 | 2026-04 |
| Mistral Small 4 119B 2603 | Mistral AI | 44.2 | 2026-04 |
| Phi 4 mini instruct | Microsoft | 40.2 | 2026-04 |
| CodeLlama 34B Instruct hf | Meta | 32.8 | 2026-04 |