The Lua subset of MultiPL-E: HumanEval and MBPP function-completion problems translated into Lua and scored with pass@1.
unassessed
| Category | coding |
|---|---|
| Subcategory | multilingual code generation |
| Page status | active |
| Metric | pass@1 |
| Direction | higher_is_better |
| Unit | % |
| Dataset licence | MIT |
| Publisher | Northeastern University Programming Research Lab (nuprl) |
This subset translates the HumanEval and MBPP prompts into Lua by rewriting each problem's function signature, docstring and tests with Lua syntax and typing, then asks the model to complete the function body in Lua. The underlying algorithmic problem is unchanged from the Python original; only the surface language differs.
Function completion in Lua: given a translated signature, docstring and (for HumanEval-derived items) doctests, the model generates a function body, which is compiled or interpreted with a real Lua toolchain inside a container and checked against translated unit tests.
| Model | Provider | Score | Card as of |
|---|---|---|---|
| GPT-5.1 | OpenAI | 66.8 | 2026-04 |
| GPT-5.1 Chat | OpenAI | 66.8 | 2026-04 |
| GPT-5.1 Codex | OpenAI | 66.8 | 2026-04 |
| GPT-5.1 Codex Max | OpenAI | 66.8 | 2026-04 |
| GPT-5.1 Codex mini | OpenAI | 66.8 | 2026-04 |
| Claude Opus 4 | Anthropic | 65.8 | 2026-04 |
| Claude Opus 4.6 | Anthropic | 65.8 | 2026-04 |
| GPT-5 | OpenAI | 65.5 | 2026-04 |
| GPT-5 Chat (latest) | OpenAI | 65.5 | 2026-04 |
| GPT-5 Mini | OpenAI | 65.5 | 2026-04 |
| GPT-5 Nano | OpenAI | 65.5 | 2026-04 |
| GPT-5 Pro | OpenAI | 65.5 | 2026-04 |
| GPT-5-Codex | OpenAI | 65.5 | 2026-04 |
| GPT-5.2 | OpenAI | 65.5 | 2026-04 |
| GPT-5.2 Chat | OpenAI | 65.5 | 2026-04 |
| GPT-5.2 Codex | OpenAI | 65.5 | 2026-04 |
| GPT-5.2 Pro | OpenAI | 65.5 | 2026-04 |
| GPT-5.3 Chat (latest) | OpenAI | 65.5 | 2026-04 |
| GPT-5.3 Codex | OpenAI | 65.5 | 2026-04 |
| GPT-5.3 Codex Spark | OpenAI | 65.5 | 2026-04 |
| GPT-5.4 | OpenAI | 65.5 | 2026-04 |
| GPT-5.4 mini | OpenAI | 65.5 | 2026-04 |
| GPT-5.4 nano | OpenAI | 65.5 | 2026-04 |
| GPT-5.4 Pro | OpenAI | 65.5 | 2026-04 |
| o3 | OpenAI | 65.2 | 2026-04 |
| Claude Opus 4.5 | Anthropic | 64.5 | 2026-04 |
| Claude Opus 4.5 (latest) | Anthropic | 64.5 | 2026-04 |
| Claude Sonnet 4.6 | Anthropic | 63.8 | 2026-04 |
| Claude Opus 4.1 | Anthropic | 63.5 | 2026-04 |
| Claude Opus 4.1 (latest) | Anthropic | 63.5 | 2026-04 |
| Qwen3-Coder 480B-A35B Instruct | Alibaba / Qwen Team | 62.5 | 2026-04 |
| Claude Sonnet 4 | Anthropic | 62.1 | 2026-04 |
| Claude Sonnet 4.5 | Anthropic | 62.1 | 2026-04 |
| Claude Sonnet 4.5 (latest) | Anthropic | 62.1 | 2026-04 |
| Gemini 2.5 Pro | Google DeepMind | 61.8 | 2026-04 |
| GPT-4.1 | OpenAI | 61.5 | 2026-04 |
| o4-mini | OpenAI | 61.5 | 2026-04 |
| o4-mini-deep-research | OpenAI | 61.5 | 2026-04 |
| Claude Opus 4 (latest) | Anthropic | 61.2 | 2026-04 |
| Grok 4 | xAI | 61.2 | 2026-04 |
| Grok 4 Fast | xAI | 61.2 | 2026-04 |
| Grok 4 Fast (Non-Reasoning) | xAI | 61.2 | 2026-04 |
| Grok 4.1 Fast | xAI | 61.2 | 2026-04 |
| Grok 4.1 Fast (Non-Reasoning) | xAI | 61.2 | 2026-04 |
| Grok 4.20 (Non-Reasoning) | xAI | 61.2 | 2026-04 |
| Grok 4.20 (Reasoning) | xAI | 61.2 | 2026-04 |
| Grok 4.20 Multi-Agent | xAI | 61.2 | 2026-04 |
| DeepSeek V3.2 Exp | DeepSeek | 59.2 | 2026-04 |
| Claude Sonnet 4 (latest) | Anthropic | 58.8 | 2026-04 |
| Qwen3 235B-A22B | Alibaba / Qwen Team | 58.8 | 2026-04 |
| GPT-4o | OpenAI | 58.5 | 2026-04 |
| GPT-4o (2024-05-13) | OpenAI | 58.5 | 2026-04 |
| GPT-4o (2024-08-06) | OpenAI | 58.5 | 2026-04 |
| GPT-4o (2024-11-20) | OpenAI | 58.5 | 2026-04 |
| o3-mini | OpenAI | 58.5 | 2026-04 |
| DeepSeek V3.2 | DeepSeek | 58.2 | 2026-04 |
| Claude Sonnet 3.7 | Anthropic | 57.8 | 2026-04 |
| DeepSeek R1 0528 | DeepSeek | 57.8 | 2026-04 |
| DeepSeek R1 0528 NVFP4 v2 | NVIDIA | 57.8 | 2026-04 |
| GPT-4 Turbo | OpenAI | 56.8 | 2026-04 |
| Claude Sonnet 3.5 | Anthropic | 55.8 | 2026-04 |
| Claude Sonnet 3.5 v2 | Anthropic | 55.8 | 2026-04 |
| DeepSeek R1 | DeepSeek | 55.8 | 2026-04 |
| DeepSeek Reasoner | DeepSeek | 55.8 | 2026-04 |
| Claude Haiku 4.5 | Anthropic | 54.8 | 2026-04 |
| Claude Haiku 4.5 (latest) | Anthropic | 54.8 | 2026-04 |
| DeepSeek V3.1 | DeepSeek | 54.5 | 2026-04 |
| Gemini 2.5 Flash | Google DeepMind | 53.8 | 2026-04 |
| Gemini 2.5 Flash Image | Google DeepMind | 53.8 | 2026-04 |
| Gemini 2.5 Flash Image (Preview) | Google DeepMind | 53.8 | 2026-04 |
| Gemini 2.5 Flash Lite | Google DeepMind | 53.8 | 2026-04 |
| Gemini 2.5 Flash Lite Preview 06-17 | Google DeepMind | 53.8 | 2026-04 |
| Gemini 2.5 Flash Lite Preview 09-25 | Google DeepMind | 53.8 | 2026-04 |
| Gemini 2.5 Flash Preview 04-17 | Google DeepMind | 53.8 | 2026-04 |
| Gemini 2.5 Flash Preview 05-20 | Google DeepMind | 53.8 | 2026-04 |
| Gemini 2.5 Flash Preview 09-25 | Google DeepMind | 53.8 | 2026-04 |
| Gemini 2.5 Flash Preview TTS | Google DeepMind | 53.8 | 2026-04 |
| Grok 3 | xAI | 53.5 | 2026-04 |
| Grok 3 Fast | xAI | 53.5 | 2026-04 |
| Grok 3 Fast Latest | xAI | 53.5 | 2026-04 |
| Grok 3 Latest | xAI | 53.5 | 2026-04 |
| Grok 3 Mini | xAI | 53.5 | 2026-04 |
| Grok 3 Mini Fast | xAI | 53.5 | 2026-04 |
| Grok 3 Mini Fast Latest | xAI | 53.5 | 2026-04 |
| Grok 3 Mini Latest | xAI | 53.5 | 2026-04 |
| Qwen3 32B | Alibaba / Qwen Team | 53.5 | 2026-04 |
| Qwen3 32B AWQ | Alibaba / Qwen Team | 53.5 | 2026-04 |
| Qwen3 32B NVFP4 | NVIDIA | 53.5 | 2026-04 |
| Mistral Large (latest) | Mistral AI | 52.8 | 2026-04 |
| Mistral Large 2.1 | Mistral AI | 52.8 | 2026-04 |
| Mistral Large 3 | Mistral AI | 52.8 | 2026-04 |
| Qwen2.5 Coder 32B Instruct | Alibaba / Qwen Team | 52.8 | 2026-04 |
| Qwen2.5 Coder 32B Instruct AWQ | Alibaba / Qwen Team | 52.8 | 2026-04 |
| DeepSeek V3 0324 | DeepSeek | 52.2 | 2026-04 |
| GPT-4 | OpenAI | 50.8 | 2026-04 |
| GPT-4.1 mini | OpenAI | 50.8 | 2026-04 |
| GPT-4.1 nano | OpenAI | 50.8 | 2026-04 |
| Claude Opus 3 | Anthropic | 50.5 | 2026-04 |
| DeepSeek Chat | DeepSeek | 50.5 | 2026-04 |
| DeepSeek V3 | DeepSeek | 50.5 | 2026-04 |
| Llama 4 Maverick 17B 128E Instruct | Meta | 49.8 | 2026-04 |
| Llama-4-Maverick-17B-128E-Instruct-FP8 | Meta | 49.8 | 2026-04 |
| Qwen2.5 72B Instruct | Alibaba / Qwen Team | 49.5 | 2026-04 |
| Codestral (latest) | Mistral AI | 48.5 | 2026-04 |
| GPT-4o mini | OpenAI | 48.5 | 2026-04 |
| Gemma 4 31B | Google DeepMind | 47.5 | 2026-04 |
| gemma 4 31B it | Google DeepMind | 47.5 | 2026-04 |
| gemma 4 31B it GGUF | Unsloth | 47.5 | 2026-04 |
| Gemma 4 31B IT NVFP4 | NVIDIA | 47.5 | 2026-04 |
| Mistral Medium (latest) | Mistral AI | 47.2 | 2026-04 |
| Mistral Medium 3 | Mistral AI | 47.2 | 2026-04 |
| Mistral Medium 3.1 | Mistral AI | 47.2 | 2026-04 |
| Claude Haiku 3.5 | Anthropic | 46.8 | 2026-04 |
| Claude Haiku 3.5 (latest) | Anthropic | 46.8 | 2026-04 |
| Llama 4 Scout 17B 16E | Meta | 46.5 | 2026-04 |
| Llama 4 Scout 17B 16E Instruct | Meta | 46.5 | 2026-04 |
| Llama-4-Scout-17B-16E-Instruct-FP8 | Meta | 46.5 | 2026-04 |
| Llama 3.3 70B Instruct NVFP4 | NVIDIA | 45.8 | 2026-04 |
| Llama-3.3-70B-Instruct | Meta | 45.8 | 2026-04 |
| phi 4 | Microsoft | 45.5 | 2026-04 |
| Qwen2.5 Coder 14B Instruct | Alibaba / Qwen Team | 45.5 | 2026-04 |
| Gemma 4 26B | Google DeepMind | 45.2 | 2026-04 |
| Llama 3.1 70B | Meta | 43.8 | 2026-04 |
| Llama 3.1 70B Instruct | Meta | 43.8 | 2026-04 |
| Mistral Small (latest) | Mistral AI | 40.5 | 2026-04 |
| Mistral Small 24B Instruct 2501 | Mistral AI | 40.5 | 2026-04 |
| Mistral Small 3.1 24B Instruct 2503 | Mistral AI | 40.5 | 2026-04 |
| Mistral Small 3.2 | Mistral AI | 40.5 | 2026-04 |
| Mistral Small 3.2 24B Instruct 2506 | Mistral AI | 40.5 | 2026-04 |
| Mistral Small 4 | Mistral AI | 40.5 | 2026-04 |
| Mistral Small 4 119B 2603 | Mistral AI | 40.5 | 2026-04 |
| Qwen2.5 Coder 7B Instruct | Alibaba / Qwen Team | 38.5 | 2026-04 |
| Qwen2.5 Coder 7B Instruct GPTQ Int4 | Alibaba / Qwen Team | 38.5 | 2026-04 |
| Phi 4 mini instruct | Microsoft | 35.2 | 2026-04 |
| CodeLlama 34B Instruct hf | Meta | 30.5 | 2026-04 |