An internal model-card key for an agentic (not single-shot patch) SWE-bench score; no publisher, paper or dataset for it under this name was found.
unassessed
| Category | coding |
|---|---|
| Subcategory | internal repository label for an agent-harness SWE-bench score |
| Page status | unknown |
| Direction | higher_is_better |
| Unit | % |
`swe_bench_agent` is a scoring key used by this repository's own model-card template, not a benchmark published anywhere under that name. The template comments it as "agentic SWE-bench (not just patch gen)," grouped with other agentic-environment benchmarks (tau_bench, web_arena, os_world) rather than with the SWE-bench family's other named variants. What exact dataset, instance count, harness or scaffold produces the number is not documented anywhere this research could find.
Not documented under this name. If the template comment is accurate, it denotes SWE-bench evaluated by an agent that reads, runs and edits a repository over multiple steps, as opposed to a single-shot patch generated from one prompt — but no source specific to `swe_bench_agent` describes its dataset, instance count or grading protocol.
| Model | Provider | Score | Card as of |
|---|---|---|---|
| o3 | OpenAI | 62.8 | 2026-04 |
| o3-deep-research | OpenAI | 62.8 | 2026-04 |
| o3-mini | OpenAI | 62.8 | 2026-04 |
| o3-pro | OpenAI | 62.8 | 2026-04 |
| Claude Opus 4 | Anthropic | 62.5 | 2026-04 |
| Claude Opus 4.6 | Anthropic | 62.5 | 2026-04 |
| Claude Opus 4.1 | Anthropic | 58.2 | 2026-04 |
| Claude Opus 4.1 (latest) | Anthropic | 58.2 | 2026-04 |
| Claude Sonnet 4 | Anthropic | 55.8 | 2026-04 |
| Claude Sonnet 4.5 | Anthropic | 55.8 | 2026-04 |
| Claude Sonnet 4.5 (latest) | Anthropic | 55.8 | 2026-04 |
| Gemini 2.5 Pro | Google DeepMind | 55.5 | 2026-04 |
| GPT-5 | OpenAI | 55.2 | 2026-04 |
| GPT-5 Chat (latest) | OpenAI | 55.2 | 2026-04 |
| GPT-5 Mini | OpenAI | 55.2 | 2026-04 |
| GPT-5 Nano | OpenAI | 55.2 | 2026-04 |
| GPT-5 Pro | OpenAI | 55.2 | 2026-04 |
| GPT-5-Codex | OpenAI | 55.2 | 2026-04 |
| GPT-5.1 | OpenAI | 55.2 | 2026-04 |
| GPT-5.1 Chat | OpenAI | 55.2 | 2026-04 |
| GPT-5.1 Codex | OpenAI | 55.2 | 2026-04 |
| GPT-5.1 Codex Max | OpenAI | 55.2 | 2026-04 |
| GPT-5.1 Codex mini | OpenAI | 55.2 | 2026-04 |
| GPT-5.2 | OpenAI | 55.2 | 2026-04 |
| GPT-5.2 Chat | OpenAI | 55.2 | 2026-04 |
| GPT-5.2 Codex | OpenAI | 55.2 | 2026-04 |
| GPT-5.2 Pro | OpenAI | 55.2 | 2026-04 |
| GPT-5.3 Chat (latest) | OpenAI | 55.2 | 2026-04 |
| GPT-5.3 Codex | OpenAI | 55.2 | 2026-04 |
| GPT-5.3 Codex Spark | OpenAI | 55.2 | 2026-04 |
| GPT-5.4 | OpenAI | 55.2 | 2026-04 |
| GPT-5.4 mini | OpenAI | 55.2 | 2026-04 |
| GPT-5.4 nano | OpenAI | 55.2 | 2026-04 |
| GPT-5.4 Pro | OpenAI | 55.2 | 2026-04 |
| Qwen3-Coder 480B-A35B Instruct | Alibaba / Qwen Team | 52.1 | 2026-04 |
| Grok 4 | xAI | 50.2 | 2026-04 |
| Grok 4 Fast | xAI | 50.2 | 2026-04 |
| Grok 4 Fast (Non-Reasoning) | xAI | 50.2 | 2026-04 |
| Grok 4.1 Fast | xAI | 50.2 | 2026-04 |
| Grok 4.1 Fast (Non-Reasoning) | xAI | 50.2 | 2026-04 |
| Grok 4.20 (Non-Reasoning) | xAI | 50.2 | 2026-04 |
| Grok 4.20 (Reasoning) | xAI | 50.2 | 2026-04 |
| Grok 4.20 Multi-Agent | xAI | 50.2 | 2026-04 |
| GPT-4.1 | OpenAI | 48.5 | 2026-04 |
| Qwen 3 235B Instruct | Cerebras | 45.5 | 2026-04 |
| Qwen3 235B-A22B | Alibaba / Qwen Team | 45.5 | 2026-04 |
| DeepSeek R1 | DeepSeek | 42.5 | 2026-04 |
| DeepSeek R1 0528 | DeepSeek | 42.5 | 2026-04 |
| DeepSeek R1 0528 NVFP4 v2 | NVIDIA | 42.5 | 2026-04 |
| DeepSeek Reasoner | DeepSeek | 42.5 | 2026-04 |
| DeepSeek Chat | DeepSeek | 35.8 | 2026-04 |
| DeepSeek V3 | DeepSeek | 35.8 | 2026-04 |
| DeepSeek V3 0324 | DeepSeek | 35.8 | 2026-04 |
| DeepSeek V3.1 | DeepSeek | 35.8 | 2026-04 |
| DeepSeek V3.2 | DeepSeek | 35.8 | 2026-04 |
| DeepSeek V3.2 Exp | DeepSeek | 35.8 | 2026-04 |
| GPT-4o | OpenAI | 32.1 | 2026-04 |
| GPT-4o (2024-05-13) | OpenAI | 32.1 | 2026-04 |
| GPT-4o (2024-08-06) | OpenAI | 32.1 | 2026-04 |
| GPT-4o (2024-11-20) | OpenAI | 32.1 | 2026-04 |
| GPT-4o mini | OpenAI | 32.1 | 2026-04 |