Scores whether a tool-using agent can hold a policy-following conversation with a simulated customer and leave the backend in the right state.
unassessed
| Category | agentic |
|---|---|
| Subcategory | tool-use customer-service agents |
| Page status | superseded |
| Metric | pass^k |
| Direction | higher_is_better |
| Unit | % |
| Dataset size | 165 |
| Dataset licence | MIT |
| Publisher | Sierra |
τ-bench asks a language agent to act as a customer-service representative in a retail or an airline domain: it chats with a user that is itself simulated by an LLM, calls domain-specific API tools to look up and change records, and must follow a written policy document. The user pursues its own goal and only reveals what it would naturally reveal, so the agent has to ask questions rather than execute a fixed call sequence.
multi-turn text dialogue interleaved with structured tool calls, against a simulated user model
| Model | Provider | Score | Card as of |
|---|---|---|---|
| GLM 5.1 | Z.ai (Zhipu AI) | 70.6 | 2026-04 |
| Claude Opus 4 | Anthropic | 68.2 | 2026-04 |
| Claude Opus 4.6 | Anthropic | 68.2 | 2026-04 |
| o3 | OpenAI | 65.5 | 2026-04 |
| o3-deep-research | OpenAI | 65.5 | 2026-04 |
| o3-mini | OpenAI | 65.5 | 2026-04 |
| o3-pro | OpenAI | 65.5 | 2026-04 |
| Claude Opus 4.1 | Anthropic | 64.8 | 2026-04 |
| Claude Opus 4.1 (latest) | Anthropic | 64.8 | 2026-04 |
| Claude Sonnet 4 | Anthropic | 61.5 | 2026-04 |
| Claude Sonnet 4.5 | Anthropic | 61.5 | 2026-04 |
| Claude Sonnet 4.5 (latest) | Anthropic | 61.5 | 2026-04 |
| GPT-5 | OpenAI | 58.5 | 2026-04 |
| GPT-5 Chat (latest) | OpenAI | 58.5 | 2026-04 |
| GPT-5 Mini | OpenAI | 58.5 | 2026-04 |
| GPT-5 Nano | OpenAI | 58.5 | 2026-04 |
| GPT-5 Pro | OpenAI | 58.5 | 2026-04 |
| GPT-5-Codex | OpenAI | 58.5 | 2026-04 |
| GPT-5.1 | OpenAI | 58.5 | 2026-04 |
| GPT-5.1 Chat | OpenAI | 58.5 | 2026-04 |
| GPT-5.1 Codex | OpenAI | 58.5 | 2026-04 |
| GPT-5.1 Codex Max | OpenAI | 58.5 | 2026-04 |
| GPT-5.1 Codex mini | OpenAI | 58.5 | 2026-04 |
| GPT-5.2 | OpenAI | 58.5 | 2026-04 |
| GPT-5.2 Chat | OpenAI | 58.5 | 2026-04 |
| GPT-5.2 Codex | OpenAI | 58.5 | 2026-04 |
| GPT-5.2 Pro | OpenAI | 58.5 | 2026-04 |
| GPT-5.3 Chat (latest) | OpenAI | 58.5 | 2026-04 |
| GPT-5.3 Codex | OpenAI | 58.5 | 2026-04 |
| GPT-5.3 Codex Spark | OpenAI | 58.5 | 2026-04 |
| GPT-5.4 | OpenAI | 58.5 | 2026-04 |
| GPT-5.4 mini | OpenAI | 58.5 | 2026-04 |
| GPT-5.4 nano | OpenAI | 58.5 | 2026-04 |
| GPT-5.4 Pro | OpenAI | 58.5 | 2026-04 |
| Gemini 2.5 Pro | Google DeepMind | 58.2 | 2026-04 |
| Qwen3-Coder 480B-A35B Instruct | Alibaba / Qwen Team | 55.8 | 2026-04 |
| GPT-4.1 | OpenAI | 52.8 | 2026-04 |
| Qwen 3 235B Instruct | Cerebras | 50.2 | 2026-04 |
| Qwen3 235B-A22B | Alibaba / Qwen Team | 50.2 | 2026-04 |
| DeepSeek R1 | DeepSeek | 48.8 | 2026-04 |
| DeepSeek R1 0528 | DeepSeek | 48.8 | 2026-04 |
| DeepSeek R1 0528 NVFP4 v2 | NVIDIA | 48.8 | 2026-04 |
| DeepSeek Reasoner | DeepSeek | 48.8 | 2026-04 |
| GPT-4o | OpenAI | 42.5 | 2026-04 |
| GPT-4o (2024-05-13) | OpenAI | 42.5 | 2026-04 |
| GPT-4o (2024-08-06) | OpenAI | 42.5 | 2026-04 |
| GPT-4o (2024-11-20) | OpenAI | 42.5 | 2026-04 |
| GPT-4o mini | OpenAI | 42.5 | 2026-04 |
| DeepSeek Chat | DeepSeek | 41.2 | 2026-04 |
| DeepSeek V3 | DeepSeek | 41.2 | 2026-04 |
| DeepSeek V3 0324 | DeepSeek | 41.2 | 2026-04 |
| DeepSeek V3.1 | DeepSeek | 41.2 | 2026-04 |
| DeepSeek V3.2 | DeepSeek | 41.2 | 2026-04 |
| DeepSeek V3.2 Exp | DeepSeek | 41.2 | 2026-04 |