This reviewed derivative fixes environment and instruction issues in Terminal-Bench 2.0 while preserving task logic where stated.
unassessed
| Category | agentic |
|---|---|
| Subcategory | Reviewed Terminal-Bench 2.0 tasks for agent execution |
| Page status | unknown |
| Metric | task success verified by tests |
| Direction | higher_is_better |
| Unit | % |
| Dataset size | 89 |
| Dataset licence | Apache-2.0 |
| Publisher | Terminal Bench 2 Verified |
This reviewed derivative fixes environment and instruction issues in Terminal-Bench 2.0 while preserving task logic where stated. The benchmark gives an agent an English task, a terminal environment and a verification procedure; success depends on completing the task and passing its tests.
Agent interacts with a containerized terminal; task-specific tests determine success.
No model card in ModelSpec reports this benchmark yet.