Skip to main content
Terminal-Bench 2.1 是 AgentCompass 对 Terminal-Bench 2.1 任务集的入口。它与 Terminal-Bench 2 使用相同的容器执行和验证流程,通常搭配 terminus2 Harness。

工作原理

  1. 加载任务。 使用默认数据集地址时,AgentCompass 通过 Harbor CLI 下载 Terminal-Bench 2.1;若显式配置为常规 Git 数据源,则改为浅克隆。
  2. 运行 agent。 Environment Recipe 选择每个任务声明的镜像,并在准备好的终端工作区中启动 agent。
  3. 验证结果。 任务的 tests/test.sh 通过 Harbor 验证器执行;奖励为 1 时记录为 correct。

参数

使用默认数据集运行全部任务时,无需传入 --benchmark-params。需要筛选任务或调整指标聚合时,使用 Benchmark 共享参数。运行和评测的超时与倍率通过 --execution-params 配置,见运行控制。

运行示例

agentcompass run 的三个位置参数依次为 Benchmark、Harness 和 Model。以下命令使用 terminal_bench_2_1,Harness 的选择见下文。 运行前请确认本地 Docker 可用,并设置 MODEL_NAME、MODEL_BASE_URL 和 MODEL_API_KEY,分别指定被测 Model、API 地址和密钥。

推荐 Harness

推荐使用终端 agent terminus2。
运行 filter-js-from-html 一条任务,验证容器准备、推理和评分的完整链路,其余参数使用默认值。

其他可选 Harness

codex 和 claude_code 是其他两个可选 Harness。运行时传入 --recipe terminalbench2_1_docker_ac 可使用 AgentCompass 的专用镜像。它额外提供了 Node.js、npm、curl、wget 等下载依赖,方便运行 Codex、Claude Code 等需要这些依赖的 Harness。以下命令均评测完整数据集;运行 Codex 时,模型接入信息须对应 OpenAI Responses API,运行 Claude Code 时须对应 Anthropic Messages API。
不传 --recipe 即使用官方任务镜像。它不包含节点环境引导依赖,因此需显式传入对应安装命令。

评测结果

通用结果说明见运行目录、汇总成绩和单题文件与公共字段。

评分指标

Terminal-Bench 2.1 的主指标是二元 correct,记录前文验证流程的通过判定;验证器奖励恰好为 1 时记为 true,其他有效奖励值记为 false,不提供部分分。 默认配置下,每题尝试一次,总体成绩为有效计分任务的通过率,取值为 0–1,越高越好。 多次尝试、分类聚合和计分异常的处理见指标与聚合。

单题结果与评分依据

meta.benchmark 下的 eval_raw_data 保存 Harbor 验证器的判分依据: