Skip to main content
Terminal-Bench 2 Verified 是托管在 Hugging Face 的 Terminal-Bench 2 已验证子集。它与 Terminal-Bench 2 使用相同的任务执行与验证器流程,通常搭配 terminus2。

工作原理

  1. 加载任务。 AgentCompass 克隆 Hugging Face 数据集,并在加载任务目录前拉取其中的 Git LFS 对象。
  2. 运行 agent。 Recipe 准备每个任务的容器镜像和工作区,随后终端 Harness 处理任务指令。
  3. 验证结果。 Harbor 验证器运行 tests/test.sh;奖励为 1 时记录为 correct。
加载数据集的进程必须安装 git-lfs,否则无法取得已验证任务集的 LFS 资源。

参数

使用默认数据集运行全部任务时,无需传入 --benchmark-params。需要筛选任务或调整指标聚合时,使用 Benchmark 共享参数。运行和评测的超时与倍率通过 --execution-params 配置,见运行控制。

运行示例

agentcompass run 的三个位置参数依次为 Benchmark、Harness 和 Model。以下命令使用 terminal_bench_2_verified,Harness 的选择见下文。 运行前请确认本地 Docker 可用,并设置 MODEL_NAME、MODEL_BASE_URL 和 MODEL_API_KEY,分别指定被测 Model、API 地址和密钥。

推荐 Harness

推荐使用终端 agent terminus2。
运行 filter-js-from-html 一条任务,验证容器准备、推理和评分的完整链路,其余参数使用默认值。

其他可选 Harness

codex 和 claude_code 是其他两个可选 Harness。运行时传入 --recipe terminalbench2_verified_docker_ac 可使用 AgentCompass 的专用镜像。它额外提供了 Node.js、npm、curl、wget 等下载依赖,方便运行 Codex、Claude Code 等需要这些依赖的 Harness。以下命令均评测完整数据集;运行 Codex 时,模型接入信息须对应 OpenAI Responses API,运行 Claude Code 时须对应 Anthropic Messages API。
不传 --recipe 即使用官方任务镜像。它不包含节点环境引导依赖,因此需显式传入对应安装命令。

评测结果

通用结果说明见运行目录、汇总成绩和单题文件与公共字段。

评分指标

Terminal-Bench 2 Verified 的主指标是二元 correct,记录前文验证流程的通过判定;验证器奖励恰好为 1 时记为 true,其他有效奖励值记为 false,不提供部分分。 默认配置下,每题尝试一次,总体成绩为有效计分任务的通过率,取值为 0–1,越高越好。 多次尝试、分类聚合和计分异常的处理见指标与聚合。

单题结果与评分依据

meta.benchmark 下的 eval_raw_data 保存 Harbor 验证器的判分依据: