terminus2。
工作原理
- 加载任务。 AgentCompass 克隆 Hugging Face 数据集,并在加载任务目录前拉取其中的 Git LFS 对象。
- 运行 agent。 Recipe 准备每个任务的容器镜像和工作区,随后终端 Harness 处理任务指令。
- 验证结果。 Harbor 验证器运行
tests/test.sh;奖励为1时记录为correct。
加载数据集的进程必须安装
git-lfs,否则无法取得已验证任务集的 LFS 资源。参数
使用默认数据集运行全部任务时,无需传入--benchmark-params。需要筛选任务或调整指标聚合时,使用 Benchmark 共享参数。运行和评测的超时与倍率通过 --execution-params 配置,见运行控制。
运行示例
agentcompass run 的三个位置参数依次为 Benchmark、Harness 和 Model。以下命令使用 terminal_bench_2_verified,Harness 的选择见下文。
运行前请确认本地 Docker 可用,并设置 MODEL_NAME、MODEL_BASE_URL 和 MODEL_API_KEY,分别指定被测 Model、API 地址和密钥。
推荐 Harness
推荐使用终端 agentterminus2。
- 冒烟测试(单条跑通)
- 自定义参数
- AgentCompass 推荐配置
运行
filter-js-from-html 一条任务,验证容器准备、推理和评分的完整链路,其余参数使用默认值。其他可选 Harness
codex 和 claude_code 是其他两个可选 Harness。运行时传入 --recipe terminalbench2_verified_docker_ac 可使用 AgentCompass 的专用镜像。它额外提供了 Node.js、npm、curl、wget 等下载依赖,方便运行 Codex、Claude Code 等需要这些依赖的 Harness。以下命令均评测完整数据集;运行 Codex 时,模型接入信息须对应 OpenAI Responses API,运行 Claude Code 时须对应 Anthropic Messages API。
- 使用官方镜像运行
- 使用 AgentCompass 镜像
不传
--recipe 即使用官方任务镜像。它不包含节点环境引导依赖,因此需显式传入对应安装命令。评测结果
通用结果说明见运行目录、汇总成绩和单题文件与公共字段。评分指标
Terminal-Bench 2 Verified 的主指标是二元correct,记录前文验证流程的通过判定;验证器奖励恰好为 1 时记为 true,其他有效奖励值记为 false,不提供部分分。
默认配置下,每题尝试一次,总体成绩为有效计分任务的通过率,取值为 0–1,越高越好。
多次尝试、分类聚合和计分异常的处理见指标与聚合。
单题结果与评分依据
meta.benchmark 下的 eval_raw_data 保存 Harbor 验证器的判分依据:
