Skip to main content
claude_code Harness 在 Benchmark 准备好的工作区中以非交互方式运行 Claude Code。

工作原理

  • 准备 Claude Code CLI。 可选 Runtime Capsule 可先提供通用工具链,随后 Harness 仍按 install_strategy 使用镜像内 CLI、按需安装或上传可执行文件。
  • 配置并运行。 Harness 写入当前会话使用的 Anthropic 兼容 model 配置,并以无头模式运行 Claude Code。Recipe 可以传入仓库外的设置文件,避免凭据进入最终补丁。
  • 回收结果。 Claude Code 的 JSON 记录会被规整为轨迹、最终回答和执行状态,并返回 RunResult。

参数

通过 --harness-params '{...}' 传入 Harness 参数。这里只列出通常需要调整的安装与 agent 行为,其余路径和上传配置使用内置默认值。

参数总览

参数类型默认值可选值 / 取值说明
install_strategy字符串install_if_missingpreinstalled / install_if_missing / upload准备 Claude Code 的方式。
install_command字符串npm install -g @anthropic-ai/claude-code命令缺少 Claude Code 时执行的安装命令;版本也在此指定。
setup_capsule_tag字符串未设置node24-v1在安装 Claude Code 前注入可选的预定义工具链 Capsule。
max_turns整数400整数 ≥ 1单个任务的最大 agent 轮数。
max_output_tokens整数 / 空值未设置整数 ≥ 1 或 null单次响应最大输出词元;未设置时沿用 Claude Code 默认值。
append_system_prompt字符串未设置任意字符串追加给 Claude Code 的额外系统提示词。
dangerously_skip_permissions布尔值truetrue / false是否传 —dangerously-skip-permissions。仅在需要保留 Claude Code 权限确认时设为 false。

model API

Claude Code 需要 Anthropic 兼容的 --model-base-url 与 --model-api-key,并使用 --model-api-protocol anthropic。基础 URL 以 /v1 结尾时,Harness 会自动去除该后缀,再写入 Claude Code 配置。

运行示例

使用默认安装与 agent 配置运行。

输出

Harness 为每个任务返回 RunResult:轨迹、最终回答与执行状态。单任务详情与聚合指标由 Benchmark 写入 运行目录(详见 结果)。 任务执行 deadline 统一通过 --execution-params 中的 run_timeout_seconds 和 run_timeout_multiplier 设置。详见阶段超时。