Skip to main content
agentcompass run 使用所选 Benchmark、Harness、Model 和 Environment 创建并执行一个评测请求。BENCHMARK HARNESS MODEL 是顺序固定的位置参数,Environment 通过 --env 选择。

运行最小评测

下面通过 --benchmark-params 中的 sample_ids,按稳定任务 ID 选择一个 Benchmark 任务,用于快速验证组件和端点配置:
一条 run 命令对应一个评测请求。需要协调多个显式评测请求时,请使用 agentcompass launch。

参数参考

本节说明 agentcompass run 的参数用法,并列出完整签名、默认值和作用对象;并发、超时、重试、输出与调试参数的使用建议见运行控制。“内置默认值”指用户级、项目级或显式配置文件覆盖前使用的值。“按需”参数仅在所选组件或端点需要时必填。

组件选择与参数

配置与 Recipe

执行控制

设置多次尝试

例如,下面的参数会为每个任务计划 3 次独立 attempt,并采用 avg 策略汇总:
未指定这两个参数时使用 k=1 和 avg:每个任务只执行一次,指标按 native@1 输出。k>1 时,各 attempt 是独立的执行单元,并共同受 --task-concurrency 限制;两种策略的差异如下: 需要注意:
  • 标量主指标使用 pass 会在任务开始前报错。
  • k 表示逻辑 attempt 数量,不包含 attempt 内部由 --max-retries 产生的 retry。
  • avg@k、pass@k 的精确定义以及缺失 attempt 的处理见指标与聚合。
使用 launch 时,每个请求可以单独设置 k 和策略,详见为每个请求设置 k 和策略。

输出与复用

进程级设置

分析

组件专属 JSON 参数

四个 JSON 参数并不共享同一个结构。可用字段和默认值取决于所选组件: sample_ids 属于 --benchmark-params;多次尝试使用上述执行参数。provider 的 CPU、内存、镜像和网络设置属于 --env-params。评测各部分的概念分工见配置评测。