Skip to main content
SGI Deep Research(arXiv)—— “Probing Scientific General Intelligence of LLMs with Scientist-Aligned Workflows”,AgentCompass 采用其 SGI Deep Research 子集。该基准评测深度研究型 agent 在科研问题上的能力:此类问题需经多步网络检索与证据搜集,最终产出一段详尽的研究性答案,再由 LLM 评委 依据标准答案判定对错。 与 BrowseComp 相同,SGI Deep Research 采用单侧判题。评委仅比对被测 agent 的答案与标准答案,不与任何基线对照。推理与判题均在本地进程(host_process)内完成——先由 Harness 驱动被测 model 完成检索循环并给出最终答案,再由评委 model 判分。

工作原理

SGI Deep Research 一次运行分为推理与判题两个阶段。

推理与判题

  • 推理:被测 model 作为研究型 agent,在 Harness(默认 naive_search_agent)驱动下逐题完成搜索 / 网页访问等多轮工具循环,跨来源搜集证据,并产出一段详尽的自然语言研究性答案。
  • 判题:评委 model(judge_model)接收「问题 + 标准答案 + 被测答案」,套用内置的 A/B/C 判定协议进行打分。评委仅比对最终答案,忽略推理过程与格式差异,等价表达视为一致。评委与被测 model 是两个独立端点,须显式指定 judge_model。

A/B/C 判定

评委只给出一个判定结果,其中仅 A 记为正确:
  • A —— 正确:答案在语义上命中标准答案(允许等价表达与格式差异)。
  • B —— 错误:与标准答案存在任何偏差。
  • C —— 无效(未完成 / 重复 / 拒绝):答案不完整(中途截断)、循环重复,或明确拒答。

参数

通过 --benchmark-params '{...}' 传入一段 JSON;也可写进 --config 指定 YAML 的 benchmark.params 块,同名项以命令行为准。合并与优先级见 Benchmark 概览。

参数总览

参数类型默认值可选值 / 取值说明
judge_model字典nullid, base_url, api_key, api_protocol, params评委 model 配置,必填(见 评委 model 配置)。判分由它裁定,非命令行的 —model-*。
category字符串 / 列表”all""all”、life、earth、material、physics、mathematics、neuroscience、information、astronomy、chemistry、energy按类别筛选任务;“all” = 不过滤,传入列表时取并集。各类别任务数——生命(87)、地球(54)、材料(38)、物理(32)、数学(25)、神经科学(24)、信息科学(20)、天文学(17)、化学(11)、能源(10),合计 318 条。
sample_ids 等共享字段遵循 Benchmark 参数 的约定;多次尝试使用 --k 和 --attempt-strategy,详见指标与聚合。

评委 model 配置

judge_model 以字典形式传入,包含 id、base_url、api_key、api_protocol 和 params,指向评委 model 的独立端点,model 推理参数放在 params 下。 建议 固定使用同一个评委 评测所有被测 model。判分结果直接决定成绩,更换评委后成绩即失去横向可比性;同时不应让被测 model 充当自身的评委,否则既不公正也失去对照意义。评委无需特别强——A/B/C 判据(语义命中)相对客观,中等规模 model 即可胜任。AgentCompass 推荐 Qwen3.6-35B-A3B。

运行示例

agentcompass run 的三个位置参数依次为 Benchmark、Harness 和 Model;以下使用 sgi_deep_research、naive_search_agent 和 $MODEL_NAME,运行环境为 host_process。 运行前,在当前终端设置以下环境变量:
  • 被测 Model:MODEL_NAME、MODEL_BASE_URL、MODEL_API_KEY,设置方法见 Model 接入配置。
  • 评委 Model:JUDGE_MODEL_NAME、JUDGE_MODEL_BASE_URL、JUDGE_MODEL_API_KEY,使用独立且固定的评委配置。
  • 检索工具:SERPER_API_KEY 和 JINA_API_KEY,分别供 search 和 visit 使用。
配置归属与命令行覆盖规则见 run 命令。
通过 sample_ids 仅评测一条任务,用于验证推理与判题的端到端流程是否正常,其余参数使用默认值。

评测结果

通用结果说明见运行目录、汇总成绩和单题文件与公共字段。

评分指标

SGI Deep Research 的主指标是二元 correct:按前文的 A/B/C 判定,A 对应 true,B/C 对应 false,不提供部分分。 默认配置下,每题尝试一次,总体成绩为有效计分任务的准确率,取值为 0–1,越高越好。例如,100 道题均取得有效判定,其中 63 道正确,报告中的 0.63 即 63%。使用 category 或 sample_ids 筛选任务后,成绩只覆盖所选任务。 多次尝试、分类聚合和计分异常的处理见指标与聚合。

单题结果与评分依据

每次尝试评分成功后,meta.benchmark 下的 scoring 保存以下信息: 该评分记录保留判定和比对的答案,不保存评委的原始回复或推理说明。