From 5bb4b75b0708db66c64701cafabb4aed905cdadd Mon Sep 17 00:00:00 2001 From: sora <2075279110@qq.com> Date: Thu, 10 Sep 2026 06:52:31 +0000 Subject: [PATCH] Rename --judge to --judge-model (alias kept) for symmetry with --model Co-Authored-By: Claude --- README.md | 4 ++-- evalharness/cli.py | 2 +- 2 files changed, 3 insertions(+), 3 deletions(-) diff --git a/README.md b/README.md index e5077a2..0e0de5c 100644 --- a/README.md +++ b/README.md @@ -68,7 +68,7 @@ evalharness eval run gsm8k \ | `--api-url URL` | OpenAI 兼容端点;与 `--model` 搭配使用(不用手拼 spec 字符串) | | `--model NAME` | 服务端模型名(配合 `--api-url`);或直接给完整 spec:`openai/http://h:8000/v1?qwen3-8b` | | `--provider {openai-chat,openai-pool}` | 协议/提供方,默认 `openai-chat`;端点池用 `openai-pool` | -| `--judge NAME` + `--judge-api-url URL` | LLM-judge 模型(hle / simple_qa / imo 需要);也可单给完整 spec `--judge openai/http://...?m` | +| `--judge-model NAME` + `--judge-api-url URL` | LLM-judge 模型(hle / simple_qa / imo 需要);也可单给完整 spec `--judge openai/http://...?m` | | `--api-key KEY` | 显式指定主模型端点的 key(优先于环境变量推断;只进请求头,不写入 spec/报告) | | `--judge-provider {openai-chat,openai-pool}` | judge 协议;多 judge 端点负载均衡用 `openai-pool` | | `--judge-api-key KEY` | 显式指定 judge 端点的 key | @@ -187,7 +187,7 @@ evalharness eval list # 全部判分 recipe 各族注意事项: -- **LLM-judge 类**(`hle`、`simple_qa`、`imo_answerbench`):传 `--judge <模型名> --judge-api-url <端点>`(与主模型同款分离参数风格);judge 走官方协议 +- **LLM-judge 类**(`hle`、`simple_qa`、`imo_answerbench`):传 `--judge-model <模型名> --judge-api-url <端点>`(与主模型同款分离参数风格);judge 走官方协议 (如 SimpleQA 的分级正确性 + NOT_ATTEMPTED 兜底)。 - **代码执行类**:模型生成的代码在硬隔离 Docker 中运行(`--network none`、cgroup 上限、只读 rootfs); swe 的逐实例 `sweb.eval.*` 镜像用 `evalharness sandbox prefetch swe_bench_verified` 预取。 diff --git a/evalharness/cli.py b/evalharness/cli.py index c194bf3..93aa2c1 100644 --- a/evalharness/cli.py +++ b/evalharness/cli.py @@ -522,7 +522,7 @@ def build_parser() -> argparse.ArgumentParser: p.add_argument('--provider', default='openai-chat', choices=('openai-chat', 'openai-pool'), help='API protocol/provider (default: openai-chat)') - p.add_argument('--judge', default='', + p.add_argument('--judge-model', '--judge', dest='judge', default='', help='judge model name with --judge-api-url, or full spec') p.add_argument('--judge-api-url', default='', help='judge API base URL when --judge is only the model name')