Rename --judge to --judge-model (alias kept) for symmetry with --model

Co-Authored-By: Claude <noreply@anthropic.com>
This commit is contained in:
sora 2026-09-10 06:52:31 +00:00
parent c78b0d6f0f
commit 5bb4b75b07
2 changed files with 3 additions and 3 deletions

View File

@ -68,7 +68,7 @@ evalharness eval run gsm8k \
| `--api-url URL` | OpenAI 兼容端点;与 `--model` 搭配使用(不用手拼 spec 字符串) |
| `--model NAME` | 服务端模型名(配合 `--api-url`);或直接给完整 spec`openai/http://h:8000/v1?qwen3-8b` |
| `--provider {openai-chat,openai-pool}` | 协议/提供方,默认 `openai-chat`;端点池用 `openai-pool` |
| `--judge NAME` + `--judge-api-url URL` | LLM-judge 模型hle / simple_qa / imo 需要);也可单给完整 spec `--judge openai/http://...?m` |
| `--judge-model NAME` + `--judge-api-url URL` | LLM-judge 模型hle / simple_qa / imo 需要);也可单给完整 spec `--judge openai/http://...?m` |
| `--api-key KEY` | 显式指定主模型端点的 key优先于环境变量推断只进请求头不写入 spec/报告) |
| `--judge-provider {openai-chat,openai-pool}` | judge 协议;多 judge 端点负载均衡用 `openai-pool` |
| `--judge-api-key KEY` | 显式指定 judge 端点的 key |
@ -187,7 +187,7 @@ evalharness eval list # 全部判分 recipe
各族注意事项:
- **LLM-judge 类**`hle``simple_qa``imo_answerbench`):传 `--judge <模型名> --judge-api-url <端点>`与主模型同款分离参数风格judge 走官方协议
- **LLM-judge 类**`hle``simple_qa``imo_answerbench`):传 `--judge-model <模型名> --judge-api-url <端点>`与主模型同款分离参数风格judge 走官方协议
(如 SimpleQA 的分级正确性 + NOT_ATTEMPTED 兜底)。
- **代码执行类**:模型生成的代码在硬隔离 Docker 中运行(`--network none`、cgroup 上限、只读 rootfs
swe 的逐实例 `sweb.eval.*` 镜像用 `evalharness sandbox prefetch swe_bench_verified` 预取。

View File

@ -522,7 +522,7 @@ def build_parser() -> argparse.ArgumentParser:
p.add_argument('--provider', default='openai-chat',
choices=('openai-chat', 'openai-pool'),
help='API protocol/provider (default: openai-chat)')
p.add_argument('--judge', default='',
p.add_argument('--judge-model', '--judge', dest='judge', default='',
help='judge model name with --judge-api-url, or full spec')
p.add_argument('--judge-api-url', default='',
help='judge API base URL when --judge is only the model name')