Rename --judge to --judge-model (alias kept) for symmetry with --model
Co-Authored-By: Claude <noreply@anthropic.com>
This commit is contained in:
parent
c78b0d6f0f
commit
5bb4b75b07
@ -68,7 +68,7 @@ evalharness eval run gsm8k \
|
|||||||
| `--api-url URL` | OpenAI 兼容端点;与 `--model` 搭配使用(不用手拼 spec 字符串) |
|
| `--api-url URL` | OpenAI 兼容端点;与 `--model` 搭配使用(不用手拼 spec 字符串) |
|
||||||
| `--model NAME` | 服务端模型名(配合 `--api-url`);或直接给完整 spec:`openai/http://h:8000/v1?qwen3-8b` |
|
| `--model NAME` | 服务端模型名(配合 `--api-url`);或直接给完整 spec:`openai/http://h:8000/v1?qwen3-8b` |
|
||||||
| `--provider {openai-chat,openai-pool}` | 协议/提供方,默认 `openai-chat`;端点池用 `openai-pool` |
|
| `--provider {openai-chat,openai-pool}` | 协议/提供方,默认 `openai-chat`;端点池用 `openai-pool` |
|
||||||
| `--judge NAME` + `--judge-api-url URL` | LLM-judge 模型(hle / simple_qa / imo 需要);也可单给完整 spec `--judge openai/http://...?m` |
|
| `--judge-model NAME` + `--judge-api-url URL` | LLM-judge 模型(hle / simple_qa / imo 需要);也可单给完整 spec `--judge openai/http://...?m` |
|
||||||
| `--api-key KEY` | 显式指定主模型端点的 key(优先于环境变量推断;只进请求头,不写入 spec/报告) |
|
| `--api-key KEY` | 显式指定主模型端点的 key(优先于环境变量推断;只进请求头,不写入 spec/报告) |
|
||||||
| `--judge-provider {openai-chat,openai-pool}` | judge 协议;多 judge 端点负载均衡用 `openai-pool` |
|
| `--judge-provider {openai-chat,openai-pool}` | judge 协议;多 judge 端点负载均衡用 `openai-pool` |
|
||||||
| `--judge-api-key KEY` | 显式指定 judge 端点的 key |
|
| `--judge-api-key KEY` | 显式指定 judge 端点的 key |
|
||||||
@ -187,7 +187,7 @@ evalharness eval list # 全部判分 recipe
|
|||||||
|
|
||||||
各族注意事项:
|
各族注意事项:
|
||||||
|
|
||||||
- **LLM-judge 类**(`hle`、`simple_qa`、`imo_answerbench`):传 `--judge <模型名> --judge-api-url <端点>`(与主模型同款分离参数风格);judge 走官方协议
|
- **LLM-judge 类**(`hle`、`simple_qa`、`imo_answerbench`):传 `--judge-model <模型名> --judge-api-url <端点>`(与主模型同款分离参数风格);judge 走官方协议
|
||||||
(如 SimpleQA 的分级正确性 + NOT_ATTEMPTED 兜底)。
|
(如 SimpleQA 的分级正确性 + NOT_ATTEMPTED 兜底)。
|
||||||
- **代码执行类**:模型生成的代码在硬隔离 Docker 中运行(`--network none`、cgroup 上限、只读 rootfs);
|
- **代码执行类**:模型生成的代码在硬隔离 Docker 中运行(`--network none`、cgroup 上限、只读 rootfs);
|
||||||
swe 的逐实例 `sweb.eval.*` 镜像用 `evalharness sandbox prefetch swe_bench_verified` 预取。
|
swe 的逐实例 `sweb.eval.*` 镜像用 `evalharness sandbox prefetch swe_bench_verified` 预取。
|
||||||
|
|||||||
@ -522,7 +522,7 @@ def build_parser() -> argparse.ArgumentParser:
|
|||||||
p.add_argument('--provider', default='openai-chat',
|
p.add_argument('--provider', default='openai-chat',
|
||||||
choices=('openai-chat', 'openai-pool'),
|
choices=('openai-chat', 'openai-pool'),
|
||||||
help='API protocol/provider (default: openai-chat)')
|
help='API protocol/provider (default: openai-chat)')
|
||||||
p.add_argument('--judge', default='',
|
p.add_argument('--judge-model', '--judge', dest='judge', default='',
|
||||||
help='judge model name with --judge-api-url, or full spec')
|
help='judge model name with --judge-api-url, or full spec')
|
||||||
p.add_argument('--judge-api-url', default='',
|
p.add_argument('--judge-api-url', default='',
|
||||||
help='judge API base URL when --judge is only the model name')
|
help='judge API base URL when --judge is only the model name')
|
||||||
|
|||||||
Loading…
x
Reference in New Issue
Block a user