diff --git a/evalharness/cli.py b/evalharness/cli.py index 000ede1..a5df6ae 100644 --- a/evalharness/cli.py +++ b/evalharness/cli.py @@ -788,8 +788,12 @@ def _cmd_eval_run(args) -> int: # YAML config: per-bench generation params, AUTO-LOADED # (single .yaml in config/ = the default; --config overrides) bench_cfg = _load_bench_cfg(args, name) + # env: per-bench from YAML, CLI --env as fallback/default + _env_cfg = bench_cfg.pop('env', '') or '' + if _env_cfg: + args.env = _env_cfg # strip non-generation keys (they go to run_eval kwargs) - for k in ('judge', 'judge_url', 'env', 'max_turns', + for k in ('judge', 'judge_url', 'max_turns', 'limit', 'limit_per_task', 'concurrency'): bench_cfg.pop(k, None) diff --git a/evalharness/config/default.yaml b/evalharness/config/default.yaml index 219a3f4..3ce0253 100644 --- a/evalharness/config/default.yaml +++ b/evalharness/config/default.yaml @@ -54,7 +54,9 @@ openai_mrcr: max_input_tokens: 128000 bfcl_v3: max_tokens: 4096 + env: bfcl_mock # agent 模式:工具调用轨迹 + 官方 AST 判分 general_fc: max_tokens: 4096 tau2_bench: max_tokens: 16384 + env: tau2_official # agent 模式:官方引擎