From eb6028e8c919c97784724c1f127795de8dae0554 Mon Sep 17 00:00:00 2001 From: sora <2075279110@qq.com> Date: Fri, 11 Sep 2026 08:42:21 +0000 Subject: [PATCH] Config simplified: default block + per-bench overrides only (removed env/limit/judge/concurrency; max_input_tokens 128000) Co-Authored-By: Claude --- evalharness/config/dp4-nothink.yaml | 243 +++++++--------------------- 1 file changed, 61 insertions(+), 182 deletions(-) diff --git a/evalharness/config/dp4-nothink.yaml b/evalharness/config/dp4-nothink.yaml index 9153f07..fc37f9d 100644 --- a/evalharness/config/dp4-nothink.yaml +++ b/evalharness/config/dp4-nothink.yaml @@ -1,196 +1,75 @@ -gpqa_diamond: - generation_config: - temperature: 1.0 - top_p: 1.0 - stream: true - max_tokens: 8192 -hle: - generation_config: - temperature: 0.0 - top_p: 1.0 - stream: true - max_tokens: 32768 +default: + temperature: 0.0 + top_p: 1.0 + stream: true + max_tokens: 32768 + aime24: - generation_config: - temperature: 1.0 - top_p: 1.0 - stream: true - max_tokens: 32768 + temperature: 1.0 repeats: 12 + aime25: - generation_config: - temperature: 1.0 - top_p: 1.0 - stream: true - max_tokens: 32768 + temperature: 1.0 repeats: 12 -mmlu_pro: - generation_config: - temperature: 0.0 - top_p: 1.0 - stream: true - max_tokens: 8192 -simple_qa: - generation_config: - temperature: 0.0 - top_p: 1.0 - stream: true - max_tokens: 8192 -arc: - generation_config: - temperature: 0.0 - top_p: 1.0 - stream: true - max_tokens: 8192 -bbh: - generation_config: - temperature: 0.0 - top_p: 1.0 - stream: true - max_tokens: 32768 -live_code_bench: - generation_config: - temperature: 1.0 - top_p: 1.0 - stream: true - max_tokens: 32768 - dataset_args: - subset_list: - - release_v6 + aime26: - generation_config: - temperature: 1.0 - top_p: 1.0 - stream: true - max_tokens: 32768 + temperature: 1.0 repeats: 12 + hmmt26: - generation_config: - temperature: 1.0 - top_p: 1.0 - stream: true - max_tokens: 32768 + temperature: 1.0 repeats: 12 + imo_answerbench: - generation_config: - temperature: 1.0 - top_p: 1.0 - stream: true - max_tokens: 32768 -drop: - generation_config: - temperature: 0.0 - top_p: 1.0 - stream: true - max_tokens: 32768 -hellaswag: - generation_config: - temperature: 0.0 - top_p: 1.0 - stream: true - max_tokens: 8192 + temperature: 1.0 + +gpqa_diamond: + temperature: 1.0 + max_tokens: 8192 + mmlu: - generation_config: - temperature: 0.0 - top_p: 1.0 - stream: true - max_tokens: 8192 -openai_mrcr: - generation_config: - temperature: 0.0 - top_p: 1.0 - stream: true - max_tokens: 8192 -bigcodebench: - generation_config: - temperature: 0.0 - top_p: 1.0 - stream: true - max_tokens: 32768 -humaneval: - generation_config: - temperature: 1.0 - top_p: 1.0 - stream: true - max_tokens: 32768 -gsm8k: - generation_config: - temperature: 0.0 - top_p: 1.0 - stream: true - max_tokens: 32768 -competition_math: - generation_config: - temperature: 0.0 - top_p: 1.0 - stream: true - max_tokens: 32768 + max_tokens: 8192 + +mmlu_pro: + max_tokens: 8192 + cmmlu: - generation_config: - temperature: 0.0 - top_p: 1.0 - stream: true - max_tokens: 8192 -trivia_qa: - generation_config: - temperature: 0.0 - top_p: 1.0 - stream: true - max_tokens: 8192 + max_tokens: 8192 + +arc: + max_tokens: 8192 + +hellaswag: + max_tokens: 8192 + winogrande: - generation_config: - temperature: 0.0 - top_p: 1.0 - stream: true - max_tokens: 8192 + max_tokens: 8192 + +simple_qa: + max_tokens: 8192 + +trivia_qa: + max_tokens: 8192 + +humaneval: + temperature: 1.0 + +live_code_bench: + temperature: 1.0 + longbench_v2: - generation_config: - temperature: 0.0 - top_p: 1.0 - stream: true - max_tokens: 8192 - dataset_args: - subset_list: - - short - - medium - - long -tau2_bench: - generation_config: - temperature: 0.0 - top_p: 1.0 - stream: true - max_tokens: 16384 - dataset_args: - extra_params: - user_model: deepseek-v4-pro - api_key: sk-9ed86ef546ca47e3afa7c3b014dea268 - api_base: https://api.deepseek.com/v1 - generation_config: - temperature: 0.0 - max_tokens: 4096 - env: tau2_official - max_turns: 50 -general_fc: - generation_config: - temperature: 0.0 - top_p: 1.0 - stream: true - max_tokens: 4096 + max_tokens: 8192 + max_input_tokens: 128000 + +openai_mrcr: + max_tokens: 8192 + max_input_tokens: 128000 + bfcl_v3: - generation_config: - temperature: 0.0 - top_p: 1.0 - stream: true - max_tokens: 4096 - parallel_tool_calls: true - dataset_args: - extra_params: - is_fc_model: true - underscore_to_dot: true - env: bfcl_mock -swe_bench_verified: - generation_config: - temperature: 0.0 - top_p: 1.0 - stream: true - max_tokens: 32768 + max_tokens: 4096 + +general_fc: + max_tokens: 4096 + +tau2_bench: + max_tokens: 16384