sora acb94e3e20 humaneval/gpqa_diamond: repeats 3 (align with the es reference runs)
syy's es runs: humaneval x3, gpqa x2, aime25/26 x12 (already aligned),
mmlu_pro/longbench_v2 x1 (temp=0 deterministic -- repeats are noise,
and 3x 12k samples is pure cost). temp=1 benches get 3.

Co-Authored-By: Claude <noreply@anthropic.com>
2026-09-14 07:39:55 +00:00

61 lines
931 B
YAML

default:
temperature: 0.0
top_p: 1.0
stream: true
max_tokens: 32768
aime24:
temperature: 1.0
repeats: 12
max_tokens: 8192
aime25:
temperature: 1.0
repeats: 12
max_tokens: 8192
aime26:
temperature: 1.0
repeats: 12
max_tokens: 8192
hmmt26:
temperature: 1.0
repeats: 12
max_tokens: 8192
imo_answerbench:
temperature: 1.0
gpqa_diamond:
temperature: 1.0
repeats: 3
max_tokens: 8192
mmlu:
max_tokens: 8192
mmlu_pro:
max_tokens: 8192
cmmlu:
max_tokens: 8192
arc:
max_tokens: 8192
hellaswag:
max_tokens: 8192
winogrande:
max_tokens: 8192
simple_qa:
max_tokens: 8192
trivia_qa:
max_tokens: 8192
humaneval:
temperature: 1.0
repeats: 3
live_code_bench:
temperature: 1.0
longbench_v2:
max_tokens: 8192
max_input_tokens: 128000
openai_mrcr:
max_tokens: 8192
max_input_tokens: 128000
bfcl_v3:
max_tokens: 4096
general_fc:
max_tokens: 4096
tau2_bench:
max_tokens: 16384