EvalHarness/evalharness/config/dp4-nothink.yaml

89 lines
1.4 KiB
YAML

default:
temperature: 0.0
max_tokens: 32768
top_p: 1.0
gpqa_diamond:
temperature: 1.0
max_tokens: 8192
hle:
limit_per_task: 25
judge: dp4-flash
judge_url: http://174.1.51.4:30000/v1
aime24:
temperature: 1.0
repeats: 12
aime25:
temperature: 1.0
repeats: 12
mmlu_pro:
max_tokens: 8192
limit_per_task: 20
simple_qa:
max_tokens: 8192
limit: 200
arc:
max_tokens: 8192
limit: 200
bbh:
limit_per_task: 10
live_code_bench:
temperature: 1.0
limit: 200
aime26:
temperature: 1.0
repeats: 12
hmmt26:
temperature: 1.0
repeats: 12
imo_answerbench:
temperature: 1.0
limit_per_task: 25
judge: dp4-flash
judge_url: http://174.1.51.4:30000/v1
drop:
limit: 200
hellaswag:
max_tokens: 8192
limit: 400
mmlu:
max_tokens: 8192
limit_per_task: 4
openai_mrcr:
max_tokens: 8192
limit: 200
max_input_tokens: 120000
bigcodebench:
limit: 200
humaneval:
temperature: 1.0
gsm8k:
limit: 200
competition_math:
limit_per_task: 40
cmmlu:
max_tokens: 8192
limit_per_task: 3
trivia_qa:
max_tokens: 8192
limit: 200
winogrande:
max_tokens: 8192
limit: 200
longbench_v2:
max_tokens: 8192
limit_per_task: 66
max_input_tokens: 120000
tau2_bench:
max_tokens: 16384
env: tau2_official
max_turns: 50
general_fc:
max_tokens: 4096
limit: 400
bfcl_v3:
max_tokens: 4096
limit_per_task: 20
env: bfcl_mock
swe_bench_verified:
limit: 70