32 lines
1.2 KiB
YAML
32 lines
1.2 KiB
YAML
# Generation-parameter profiles (YAML).
|
|
# Usage: evalharness eval run <bench> --model ... --profile <name>
|
|
# Resolution: DatasetSpec.gen_config < profile.default < profile.<bench> < gen_kwargs
|
|
|
|
dp4-nothink:
|
|
default: {temperature: 0.0, max_tokens: 32768, top_p: 1.0}
|
|
|
|
qwen3-es-parity:
|
|
default: {temperature: 0.0, max_tokens: 32768}
|
|
simple_qa: {max_tokens: 1024}
|
|
hle: {max_tokens: 8192}
|
|
gpqa_diamond: {temperature: 1.0, max_tokens: 8192}
|
|
aime24: {temperature: 1.0, max_tokens: 8192}
|
|
aime25: {temperature: 1.0, max_tokens: 8192}
|
|
aime26: {temperature: 1.0, max_tokens: 8192}
|
|
hmmt26: {temperature: 1.0, max_tokens: 8192}
|
|
imo_answerbench: {temperature: 1.0, max_tokens: 8192}
|
|
|
|
glm53-nothink:
|
|
default: {temperature: 0.0, max_tokens: 8192, top_p: 1.0}
|
|
aime24: {temperature: 1.0, max_tokens: 8192}
|
|
aime25: {temperature: 1.0, max_tokens: 8192}
|
|
aime26: {temperature: 1.0, max_tokens: 8192}
|
|
hmmt26: {temperature: 1.0, max_tokens: 8192}
|
|
imo_answerbench: {temperature: 1.0, max_tokens: 8192}
|
|
gpqa_diamond: {temperature: 1.0, max_tokens: 8192}
|
|
humaneval: {temperature: 1.0, max_tokens: 32768}
|
|
live_code_bench: {temperature: 1.0, max_tokens: 32768}
|
|
|
|
t1-short:
|
|
default: {temperature: 1.0, max_tokens: 8192, top_p: 1.0}
|