evalstone/config/dpv4-int8_nothinking.yaml
sora ad61a2c44e Fix DeepSWE Pier routing and Terminal-Bench context/apt setup.
Keep generation max_tokens from being used as terminus-2 context, rewrite Debian/Ubuntu .sources to the Tsinghua mirror, and skip injecting truncation_tokens into DeepSWE extra_params.

Co-authored-by: Cursor <cursoragent@cursor.com>
2026-09-08 07:32:07 +00:00

396 lines
7.7 KiB
YAML
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

gpqa_diamond:
generation_config:
temperature: 1.0
top_p: 1.0
stream: true
max_tokens: 8192
hle:
generation_config:
temperature: 0.0
top_p: 1.0
stream: true
max_tokens: 32768
aime24:
generation_config:
temperature: 1.0
top_p: 1.0
stream: true
max_tokens: 32768
aime25:
generation_config:
temperature: 1.0
top_p: 1.0
stream: true
max_tokens: 32768
mmlu_pro:
generation_config:
temperature: 0.0
top_p: 1.0
stream: true
max_tokens: 8192
simple_qa:
generation_config:
temperature: 0.0
top_p: 1.0
stream: true
max_tokens: 8192
arc:
generation_config:
temperature: 0.0
top_p: 1.0
stream: true
max_tokens: 8192
bbh:
generation_config:
temperature: 0.0
top_p: 1.0
stream: true
max_tokens: 32768
live_code_bench:
generation_config:
temperature: 1.0
top_p: 1.0
stream: true
max_tokens: 32768
dataset_args:
subset_list:
- release_v6
aime26:
generation_config:
temperature: 1.0
top_p: 1.0
stream: true
max_tokens: 32768
hmmt26:
generation_config:
temperature: 1.0
top_p: 1.0
stream: true
max_tokens: 32768
imo_answerbench:
generation_config:
temperature: 1.0
top_p: 1.0
stream: true
max_tokens: 32768
super_gpqa:
generation_config:
temperature: 0.0
top_p: 1.0
stream: true
max_tokens: 8192
drop:
generation_config:
temperature: 0.0
top_p: 1.0
stream: true
max_tokens: 32768
hellaswag:
generation_config:
temperature: 0.0
top_p: 1.0
stream: true
max_tokens: 8192
mmlu:
generation_config:
temperature: 0.0
top_p: 1.0
stream: true
max_tokens: 8192
openai_mrcr:
generation_config:
temperature: 0.0
top_p: 1.0
stream: true
max_tokens: 8192
bigcodebench:
generation_config:
temperature: 0.0
top_p: 1.0
stream: true
max_tokens: 32768
humaneval:
generation_config:
temperature: 1.0
top_p: 1.0
stream: true
max_tokens: 32768
gsm8k:
generation_config:
temperature: 0.0
top_p: 1.0
stream: true
max_tokens: 32768
competition_math:
generation_config:
temperature: 0.0
top_p: 1.0
stream: true
max_tokens: 32768
cmmlu:
generation_config:
temperature: 0.0
top_p: 1.0
stream: true
max_tokens: 8192
trivia_qa:
generation_config:
temperature: 0.0
top_p: 1.0
stream: true
max_tokens: 8192
winogrande:
generation_config:
temperature: 0.0
top_p: 1.0
stream: true
max_tokens: 8192
longbench_v2:
generation_config:
temperature: 0.0
top_p: 1.0
stream: true
max_tokens: 8192
dataset_args:
subset_list:
- short
- medium
- long
tau2_bench:
generation_config:
temperature: 0.0
top_p: 1.0
stream: true
max_tokens: 16384
dataset_args:
extra_params:
user_model: deepseek-v4-pro
api_key: sk-9ed86ef546ca47e3afa7c3b014dea268
api_base: https://api.deepseek.com/v1
generation_config:
temperature: 0.0
max_tokens: 4096
agent_config:
mode: native
strategy: react
max_steps: 50
general_fc:
generation_config:
temperature: 0.0
top_p: 1.0
stream: true
max_tokens: 4096
bfcl_v3:
generation_config:
temperature: 0.0
top_p: 1.0
stream: true
max_tokens: 4096
parallel_tool_calls: true
dataset_args:
extra_params:
is_fc_model: true
underscore_to_dot: true
swe_bench_verified:
generation_config:
temperature: 0.0
top_p: 1.0
stream: true
max_tokens: 32768
swe_bench_pro:
generation_config:
temperature: 0.0
top_p: 1.0
stream: true
max_tokens: 32768
terminal_bench_v2_1:
# 单题 Harbor 异常(如 AgentTimeoutError不中止整项超时题不计入分数
ignore_errors: true
generation_config:
temperature: 0.0
top_p: 1.0
stream: true
max_tokens: 8192
dataset_args:
extra_params:
# 任务默认 agent 时限约 900s倍率 6 → 约 1 小时。绝对秒数用 agent_timeout_sec勿与 agent_timeout_multiplier 同设)
timeout_multiplier: 6.0
max_turns: 200
# 上下窗口context_limit > generation_config.max_tokens > --truncation-tokens > 100000
# 必须显式设 context_limit否则 max_tokens=8192 会被当成上下文terminus-2 几乎每轮摘要
context_limit: 65536
enable_summarize: true
proactive_summarization_threshold: 8000
aa_lcr:
generation_config:
temperature: 1.0
top_p: 1.0
stream: true
max_tokens: 32768
scicode:
generation_config:
temperature: 1.0
top_p: 1.0
stream: true
max_tokens: 32768
deep_swe:
generation_config:
temperature: 1.0
top_p: 1.0
stream: true
max_tokens: 32768
dataset_args:
extra_params:
# 官方 Claude 等原生 provider 改 pier_route: native
pier_route: openai_compat
pier_model_prefix: openai
pier_agent_kwargs:
model_class: litellm
researchrubrics:
generation_config:
temperature: 1.0
top_p: 1.0
stream: true
max_tokens: 32768
gdpval:
generation_config:
temperature: 1.0
top_p: 1.0
stream: true
max_tokens: 32768
tau3_bench:
generation_config:
temperature: 1.0
top_p: 1.0
stream: true
max_tokens: 16384
dataset_args:
subset_list:
- banking_knowledge
extra_params:
user_model: deepseek-v4-pro
api_key: sk-9ed86ef546ca47e3afa7c3b014dea268
api_base: https://api.deepseek.com/v1
generation_config:
temperature: 0.0
max_tokens: 4096
toolathlon:
generation_config:
temperature: 1.0
top_p: 1.0
stream: true
max_tokens: 32768
dataset_args:
extra_params:
server_host: 127.0.0.1
server_port: 8080
ws_proxy_port: 8081
timeout_seconds: 14400
submit_timeout_seconds: 300
task_list:
- paper-checker
skip_container_restart: false
override_output_dir: true
browsecomp:
generation_config:
temperature: 1.0
top_p: 1.0
stream: true
max_tokens: 32768
mcp_atlas:
generation_config:
temperature: 1.0
top_p: 1.0
stream: true
max_tokens: 32768
officeqa:
generation_config:
temperature: 1.0
top_p: 1.0
stream: true
max_tokens: 32768
dataset_args:
subset_list:
- officeqa_pro
deepsearchqa:
generation_config:
temperature: 1.0
top_p: 1.0
stream: true
max_tokens: 32768
job_bench:
generation_config:
temperature: 1.0
top_p: 1.0
stream: true
max_tokens: 32768
automation_bench:
generation_config:
temperature: 1.0
top_p: 1.0
stream: true
max_tokens: 32768
dataset_args:
extra_params:
toolset: api
mmmu_pro:
generation_config:
temperature: 1.0
top_p: 1.0
stream: true
max_tokens: 32768
dataset_args:
max_image_bytes: 5mb
extra_params:
dataset_format: standard (4 options)
charxiv:
generation_config:
temperature: 1.0
top_p: 1.0
stream: true
max_tokens: 32768
dataset_args:
subset_list:
- reasoning
math_vision:
generation_config:
temperature: 1.0
top_p: 1.0
stream: true
max_tokens: 32768
baby_vision:
generation_config:
temperature: 1.0
top_p: 1.0
stream: true
max_tokens: 32768
zerobench:
generation_config:
temperature: 1.0
top_p: 1.0
stream: true
max_tokens: 32768
dataset_args:
max_image_bytes: 10mb
world_vqa:
generation_config:
temperature: 1.0
top_p: 1.0
stream: true
max_tokens: 32768
omni_doc_bench:
generation_config:
temperature: 1.0
top_p: 1.0
stream: true
max_tokens: 32768
dataset_args:
extra_params:
match_method: quick_match
perception_bench:
generation_config:
temperature: 1.0
top_p: 1.0
stream: true
max_tokens: 32768