Keep generation max_tokens from being used as terminus-2 context, rewrite Debian/Ubuntu .sources to the Tsinghua mirror, and skip injecting truncation_tokens into DeepSWE extra_params. Co-authored-by: Cursor <cursoragent@cursor.com>
396 lines
7.7 KiB
YAML
396 lines
7.7 KiB
YAML
gpqa_diamond:
|
||
generation_config:
|
||
temperature: 1.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 8192
|
||
hle:
|
||
generation_config:
|
||
temperature: 0.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 32768
|
||
aime24:
|
||
generation_config:
|
||
temperature: 1.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 32768
|
||
aime25:
|
||
generation_config:
|
||
temperature: 1.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 32768
|
||
mmlu_pro:
|
||
generation_config:
|
||
temperature: 0.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 8192
|
||
simple_qa:
|
||
generation_config:
|
||
temperature: 0.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 8192
|
||
arc:
|
||
generation_config:
|
||
temperature: 0.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 8192
|
||
bbh:
|
||
generation_config:
|
||
temperature: 0.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 32768
|
||
live_code_bench:
|
||
generation_config:
|
||
temperature: 1.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 32768
|
||
dataset_args:
|
||
subset_list:
|
||
- release_v6
|
||
aime26:
|
||
generation_config:
|
||
temperature: 1.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 32768
|
||
hmmt26:
|
||
generation_config:
|
||
temperature: 1.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 32768
|
||
imo_answerbench:
|
||
generation_config:
|
||
temperature: 1.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 32768
|
||
super_gpqa:
|
||
generation_config:
|
||
temperature: 0.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 8192
|
||
drop:
|
||
generation_config:
|
||
temperature: 0.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 32768
|
||
hellaswag:
|
||
generation_config:
|
||
temperature: 0.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 8192
|
||
mmlu:
|
||
generation_config:
|
||
temperature: 0.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 8192
|
||
openai_mrcr:
|
||
generation_config:
|
||
temperature: 0.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 8192
|
||
bigcodebench:
|
||
generation_config:
|
||
temperature: 0.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 32768
|
||
humaneval:
|
||
generation_config:
|
||
temperature: 1.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 32768
|
||
gsm8k:
|
||
generation_config:
|
||
temperature: 0.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 32768
|
||
competition_math:
|
||
generation_config:
|
||
temperature: 0.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 32768
|
||
cmmlu:
|
||
generation_config:
|
||
temperature: 0.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 8192
|
||
trivia_qa:
|
||
generation_config:
|
||
temperature: 0.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 8192
|
||
winogrande:
|
||
generation_config:
|
||
temperature: 0.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 8192
|
||
longbench_v2:
|
||
generation_config:
|
||
temperature: 0.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 8192
|
||
dataset_args:
|
||
subset_list:
|
||
- short
|
||
- medium
|
||
- long
|
||
tau2_bench:
|
||
generation_config:
|
||
temperature: 0.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 16384
|
||
dataset_args:
|
||
extra_params:
|
||
user_model: deepseek-v4-pro
|
||
api_key: sk-9ed86ef546ca47e3afa7c3b014dea268
|
||
api_base: https://api.deepseek.com/v1
|
||
generation_config:
|
||
temperature: 0.0
|
||
max_tokens: 4096
|
||
agent_config:
|
||
mode: native
|
||
strategy: react
|
||
max_steps: 50
|
||
general_fc:
|
||
generation_config:
|
||
temperature: 0.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 4096
|
||
bfcl_v3:
|
||
generation_config:
|
||
temperature: 0.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 4096
|
||
parallel_tool_calls: true
|
||
dataset_args:
|
||
extra_params:
|
||
is_fc_model: true
|
||
underscore_to_dot: true
|
||
swe_bench_verified:
|
||
generation_config:
|
||
temperature: 0.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 32768
|
||
swe_bench_pro:
|
||
generation_config:
|
||
temperature: 0.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 32768
|
||
terminal_bench_v2_1:
|
||
# 单题 Harbor 异常(如 AgentTimeoutError)不中止整项;超时题不计入分数
|
||
ignore_errors: true
|
||
generation_config:
|
||
temperature: 0.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 8192
|
||
dataset_args:
|
||
extra_params:
|
||
# 任务默认 agent 时限约 900s;倍率 6 → 约 1 小时。绝对秒数用 agent_timeout_sec(勿与 agent_timeout_multiplier 同设)
|
||
timeout_multiplier: 6.0
|
||
max_turns: 200
|
||
# 上下窗口:context_limit > generation_config.max_tokens > --truncation-tokens > 100000
|
||
# 必须显式设 context_limit,否则 max_tokens=8192 会被当成上下文,terminus-2 几乎每轮摘要
|
||
context_limit: 65536
|
||
enable_summarize: true
|
||
proactive_summarization_threshold: 8000
|
||
aa_lcr:
|
||
generation_config:
|
||
temperature: 1.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 32768
|
||
scicode:
|
||
generation_config:
|
||
temperature: 1.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 32768
|
||
deep_swe:
|
||
generation_config:
|
||
temperature: 1.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 32768
|
||
dataset_args:
|
||
extra_params:
|
||
# 官方 Claude 等原生 provider 改 pier_route: native
|
||
pier_route: openai_compat
|
||
pier_model_prefix: openai
|
||
pier_agent_kwargs:
|
||
model_class: litellm
|
||
researchrubrics:
|
||
generation_config:
|
||
temperature: 1.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 32768
|
||
gdpval:
|
||
generation_config:
|
||
temperature: 1.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 32768
|
||
tau3_bench:
|
||
generation_config:
|
||
temperature: 1.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 16384
|
||
dataset_args:
|
||
subset_list:
|
||
- banking_knowledge
|
||
extra_params:
|
||
user_model: deepseek-v4-pro
|
||
api_key: sk-9ed86ef546ca47e3afa7c3b014dea268
|
||
api_base: https://api.deepseek.com/v1
|
||
generation_config:
|
||
temperature: 0.0
|
||
max_tokens: 4096
|
||
toolathlon:
|
||
generation_config:
|
||
temperature: 1.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 32768
|
||
dataset_args:
|
||
extra_params:
|
||
server_host: 127.0.0.1
|
||
server_port: 8080
|
||
ws_proxy_port: 8081
|
||
timeout_seconds: 14400
|
||
submit_timeout_seconds: 300
|
||
task_list:
|
||
- paper-checker
|
||
skip_container_restart: false
|
||
override_output_dir: true
|
||
browsecomp:
|
||
generation_config:
|
||
temperature: 1.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 32768
|
||
mcp_atlas:
|
||
generation_config:
|
||
temperature: 1.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 32768
|
||
officeqa:
|
||
generation_config:
|
||
temperature: 1.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 32768
|
||
dataset_args:
|
||
subset_list:
|
||
- officeqa_pro
|
||
deepsearchqa:
|
||
generation_config:
|
||
temperature: 1.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 32768
|
||
job_bench:
|
||
generation_config:
|
||
temperature: 1.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 32768
|
||
automation_bench:
|
||
generation_config:
|
||
temperature: 1.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 32768
|
||
dataset_args:
|
||
extra_params:
|
||
toolset: api
|
||
mmmu_pro:
|
||
generation_config:
|
||
temperature: 1.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 32768
|
||
dataset_args:
|
||
max_image_bytes: 5mb
|
||
extra_params:
|
||
dataset_format: standard (4 options)
|
||
charxiv:
|
||
generation_config:
|
||
temperature: 1.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 32768
|
||
dataset_args:
|
||
subset_list:
|
||
- reasoning
|
||
math_vision:
|
||
generation_config:
|
||
temperature: 1.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 32768
|
||
baby_vision:
|
||
generation_config:
|
||
temperature: 1.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 32768
|
||
zerobench:
|
||
generation_config:
|
||
temperature: 1.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 32768
|
||
dataset_args:
|
||
max_image_bytes: 10mb
|
||
world_vqa:
|
||
generation_config:
|
||
temperature: 1.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 32768
|
||
omni_doc_bench:
|
||
generation_config:
|
||
temperature: 1.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 32768
|
||
dataset_args:
|
||
extra_params:
|
||
match_method: quick_match
|
||
perception_bench:
|
||
generation_config:
|
||
temperature: 1.0
|
||
top_p: 1.0
|
||
stream: true
|
||
max_tokens: 32768
|