gpqa_diamond: generation_config: temperature: 1.0 top_p: 1.0 stream: true max_tokens: 8192 max_completion_tokens: 64000 hle: generation_config: temperature: 0.0 top_p: 1.0 stream: true max_tokens: 32768 max_completion_tokens: 64000 aime24: generation_config: temperature: 1.0 top_p: 1.0 stream: true max_tokens: 32768 max_completion_tokens: 64000 aime25: generation_config: temperature: 1.0 top_p: 1.0 stream: true max_tokens: 65536 max_completion_tokens: 64000 mmlu_pro: generation_config: temperature: 0.0 top_p: 1.0 stream: true max_tokens: 8192 max_completion_tokens: 64000 simple_qa: generation_config: temperature: 0.0 top_p: 1.0 stream: true max_tokens: 8192 max_completion_tokens: 64000 arc: generation_config: temperature: 0.0 top_p: 1.0 stream: true max_tokens: 8192 max_completion_tokens: 64000 bbh: generation_config: temperature: 0.0 top_p: 1.0 stream: true max_tokens: 32768 max_completion_tokens: 64000 live_code_bench: generation_config: temperature: 1.0 top_p: 1.0 stream: true max_tokens: 65536 max_completion_tokens: 64000 dataset_args: subset_list: - release_v6 aime26: generation_config: temperature: 1.0 top_p: 1.0 stream: true max_tokens: 65536 max_completion_tokens: 64000 hmmt26: generation_config: temperature: 1.0 top_p: 1.0 stream: true max_tokens: 32768 max_completion_tokens: 64000 imo_answerbench: generation_config: temperature: 1.0 top_p: 1.0 stream: true max_tokens: 32768 max_completion_tokens: 64000 super_gpqa: generation_config: temperature: 0.0 top_p: 1.0 stream: true max_tokens: 8192 max_completion_tokens: 64000 drop: generation_config: temperature: 0.0 top_p: 1.0 stream: true max_tokens: 32768 max_completion_tokens: 64000 hellaswag: generation_config: temperature: 0.0 top_p: 1.0 stream: true max_tokens: 8192 max_completion_tokens: 64000 mmlu: generation_config: temperature: 0.0 top_p: 1.0 stream: true max_tokens: 8192 max_completion_tokens: 64000 openai_mrcr: generation_config: temperature: 0.0 top_p: 1.0 stream: true max_tokens: 8192 max_completion_tokens: 64000 bigcodebench: generation_config: temperature: 0.0 top_p: 1.0 stream: true max_tokens: 32768 max_completion_tokens: 64000 humaneval: generation_config: temperature: 1.0 top_p: 1.0 stream: true max_tokens: 32768 max_completion_tokens: 64000 gsm8k: generation_config: temperature: 0.0 top_p: 1.0 stream: true max_tokens: 32768 max_completion_tokens: 64000 competition_math: generation_config: temperature: 0.0 top_p: 1.0 stream: true max_tokens: 32768 max_completion_tokens: 64000 cmmlu: generation_config: temperature: 0.0 top_p: 1.0 stream: true max_tokens: 8192 max_completion_tokens: 64000 trivia_qa: generation_config: temperature: 0.0 top_p: 1.0 stream: true max_tokens: 8192 max_completion_tokens: 64000 winogrande: generation_config: temperature: 0.0 top_p: 1.0 stream: true max_tokens: 8192 max_completion_tokens: 64000 longbench_v2: generation_config: temperature: 0.0 top_p: 1.0 stream: true max_tokens: 8192 max_completion_tokens: 64000 dataset_args: subset_list: - short - medium - long tau2_bench: generation_config: temperature: 0.0 top_p: 1.0 stream: true max_tokens: 16384 max_completion_tokens: 64000 dataset_args: extra_params: user_model: deepseek-v4-pro api_key: sk-9ed86ef546ca47e3afa7c3b014dea268 api_base: https://api.deepseek.com/v1 generation_config: temperature: 0.0 max_tokens: 4096 max_completion_tokens: 64000 agent_config: mode: native strategy: react max_steps: 50 general_fc: generation_config: temperature: 0.0 top_p: 1.0 stream: true max_tokens: 4096 max_completion_tokens: 64000 bfcl_v3: generation_config: temperature: 0.0 top_p: 1.0 stream: true max_tokens: 4096 max_completion_tokens: 64000 parallel_tool_calls: true dataset_args: extra_params: is_fc_model: true underscore_to_dot: true swe_bench_verified: generation_config: temperature: 0.0 top_p: 1.0 stream: true max_tokens: 32768 max_completion_tokens: 64000 swe_bench_pro: generation_config: temperature: 0.0 top_p: 1.0 stream: true max_tokens: 32768 max_completion_tokens: 64000