gpqa_diamond: generation_config: temperature: 1.0 top_p: 1.0 stream: true max_tokens: 8192 hle: generation_config: temperature: 0.0 top_p: 1.0 stream: true max_tokens: 32768 aime24: generation_config: temperature: 1.0 top_p: 1.0 stream: true max_tokens: 32768 aime25: generation_config: temperature: 1.0 top_p: 1.0 stream: true max_tokens: 32768 mmlu_pro: generation_config: temperature: 0.0 top_p: 1.0 stream: true max_tokens: 8192 simple_qa: generation_config: temperature: 0.0 top_p: 1.0 stream: true max_tokens: 8192 arc: generation_config: temperature: 0.0 top_p: 1.0 stream: true max_tokens: 8192 bbh: generation_config: temperature: 0.0 top_p: 1.0 stream: true max_tokens: 32768 live_code_bench: generation_config: temperature: 1.0 top_p: 1.0 stream: true max_tokens: 32768 dataset_args: subset_list: - release_v6 aime26: generation_config: temperature: 1.0 top_p: 1.0 stream: true max_tokens: 32768 hmmt26: generation_config: temperature: 1.0 top_p: 1.0 stream: true max_tokens: 32768 imo_answerbench: generation_config: temperature: 1.0 top_p: 1.0 stream: true max_tokens: 32768 super_gpqa: generation_config: temperature: 0.0 top_p: 1.0 stream: true max_tokens: 8192 drop: generation_config: temperature: 0.0 top_p: 1.0 stream: true max_tokens: 32768 hellaswag: generation_config: temperature: 0.0 top_p: 1.0 stream: true max_tokens: 8192 mmlu: generation_config: temperature: 0.0 top_p: 1.0 stream: true max_tokens: 8192 openai_mrcr: generation_config: temperature: 0.0 top_p: 1.0 stream: true max_tokens: 8192 bigcodebench: generation_config: temperature: 0.0 top_p: 1.0 stream: true max_tokens: 32768 humaneval: generation_config: temperature: 1.0 top_p: 1.0 stream: true max_tokens: 32768 gsm8k: generation_config: temperature: 0.0 top_p: 1.0 stream: true max_tokens: 32768 competition_math: generation_config: temperature: 0.0 top_p: 1.0 stream: true max_tokens: 32768 cmmlu: generation_config: temperature: 0.0 top_p: 1.0 stream: true max_tokens: 8192 trivia_qa: generation_config: temperature: 0.0 top_p: 1.0 stream: true max_tokens: 8192 winogrande: generation_config: temperature: 0.0 top_p: 1.0 stream: true max_tokens: 8192 longbench_v2: generation_config: temperature: 0.0 top_p: 1.0 stream: true max_tokens: 8192 dataset_args: subset_list: - short - medium - long tau2_bench: generation_config: temperature: 0.0 top_p: 1.0 stream: true max_tokens: 16384 dataset_args: extra_params: user_model: deepseek-v4-pro api_key: sk-9ed86ef546ca47e3afa7c3b014dea268 api_base: https://api.deepseek.com/v1 generation_config: temperature: 0.0 max_tokens: 4096 agent_config: mode: native strategy: react max_steps: 50 general_fc: generation_config: temperature: 0.0 top_p: 1.0 stream: true max_tokens: 4096 bfcl_v3: generation_config: temperature: 0.0 top_p: 1.0 stream: true max_tokens: 4096 parallel_tool_calls: true dataset_args: extra_params: is_fc_model: true underscore_to_dot: true