From 0c89fd4fbea0db9db2071df2f78403c64c3bc466 Mon Sep 17 00:00:00 2001 From: yy-fighting <2351884576@qq.com> Date: Wed, 9 Sep 2026 09:24:43 +0800 Subject: [PATCH] r37 addendum: nomtp sweep raw logs (primary evidence, force-added past *.log ignore) --- .../results/nomtp_sweep_all.log | 36 ++++++++++++ .../results/nomtpsweep_cc16.log | 56 +++++++++++++++++++ .../results/nomtpsweep_cc32.log | 56 +++++++++++++++++++ .../results/nomtpsweep_cc40.log | 56 +++++++++++++++++++ .../results/nomtpsweep_cc64.log | 56 +++++++++++++++++++ .../results/nomtpsweep_cc8.log | 56 +++++++++++++++++++ 6 files changed, 316 insertions(+) create mode 100644 experiments/pro6000/glm53_ppmtp_r37_verify_graph/results/nomtp_sweep_all.log create mode 100644 experiments/pro6000/glm53_ppmtp_r37_verify_graph/results/nomtpsweep_cc16.log create mode 100644 experiments/pro6000/glm53_ppmtp_r37_verify_graph/results/nomtpsweep_cc32.log create mode 100644 experiments/pro6000/glm53_ppmtp_r37_verify_graph/results/nomtpsweep_cc40.log create mode 100644 experiments/pro6000/glm53_ppmtp_r37_verify_graph/results/nomtpsweep_cc64.log create mode 100644 experiments/pro6000/glm53_ppmtp_r37_verify_graph/results/nomtpsweep_cc8.log diff --git a/experiments/pro6000/glm53_ppmtp_r37_verify_graph/results/nomtp_sweep_all.log b/experiments/pro6000/glm53_ppmtp_r37_verify_graph/results/nomtp_sweep_all.log new file mode 100644 index 0000000..b2b7cc1 --- /dev/null +++ b/experiments/pro6000/glm53_ppmtp_r37_verify_graph/results/nomtp_sweep_all.log @@ -0,0 +1,36 @@ +=== cc=8 nreq=16 seed=6508 start 08:47:29 === +=== cc=8 done rc=0 08:49:27 === +Successful requests: 16 +Benchmark duration (s): 78.92 +Output token throughput (tok/s): 103.81 +Mean TTFT (ms): 18179.50 +Mean TPOT (ms): 41.59 +=== cc=16 nreq=32 seed=6516 start 08:49:27 === +=== cc=16 done rc=0 08:52:00 === +Successful requests: 32 +Benchmark duration (s): 128.71 +Output token throughput (tok/s): 127.29 +Mean TTFT (ms): 30898.35 +Mean TPOT (ms): 48.53 +=== cc=32 nreq=64 seed=6532 start 08:52:00 === +=== cc=32 done rc=0 08:56:29 === +Successful requests: 64 +Benchmark duration (s): 244.71 +Output token throughput (tok/s): 133.91 +Mean TTFT (ms): 74930.30 +Mean TPOT (ms): 48.54 +=== cc=40 nreq=80 seed=6540 start 08:56:29 === +=== cc=40 done rc=0 09:02:00 === +Successful requests: 80 +Benchmark duration (s): 304.60 +Output token throughput (tok/s): 134.47 +Mean TTFT (ms): 93857.54 +Mean TPOT (ms): 53.23 +=== cc=64 nreq=128 seed=6564 start 09:02:00 === +=== cc=64 done rc=0 09:10:18 === +Successful requests: 128 +Benchmark duration (s): 473.55 +Output token throughput (tok/s): 138.39 +Mean TTFT (ms): 161310.10 +Mean TPOT (ms): 50.23 +SWEEP-DONE diff --git a/experiments/pro6000/glm53_ppmtp_r37_verify_graph/results/nomtpsweep_cc16.log b/experiments/pro6000/glm53_ppmtp_r37_verify_graph/results/nomtpsweep_cc16.log new file mode 100644 index 0000000..ba7d83f --- /dev/null +++ b/experiments/pro6000/glm53_ppmtp_r37_verify_graph/results/nomtpsweep_cc16.log @@ -0,0 +1,56 @@ +/sgl-workspace/sglang/python/sglang/bench_serving.py:13: FutureWarning: `sglang.bench_serving` is deprecated and will be removed in a future release; use `sglang.benchmark.serving` instead (e.g. `python -m sglang.benchmark.serving`). + warnings.warn( +benchmark_args=Namespace(backend='sglang', base_url=None, host='127.0.0.1', port=30000, ready_check_timeout_sec=60, dataset_name='random-ids', dataset_path='', dataset_offset=0, agentic_max_turns=None, speed_bench_category=None, speed_bench_output_len=512, model=None, served_model_name=None, tokenizer='/data/hf_models/GLM-5.3-NVFP4', num_prompts=32, sharegpt_output_len=None, sharegpt_context_len=None, random_input_len=16384, random_output_len=512, random_range_ratio=1.0, image_count=1, image_resolution='1080p', random_image_count=False, image_format='jpeg', image_content='random', request_rate=inf, use_trace_timestamps=False, max_concurrency=16, output_file='/data/hf_models/bs_results/nomtpsweep_cc16.json', output_details=False, print_requests=False, disable_tqdm=False, disable_stream=False, return_logprob=False, top_logprobs_num=0, token_ids_logprob=None, logprob_start_len=-1, return_routed_experts=False, cache_report=False, seed=6516, disable_ignore_eos=False, temperature=0.0, top_p=1.0, extra_request_body=None, apply_chat_template=False, profile=False, plot_throughput=False, profile_activities=['CPU', 'GPU'], profile_start_step=None, profile_steps=None, profile_num_steps=None, profile_by_stage=False, profile_stages=None, profile_output_dir=None, profile_prefix=None, lora_name=None, lora_request_distribution='uniform', lora_zipf_alpha=1.5, prompt_suffix='', pd_separated=False, profile_prefill_url=None, profile_decode_url=None, flush_cache=True, flush_cache_timeout=60.0, warmup_requests=1, tokenize_prompt=False, gsp_num_groups=64, gsp_prompts_per_group=16, gsp_system_prompt_len=2048, gsp_question_len=128, gsp_output_len=256, gsp_range_ratio=1.0, gsp_fast_prepare=False, gsp_send_routing_key=False, gsp_num_turns=1, gsp_ordered=False, gsp_group_distribution='uniform', gsp_zipf_alpha=None, mooncake_slowdown_factor=1.0, mooncake_num_rounds=1, mooncake_workload='conversation', fake_prefill=False, tag=None, header=None) +Waiting up to 60s for http://127.0.0.1:30000/v1/models to become ready... +Server ready in 0.0s. +Namespace(backend='sglang', base_url=None, host='127.0.0.1', port=30000, ready_check_timeout_sec=60, dataset_name='random-ids', dataset_path='', dataset_offset=0, agentic_max_turns=None, speed_bench_category=None, speed_bench_output_len=512, model='/data/hf_models/GLM-5.3-NVFP4', served_model_name=None, tokenizer='/data/hf_models/GLM-5.3-NVFP4', num_prompts=32, sharegpt_output_len=None, sharegpt_context_len=None, random_input_len=16384, random_output_len=512, random_range_ratio=1.0, image_count=1, image_resolution='1080p', random_image_count=False, image_format='jpeg', image_content='random', request_rate=inf, use_trace_timestamps=False, max_concurrency=16, output_file='/data/hf_models/bs_results/nomtpsweep_cc16.json', output_details=False, print_requests=False, disable_tqdm=False, disable_stream=False, return_logprob=False, top_logprobs_num=0, token_ids_logprob=None, logprob_start_len=-1, return_routed_experts=False, cache_report=False, seed=6516, disable_ignore_eos=False, temperature=0.0, top_p=1.0, extra_request_body=None, apply_chat_template=False, profile=False, plot_throughput=False, profile_activities=['CPU', 'GPU'], profile_start_step=None, profile_steps=None, profile_num_steps=None, profile_by_stage=False, profile_stages=None, profile_output_dir=None, profile_prefix=None, lora_name=None, lora_request_distribution='uniform', lora_zipf_alpha=1.5, prompt_suffix='', pd_separated=False, profile_prefill_url=None, profile_decode_url=None, flush_cache=True, flush_cache_timeout=60.0, warmup_requests=1, tokenize_prompt=False, gsp_num_groups=64, gsp_prompts_per_group=16, gsp_system_prompt_len=2048, gsp_question_len=128, gsp_output_len=256, gsp_range_ratio=1.0, gsp_fast_prepare=False, gsp_send_routing_key=False, gsp_num_turns=1, gsp_ordered=False, gsp_group_distribution='uniform', gsp_zipf_alpha=None, mooncake_slowdown_factor=1.0, mooncake_num_rounds=1, mooncake_workload='conversation', fake_prefill=False, tag=None, header=None) + +#Input tokens: 524288 +#Output tokens: 16384 +Starting warmup with 1 sequences... +Warmup completed with 1 sequences. Starting main benchmark run... + 0%| | 0/32 [00:00