sskj/experiments/p800/glm52_w4a8_sglang_tp8_single_node

GLM-5.2 W4A8 P800 single-node smoke benchmark

  • Host: sskj-P800-4 (gpu051)
  • Image: iregistry.baidu-int.com/xpu/sglang-p800-pd-disagg-0510:20260715_5746
  • Model: /data2/GLM-5.2-w4a8
  • Parallelism: TP=8, EP=8, DP=1
  • Quantization: w4a8_int4; KV cache: int8
  • Dataset: /data1/wxy/sskj/datasets/ShareGPT_V3_unfiltered_cleaned_split.json
  • Benchmark: ShareGPT, 64 prompts, concurrency 8, output length 128, request rate unlimited

Run bash start_glm52_w4a8.sh, wait for http://127.0.0.1:30000/health, then run bash run_bench.sh.