# GLM-5.2 W4A8 P800 single-node smoke benchmark - Host: `sskj-P800-4` (`gpu051`) - Image: `iregistry.baidu-int.com/xpu/sglang-p800-pd-disagg-0510:20260715_5746` - Model: `/data2/GLM-5.2-w4a8` - Parallelism: TP=8, EP=8, DP=1 - Quantization: `w4a8_int4`; KV cache: `int8` - Dataset: `/data1/wxy/sskj/datasets/ShareGPT_V3_unfiltered_cleaned_split.json` - Benchmark: ShareGPT, 64 prompts, concurrency 8, output length 128, request rate unlimited Run `bash start_glm52_w4a8.sh`, wait for `http://127.0.0.1:30000/health`, then run `bash run_bench.sh`.