GLM-5.2 W4A8 P800 single-node smoke benchmark
- Host:
sskj-P800-4(gpu051) - Image:
iregistry.baidu-int.com/xpu/sglang-p800-pd-disagg-0510:20260715_5746 - Model:
/data2/GLM-5.2-w4a8 - Parallelism: TP=8, EP=8, DP=1
- Quantization:
w4a8_int4; KV cache:int8 - Dataset:
/data1/wxy/sskj/datasets/ShareGPT_V3_unfiltered_cleaned_split.json - Benchmark: ShareGPT, 64 prompts, concurrency 8, output length 128, request rate unlimited
Run bash start_glm52_w4a8.sh, wait for http://127.0.0.1:30000/health, then run bash run_bench.sh.