- scripts: 11 个服务器原样脚本入库(md5 对照表更新至 README);D=60.1 生产原样配方、 E=v5 DFlash 底稿、F=PD 链四角色部署+launch+双场景压测驱动 - profiles: 新增 6 个 .env(D/E 单机 + F 四角色,均带镜像 digest sha256:28e0d260…,对齐 kimi3 PD 多角色先例) - deploy/PD_CHAIN.md: 方案 F 编排手册(启动顺序 mc-master→prefill→decode→router、 基础设施依赖表、质量门口径、拆链恢复、÷2 单机等效判决) - platforms/patches/pro6000/glm53_pd_chain/: sglang 补丁树 vs 镜像原版 11 文件 unified diff 快照——宿主树无 .git,此为唯一版本记录(DFlash+PP+PD 解锁全集) - deploy/manifests/: GLM-5.3-NVFP4(47分片)/GLM-5.3-DFlash2(单分片) 权重 md5 清单 - deploy/CURRENT.md: 全集群现役状态页(2026-09-08 八机实测) - deploy/verify_profile.sh: 防漂移核验工具(digest+参数 token 比对+端口/health, 已在 60.1 生产容器实测 PASS)
53 lines
2.9 KiB
Bash
53 lines
2.9 KiB
Bash
# GLM-5.3-NVFP4 SGLang TP=2 PP=4 deployment profile (single RTX 6000D node, 8 GPUs).
|
||
# 方案 D(2026-09-08 双场景补测;6000D-1 现役生产容器 glm53-pp4 的原样配方)。
|
||
# 可执行部署脚本:experiments/pro6000/glm53_nvfp4_pro6000d_sglang_dual_scenario_bench/scripts/deploy_glm53_pp4.sh
|
||
#
|
||
# 关键点(实测踩坑,勿随意改):
|
||
# - 脚本头注释是早期 TP4PP2 版残留(写"TP4 PP2 + IndexCache"),实际配置 TP=2 PP=4,
|
||
# 以脚本 docker run 段为准;md5 def3c64c5dc19e1d507080e3366c3762
|
||
# - 串行 prefill 有效速率 6.5-6.7k tok/s 为各方案最高;KV 池 1,040,384 token
|
||
# (A 的 3.76 倍,≈61.6 请求驻留,超过 MRR 48——池在高并发下不构成约束)
|
||
# - 场景二(16k 独立输入 cc8-64)成立:cc32 起反超 TP4PP2(方案B),cc40/64 输出
|
||
# 203.8/208.2 tok/s;TTFT p50 五档全档低于 B
|
||
# - 场景一(90% 命中长上下文)8/8 全败:TP2 长上下文每卡 KV 读量翻倍 + PP4 低并发
|
||
# 流水空泡,单请求 decode 仅 16-19 tok/s。生产态 radix off 前缀命中恒 0,实际表现
|
||
# 比报告 D 行(radix-on 最好情况)更差——长上下文/共享前缀负载勿用
|
||
# - DSA 实测:上下文长度不影响 TPOT(52.8ms 恒定),并发才是驱动
|
||
# - 上生产须补 --tool-call-parser glm47 与 --reasoning-parser glm45
|
||
# - bench 口径:场景二 cc40/64 用 nreq 80/128(与其他方案 40/64 单轮满波不同,
|
||
# 已在报告表注声明)
|
||
#
|
||
# 实测成绩:飞书《GLM-5.3-NVFP4 双场景压测报告》方案 D 行(文档 SZUSdEqY1oRVxGxgILBcHqPJnEc)。
|
||
# 质量:GSM8K×5 + 中文推理通过(6/7,tool call 为 parser 配置缺口)。
|
||
|
||
PLATFORM=pro6000
|
||
EXPERIMENT=glm53_nvfp4_pro6000_sglang_tp2pp4
|
||
MODEL_NAME=GLM-5.3-NVFP4
|
||
ENGINE=sglang
|
||
RUNTIME=docker
|
||
DOCKER_IMAGE=lmsysorg/sglang:nightly-dev-20260828-daf63171
|
||
DOCKER_IMAGE_DIGEST=sha256:28e0d26073161e49ca56eba808d264a4223804a212020f1dfe1b2405b9f8a399
|
||
CONTAINER_NAME=glm53-pp4
|
||
MODEL_PATH=/data/hf_models/GLM-5.3-NVFP4
|
||
SERVED_MODEL_NAME=/data/hf_models/GLM-5.3-NVFP4
|
||
PORT=30000
|
||
HEALTH_PATH=/health
|
||
HEALTH_WAIT_S=600
|
||
CONTAINER_PYTHON=python3
|
||
|
||
TP=2
|
||
PP=4
|
||
MEM_FRACTION_STATIC=0.85
|
||
MAX_RUNNING_REQUESTS=48
|
||
CHUNKED_PREFILL_SIZE=16384
|
||
|
||
DEVICE_VARS="CUDA_VISIBLE_DEVICES=0,1,2,3,4,5,6,7"
|
||
ENGINE_ENV="PYTHONUNBUFFERED=1 HF_HUB_OFFLINE=1 TRANSFORMERS_OFFLINE=1"
|
||
|
||
DOCKER_FLAGS="--gpus all --shm-size 64g --ipc=host -p ${PORT}:${PORT}"
|
||
VOLUMES="/data/hf_models:/data/hf_models"
|
||
|
||
BOOTSTRAP="python3 -m sglang.launch_server ${LAUNCH_ARGS}"
|
||
|
||
LAUNCH_ARGS="--model-path ${MODEL_PATH} --tp-size ${TP} --pp-size ${PP} --mem-fraction-static ${MEM_FRACTION_STATIC} --max-running-requests ${MAX_RUNNING_REQUESTS} --disable-radix-cache --disable-shared-experts-fusion --moe-runner-backend flashinfer_cutlass --disable-flashinfer-autotune --disable-custom-all-reduce --chunked-prefill-size ${CHUNKED_PREFILL_SIZE} --host 0.0.0.0 --port ${PORT} --json-model-override-args {\"index_topk_freq\": 4}"
|