- deploy_glm53_605.sh:配置 A 生产标准(60.5 在役,全 8 台 md5 fcd9109b 一致),
支持 MEMFRAC/STEPS/TOPK/DRAFT/CHUNK/EXTRA/RESTART 调参;场景二高并发变体
仅改 mrr32 + decode 图 bs{4,8,12,16}(KV 池 16.4 驻留上限)
- deploy_glm53_optimal(_s1).sh:配置 B TP4PP2+IndexCache(场景二最优 +41~79%;
s1 形态唯一差异 radix-on)
- deploy_glm53_607_exp.sh + car_patch/:E7b custom-AR 1stage 补丁(cc1 decode
每步 -14~-16%,实验性仅 cc1-2 验证;补丁文件与 60.7:/root/patches md5 一致)
- deploy/profiles/pro6000/:两个标准 profile(sskj.deploy 可消费),关键踩坑
与场景二变体、parser 缺口均在注释中标注
45 lines
2.8 KiB
Bash
45 lines
2.8 KiB
Bash
# GLM-5.3-NVFP4 SGLang TP=8 + EAGLE deployment profile (single RTX 6000D node, 8 GPUs).
|
||
# 生产标准配置(174.1.60.5 团队自用在役,2026-09-07 定稿)。
|
||
# 可执行部署脚本:experiments/pro6000/glm53_nvfp4_pro6000d_sglang_dual_scenario_bench/scripts/deploy_glm53_605.sh
|
||
#
|
||
# 关键点(实测踩坑,勿随意改):
|
||
# - SM120 必需三项:--disable-shared-experts-fusion --moe-runner-backend
|
||
# flashinfer_cutlass --disable-flashinfer-autotune
|
||
# - EAGLE 4/1/5 为 cc1-2 均衡点(3/1/4、5/1/6 在 ±10% 噪声内;树式 topk>1 在 DSA 上不可用;
|
||
# EAGLE3 本 nightly 不支持 GLM-5.3);draft 模型自动从主权重加载
|
||
# - KV fp8_e4m3 + hicache-ratio 3 是长上下文 90% 前缀命中场景的容量前提(KV 池 276,864 token)
|
||
# - chunk 8192:16384 已 A/B 证伪(MoE 工作区 OOM 风险,且 AR 带宽受限无次数红利)
|
||
# - 容器入口必须 python3 -m sglang.launch_server(镜像 entrypoint 无 shebang)
|
||
# - 重新部署前必须等显存排空(docker rm -f 异步滞留数分钟,不等会把新 KV 池压小)
|
||
# - 场景二高并发变体(16k 独立输入 cc8-32):仅改 --max-running-requests 32 +
|
||
# --cuda-graph-max-bs-decode 16 --cuda-graph-bs-decode 4 8 12 16(KV 池 276,864 ÷
|
||
# 16,896/req = 16.4 驻留上限,decode 批自然 ≤16,图覆盖到 bs16 即可,bs24/32 纯耗显存)
|
||
# - 上线前后过质量门 quality_gate_605.sh(PASS=7/7)
|
||
|
||
PLATFORM=pro6000
|
||
EXPERIMENT=glm53_nvfp4_pro6000_sglang_tp8eagle
|
||
MODEL_NAME=GLM-5.3-NVFP4
|
||
ENGINE=sglang
|
||
RUNTIME=docker
|
||
DOCKER_IMAGE=lmsysorg/sglang:nightly-dev-20260828-daf63171
|
||
CONTAINER_NAME=glm53-nvfp4
|
||
MODEL_PATH=/data/hf_models/GLM-5.3-NVFP4
|
||
SERVED_MODEL_NAME=/data/hf_models/GLM-5.3-NVFP4
|
||
PORT=30000
|
||
HEALTH_PATH=/health
|
||
HEALTH_WAIT_S=2400
|
||
CONTAINER_PYTHON=python3
|
||
|
||
TP=8
|
||
DP=1
|
||
|
||
DEVICE_VARS="CUDA_VISIBLE_DEVICES=0,1,2,3,4,5,6,7"
|
||
ENGINE_ENV="PYTHONUNBUFFERED=1 HF_HUB_OFFLINE=1 TRANSFORMERS_OFFLINE=1"
|
||
|
||
DOCKER_FLAGS="--gpus all --ipc=host --shm-size 64g --entrypoint '' -p ${PORT}:${PORT}"
|
||
VOLUMES="/data/hf_models:/data/hf_models:ro"
|
||
|
||
BOOTSTRAP="exec python3 -m sglang.launch_server ${LAUNCH_ARGS}"
|
||
|
||
LAUNCH_ARGS="--model-path ${MODEL_PATH} --tp-size ${TP} --mem-fraction-static 0.90 --max-running-requests 16 --chunked-prefill-size 8192 --max-prefill-tokens 16384 --disable-shared-experts-fusion --moe-runner-backend flashinfer_cutlass --disable-flashinfer-autotune --speculative-algorithm EAGLE --speculative-num-steps 4 --speculative-eagle-topk 1 --speculative-num-draft-tokens 5 --kv-cache-dtype fp8_e4m3 --enable-hierarchical-cache --hicache-ratio 3 --cuda-graph-max-bs-decode 8 --cuda-graph-bs-decode 1 2 3 4 6 8 --cuda-graph-max-bs-prefill 8 --context-length 270336 --reasoning-parser glm45 --tool-call-parser glm47 --host 0.0.0.0 --port ${PORT}"
|