sskj/deploy/profiles/pro6000/glm53_nvfp4_pro6000_sglang_tp8eagle.env
yy-fighting b3165a1d3c feat(pro6000/GLM-5.3): 部署方案入库(TP8+EAGLE 生产标准 / 场景二高并发变体 / TP4PP2+IndexCache / E7b CAR 实验补丁 + deploy profiles)
- deploy_glm53_605.sh:配置 A 生产标准(60.5 在役,全 8 台 md5 fcd9109b 一致),
  支持 MEMFRAC/STEPS/TOPK/DRAFT/CHUNK/EXTRA/RESTART 调参;场景二高并发变体
  仅改 mrr32 + decode 图 bs{4,8,12,16}(KV 池 16.4 驻留上限)
- deploy_glm53_optimal(_s1).sh:配置 B TP4PP2+IndexCache(场景二最优 +41~79%;
  s1 形态唯一差异 radix-on)
- deploy_glm53_607_exp.sh + car_patch/:E7b custom-AR 1stage 补丁(cc1 decode
  每步 -14~-16%,实验性仅 cc1-2 验证;补丁文件与 60.7:/root/patches md5 一致)
- deploy/profiles/pro6000/:两个标准 profile(sskj.deploy 可消费),关键踩坑
  与场景二变体、parser 缺口均在注释中标注
2026-09-08 11:38:06 +08:00

45 lines
2.8 KiB
Bash
Raw Permalink Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# GLM-5.3-NVFP4 SGLang TP=8 + EAGLE deployment profile (single RTX 6000D node, 8 GPUs).
# 生产标准配置174.1.60.5 团队自用在役2026-09-07 定稿)。
# 可执行部署脚本experiments/pro6000/glm53_nvfp4_pro6000d_sglang_dual_scenario_bench/scripts/deploy_glm53_605.sh
#
# 关键点(实测踩坑,勿随意改):
# - SM120 必需三项:--disable-shared-experts-fusion --moe-runner-backend
# flashinfer_cutlass --disable-flashinfer-autotune
# - EAGLE 4/1/5 为 cc1-2 均衡点3/1/4、5/1/6 在 ±10% 噪声内;树式 topk>1 在 DSA 上不可用;
# EAGLE3 本 nightly 不支持 GLM-5.3draft 模型自动从主权重加载
# - KV fp8_e4m3 + hicache-ratio 3 是长上下文 90% 前缀命中场景的容量前提KV 池 276,864 token
# - chunk 819216384 已 A/B 证伪MoE 工作区 OOM 风险,且 AR 带宽受限无次数红利)
# - 容器入口必须 python3 -m sglang.launch_server镜像 entrypoint 无 shebang
# - 重新部署前必须等显存排空docker rm -f 异步滞留数分钟,不等会把新 KV 池压小)
# - 场景二高并发变体16k 独立输入 cc8-32仅改 --max-running-requests 32 +
# --cuda-graph-max-bs-decode 16 --cuda-graph-bs-decode 4 8 12 16KV 池 276,864 ÷
# 16,896/req = 16.4 驻留上限decode 批自然 ≤16图覆盖到 bs16 即可bs24/32 纯耗显存)
# - 上线前后过质量门 quality_gate_605.shPASS=7/7
PLATFORM=pro6000
EXPERIMENT=glm53_nvfp4_pro6000_sglang_tp8eagle
MODEL_NAME=GLM-5.3-NVFP4
ENGINE=sglang
RUNTIME=docker
DOCKER_IMAGE=lmsysorg/sglang:nightly-dev-20260828-daf63171
CONTAINER_NAME=glm53-nvfp4
MODEL_PATH=/data/hf_models/GLM-5.3-NVFP4
SERVED_MODEL_NAME=/data/hf_models/GLM-5.3-NVFP4
PORT=30000
HEALTH_PATH=/health
HEALTH_WAIT_S=2400
CONTAINER_PYTHON=python3
TP=8
DP=1
DEVICE_VARS="CUDA_VISIBLE_DEVICES=0,1,2,3,4,5,6,7"
ENGINE_ENV="PYTHONUNBUFFERED=1 HF_HUB_OFFLINE=1 TRANSFORMERS_OFFLINE=1"
DOCKER_FLAGS="--gpus all --ipc=host --shm-size 64g --entrypoint '' -p ${PORT}:${PORT}"
VOLUMES="/data/hf_models:/data/hf_models:ro"
BOOTSTRAP="exec python3 -m sglang.launch_server ${LAUNCH_ARGS}"
LAUNCH_ARGS="--model-path ${MODEL_PATH} --tp-size ${TP} --mem-fraction-static 0.90 --max-running-requests 16 --chunked-prefill-size 8192 --max-prefill-tokens 16384 --disable-shared-experts-fusion --moe-runner-backend flashinfer_cutlass --disable-flashinfer-autotune --speculative-algorithm EAGLE --speculative-num-steps 4 --speculative-eagle-topk 1 --speculative-num-draft-tokens 5 --kv-cache-dtype fp8_e4m3 --enable-hierarchical-cache --hicache-ratio 3 --cuda-graph-max-bs-decode 8 --cuda-graph-bs-decode 1 2 3 4 6 8 --cuda-graph-max-bs-prefill 8 --context-length 270336 --reasoning-parser glm45 --tool-call-parser glm47 --host 0.0.0.0 --port ${PORT}"