# GLM-5.3-NVFP4 SGLang TP=8 + DFlash2 speculative decoding profile (single RTX 6000D node, 8 GPUs). # 方案 E(2026-09-08 场景一补测,6000D-2)。 # 可执行部署脚本:experiments/pro6000/glm53_nvfp4_pro6000d_sglang_dual_scenario_bench/scripts/deploy_glm53_tp8_dflash2.sh # (v5 终版底稿,含四轮 OOM 战役完整教训注释;md5 5bf2b47c9349e5855b963e571e35c096) # # 关键点(实测踩坑,勿随意改): # - v5 配方核心:MRR 48→12(verify CUDA graph 4.04→0.83GB,真正起作用的杠杆)+ # --speculative-draft-window-size 2048 + mem0.85/cps8192。四轮 OOM 根因与推导见脚本头注释 # - DFLASH block-diffusion 草稿 7 tokens/步,draft 权重 GLM-5.3-DFlash2,fa4 draft # attention(fa4 会把 draft KV 强制 bf16,fp8 需换 flashinfer/triton 后端,仅省 0.35GB 未用) # - KV 池 243,584 token;kv fp8_e4m3 由模型配置自动带出(无需显式 flag) # - 底稿(本 profile LAUNCH_ARGS)radix/AR 均为禁用;场景一实测变体共四处 delta: # ① 去 --disable-radix-cache(90% 命中前提)② 去 --disable-custom-all-reduce # (v1 CAR 与方案 A 一致开启)③ 加 --context-length 270336 ④ 加 --reasoning-parser # glm45 --tool-call-parser glm47(质量门 7/7 的前提) # - 判决:场景一 8 点全部低于方案 C、7 点低于 A——DFlash accept 低于 EAGLE(同语料 # 2.53 vs 2.84)而每步墙钟相当,劣势全在接受率。投机栈选型维持 EAGLE3,勿用 # DFlash2 替换(性能问题非质量问题) # # 实测成绩:飞书《GLM-5.3-NVFP4 双场景压测报告》方案 E 行(文档 SZUSdEqY1oRVxGxgILBcHqPJnEc)。 # 质量:变体配置下质量门 7/7(GSM8K×5、中文推理、tool call 全过),DFlash 草稿无质量损失。 PLATFORM=pro6000 EXPERIMENT=glm53_nvfp4_pro6000_sglang_tp8dflash2 MODEL_NAME=GLM-5.3-NVFP4 ENGINE=sglang RUNTIME=docker DOCKER_IMAGE=lmsysorg/sglang:nightly-dev-20260828-daf63171 DOCKER_IMAGE_DIGEST=sha256:28e0d26073161e49ca56eba808d264a4223804a212020f1dfe1b2405b9f8a399 CONTAINER_NAME=glm53-tp8-dflash2 MODEL_PATH=/data/hf_models/GLM-5.3-NVFP4 DRAFT_MODEL_PATH=/data/hf_models/GLM-5.3-DFlash2 SERVED_MODEL_NAME=/data/hf_models/GLM-5.3-NVFP4 PORT=30000 HEALTH_PATH=/health HEALTH_WAIT_S=900 CONTAINER_PYTHON=python3 TP=8 MEM_FRACTION_STATIC=0.85 MAX_RUNNING_REQUESTS=12 CHUNKED_PREFILL_SIZE=8192 DEVICE_VARS="CUDA_VISIBLE_DEVICES=0,1,2,3,4,5,6,7" ENGINE_ENV="PYTHONUNBUFFERED=1 HF_HUB_OFFLINE=1 TRANSFORMERS_OFFLINE=1" DOCKER_FLAGS="--gpus all --shm-size 64g --ipc=host -p ${PORT}:${PORT}" VOLUMES="/data/hf_models:/data/hf_models" BOOTSTRAP="python3 -m sglang.launch_server ${LAUNCH_ARGS}" LAUNCH_ARGS="--model-path ${MODEL_PATH} --tp-size ${TP} --mem-fraction-static ${MEM_FRACTION_STATIC} --max-running-requests ${MAX_RUNNING_REQUESTS} --disable-radix-cache --disable-shared-experts-fusion --moe-runner-backend flashinfer_cutlass --disable-flashinfer-autotune --disable-custom-all-reduce --chunked-prefill-size ${CHUNKED_PREFILL_SIZE} --speculative-algorithm DFLASH --speculative-draft-model-path ${DRAFT_MODEL_PATH} --speculative-draft-attention-backend fa4 --speculative-draft-window-size 2048 --host 0.0.0.0 --port ${PORT} --json-model-override-args {\"index_topk_freq\": 4}"