6.5 KiB
DSV4-Flash 优化点迁移实验报告 — GLM-5.3-NVFP4 @ 60.1(6000D-1)
日期:2026-09-09 | 机器:174.1.60.1(8×RTX 6000D,SM120,无 NVLink 纯 PCIe) 基线:方案 D(TP2 PP4 mono,60.1 生产 glm53-pp4 原样配方) 口径:i16384 / o512 / cc∈{8,16,32,40,64},输出吞吐高者优(用户判定规则) 源报告:飞书《DSV4-Flash 优化日报》(A3Fmw6YePikH9lkRx8scN1UYngw) + 《DSV4-Flash 单机八卡推理优化完整报告》(Bby6wiQ9Bi8yGjkB6EIcG1CqnJe)
一、迁移性判定总表(先判后测)
| DSV4 优化点 | GLM-5.3 迁移判定 | 依据 |
|---|---|---|
| P0 native-heads(deepseek_v4.py) | N/A,不实验 | GLM 已原生直通 flashinfer(8/16/32-head 模板齐全),无中间层可剥 |
| P1 page-mark 向量化(BLOCK=1024) | 判死(双证据),压测前撤臂 | GLM 入口 flashinfer_sparse_mla_forward:607 直调 trtllm_batch_decode_with_kv_cache_mla,不经过 _split_kv_pages_to_64(page-mark 唯一入口,DSV4 SWA 专用);运行时 GLM serving 0 个 Triton kernel 启动。证据见 patches/page_mark_verdict_evidence.md |
| pdi/SWA 相关整族 | N/A | GLM-5.3 无滑动窗口注意力 |
| chunk2048+radix 命中 | N/A | 本场景 16k 独立输入无共享前缀,radix OFF 为既定口径 |
| flashinfer autotune + 持久 tactic 缓存 | 可迁移 → 实验(arm2) | DSV4 E2 实测 autotune-on + 持久缓存胜 autotune-off ~7%;GLM 同为 flashinfer 栈 |
| PCIe-IPC AllReduce 包(PR#34528 + fi#4393) | 可迁移 → 实验(arm3) | 同代 SM120 无 NVLink 平台同痛点;DSV4 TP4 实测 +1.8% |
| 最新镜像(sglang 0.5.19 + flashinfer 0.6.18) | 可迁移 → 实验(0b) | 用户加测;DSV4 团队验证过、IPC manifest 指定镜像 |
| DeepGEMM MoE runner / dsa-topk flashinfer / AR-fusion | 勿碰 | DSV4 报告负结果 + 本集群已知 SM120 门禁(见双场景报告勿碰清单) |
二、实验臂与判决
| 臂 | 配置 | 判决 |
|---|---|---|
| 0a | D 配置 @ nightly-dev-20260828(生产镜像) | 基线带 102.2/148.2/191.1/198.4/208.2,与 mono 战役发表 D 数字交叉一致 |
| 0b | D 配置 @ latest(d6e72886, 0.5.19+fi0.6.18) | 与 0a 差 ≤0.7% 全点持平 → 按用户规则转 latest 跑后续臂(镜像中性,无回归) |
| 1 | page-mark 向量化 | 压测前撤销(双证据判死,省一整轮),见判定总表 |
| 2 | latest + autotune-on + 持久 SGLANG_CACHE_DIR/fi_jit_cache | 五点全胜 +1.2~+3.2%(唯一胜者):104.8/151.1/195.0/200.6/210.0;cc16/32/64 分布与基线不重叠;TPOT 全点改善(−2~−4.6%);代价 available_gpu_mem 15.64→11.79 GB(≈3.9GB/卡 tactic 缓冲),KV 池不缩(1,040,384);门 6/7 不变 |
| 3 | latest + PCIe-IPC 12 文件包 + 双 env 开关 | 五点全降判负:97.9/143.2/187.1/197.3/204.5(−0.4~−3.5%),cc8/16/32/64 分布不重叠(方向为劣),TPOT 全点变差;8 rank 均确认 FlashInfer PCIe-IPC all-reduce enabled (world=2)——激活正确、真输。机制:TP2 单对端 NCCL AR 走同 switch P2P 已近最优,IPC 工作区拷贝+跨块同步纯倒贴;DSV4 的 +1.8% 本就是 TP4 口径,TP 度越低收益越小,TP2 翻负。与既有结论「TP2 AR≈free」互证 |
| 4 | 冠军组合 | 不需要(唯一胜者 autotune 已完整测量=arm2) |
| 5 | 回切确认:stock-latest 全新部署 1 轮 | PASS:102.6/147.0/190.9/200.6/207.8 全落 0b 基线带(缓存已热,无 0b r1 式冷 JIT 压低),且低于 arm2 → A/B/A 闭环,autotune 增益判定为因果非环境漂移 |
原始数据:results/results_raw.md。
三、优胜配置交付(已入档未执行)
推荐部署 = 方案 D 配方升级两处:镜像换 latest + 开 autotune(持久缓存)
镜像: lmsysorg/sglang:latest (sha256:d6e7288627be8b02be88e4bba38e73f6d50e2826869f753c13a4c4385ab3eda9
= sglang 0.5.19 + flashinfer 0.6.18;生产现役 nightly-dev-20260828 同 digest 已本地 tag 为 dev)
启动: python3 -m sglang.launch_server --model-path /data/hf_models/GLM-5.3-NVFP4 \
--tp-size 2 --pp-size 4 --mem-fraction-static 0.85 --max-running-requests 48 \
--disable-radix-cache --disable-shared-experts-fusion \
--moe-runner-backend flashinfer_cutlass \
--disable-custom-all-reduce --chunked-prefill-size 16384 \
--host 0.0.0.0 --port 30000 --json-model-override-args '{"index_topk_freq": 4}'
# 相对现役:镜像 nightly-dev→latest;删 --disable-flashinfer-autotune;其余逐字不变
挂载(新增,持久化必需): -v <host>/fi_jit_cache:/root/.cache/flashinfer \
-v <host>/sglang_cache:/root/.cache/sglang \
-e SGLANG_CACHE_DIR=/root/.cache/sglang
关键运维纪律(DSV4 §12.6 同款教训):autotune 增益钉在 tactic 缓存上。 SGLANG_CACHE_DIR / flashinfer JIT 缓存必须挂载到宿主持久盘——否则每次重部署 重抽 tactic 签,轻则增益消失、重则抽到差 tactic 比关闭还慢,且引入不可复现性。 缓存目录随部署资产同迁移(本实验用 /data/glm53_exp/{fi_jit_cache,sglang_cache})。
上生产另须补 --tool-call-parser glm47 --reasoning-parser glm45(D 配置既有缺口)。
profile:deploy/profiles/pro6000/glm53_nvfp4_pro6000_sglang_tp2pp4_latest_autotune.env
部署器:scripts/deploy_glm53_exp.sh(EXP_NAME=x EXP_IMAGE=lmsysorg/sglang:latest AUTOTUNE=1)
四、机器状态与还原
- 原生产容器
glm53-pp4配置全程未动,实验后docker start还原(health 核验) dsv4_scan(DSV4 团队扫描容器,实验前确认已跑完 45min 无日志无 GPU 占用,经授权 stop) 保持停止,还原说明在 60.1:/root/dsv4_scan_restore_note.txt(docker start dsv4_scan即还原)- 实验容器 glm53-exp0a/0b/2/3/5 全部拆除,/data/glm53_exp/(缓存+补丁+日志)留盘
五、资产清单
scripts/:deploy_glm53_exp.sh(参数化部署器)/ run_exp_s2.sh(五点单轮)/ run_arm_chain.sh(门+3轮链)patches/:page_mark_verdict_evidence.md(判死证据)+ base_flash_mla_sm120.py (两镜像共有基础模块 md5 9df4d50d)+ page_mark_vectorized/ + native_heads/(N/A 留档)- pcie_ipc_v1/(12 文件判负快照,sha256 校验 ok=12)
results/results_raw.md:逐轮原始数据 + 中位对比 + TPOT + 显存口径- 远端:60.1 /root/{deploy_glm53_exp.sh,run_exp_s2.sh,run_arm_chain.sh}、 /root/bench_logs/exp_*.log、/data/glm53_exp/{logs,patches,inject}