6.5 KiB
Raw Permalink Blame History

DSV4-Flash 优化点迁移实验报告 — GLM-5.3-NVFP4 @ 60.16000D-1

日期2026-09-09 机器174.1.60.18×RTX 6000DSM120无 NVLink 纯 PCIe 基线:方案 DTP2 PP4 mono60.1 生产 glm53-pp4 原样配方) 口径i16384 / o512 / cc∈{8,16,32,40,64},输出吞吐高者优(用户判定规则) 源报告飞书《DSV4-Flash 优化日报》(A3Fmw6YePikH9lkRx8scN1UYngw) + 《DSV4-Flash 单机八卡推理优化完整报告》(Bby6wiQ9Bi8yGjkB6EIcG1CqnJe)

一、迁移性判定总表(先判后测)

DSV4 优化点 GLM-5.3 迁移判定 依据
P0 native-headsdeepseek_v4.py N/A不实验 GLM 已原生直通 flashinfer8/16/32-head 模板齐全),无中间层可剥
P1 page-mark 向量化BLOCK=1024 判死(双证据),压测前撤臂 GLM 入口 flashinfer_sparse_mla_forward:607 直调 trtllm_batch_decode_with_kv_cache_mla不经过 _split_kv_pages_to_64page-mark 唯一入口DSV4 SWA 专用);运行时 GLM serving 0 个 Triton kernel 启动。证据见 patches/page_mark_verdict_evidence.md
pdi/SWA 相关整族 N/A GLM-5.3 无滑动窗口注意力
chunk2048+radix 命中 N/A 本场景 16k 独立输入无共享前缀radix OFF 为既定口径
flashinfer autotune + 持久 tactic 缓存 可迁移 → 实验arm2 DSV4 E2 实测 autotune-on + 持久缓存胜 autotune-off ~7%GLM 同为 flashinfer 栈
PCIe-IPC AllReduce 包PR#34528 + fi#4393 可迁移 → 实验arm3 同代 SM120 无 NVLink 平台同痛点DSV4 TP4 实测 +1.8%
最新镜像sglang 0.5.19 + flashinfer 0.6.18 可迁移 → 实验0b 用户加测DSV4 团队验证过、IPC manifest 指定镜像
DeepGEMM MoE runner / dsa-topk flashinfer / AR-fusion 勿碰 DSV4 报告负结果 + 本集群已知 SM120 门禁(见双场景报告勿碰清单)

二、实验臂与判决

配置 判决
0a D 配置 @ nightly-dev-20260828生产镜像 基线带 102.2/148.2/191.1/198.4/208.2,与 mono 战役发表 D 数字交叉一致
0b D 配置 @ latest(d6e72886, 0.5.19+fi0.6.18) 与 0a 差 ≤0.7% 全点持平 → 按用户规则转 latest 跑后续臂(镜像中性,无回归)
1 page-mark 向量化 压测前撤销(双证据判死,省一整轮),见判定总表
2 latest + autotune-on + 持久 SGLANG_CACHE_DIR/fi_jit_cache 五点全胜 +1.2~+3.2%(唯一胜者)104.8/151.1/195.0/200.6/210.0cc16/32/64 分布与基线不重叠TPOT 全点改善(2~4.6%);代价 available_gpu_mem 15.64→11.79 GB≈3.9GB/卡 tactic 缓冲KV 池不缩(1,040,384);门 6/7 不变
3 latest + PCIe-IPC 12 文件包 + 双 env 开关 五点全降判负97.9/143.2/187.1/197.3/204.50.4~3.5%cc8/16/32/64 分布不重叠方向为劣TPOT 全点变差8 rank 均确认 FlashInfer PCIe-IPC all-reduce enabled (world=2)——激活正确、真输。机制TP2 单对端 NCCL AR 走同 switch P2P 已近最优IPC 工作区拷贝+跨块同步纯倒贴DSV4 的 +1.8% 本就是 TP4 口径TP 度越低收益越小TP2 翻负。与既有结论「TP2 AR≈free」互证
4 冠军组合 不需要(唯一胜者 autotune 已完整测量=arm2
5 回切确认stock-latest 全新部署 1 轮 PASS102.6/147.0/190.9/200.6/207.8 全落 0b 基线带(缓存已热,无 0b r1 式冷 JIT 压低),且低于 arm2 → A/B/A 闭环,autotune 增益判定为因果非环境漂移

原始数据:results/results_raw.md

三、优胜配置交付(已入档未执行)

推荐部署 = 方案 D 配方升级两处:镜像换 latest + 开 autotune持久缓存

镜像: lmsysorg/sglang:latest  (sha256:d6e7288627be8b02be88e4bba38e73f6d50e2826869f753c13a4c4385ab3eda9
       = sglang 0.5.19 + flashinfer 0.6.18;生产现役 nightly-dev-20260828 同 digest 已本地 tag 为 dev)
启动: python3 -m sglang.launch_server --model-path /data/hf_models/GLM-5.3-NVFP4 \
  --tp-size 2 --pp-size 4 --mem-fraction-static 0.85 --max-running-requests 48 \
  --disable-radix-cache --disable-shared-experts-fusion \
  --moe-runner-backend flashinfer_cutlass \
  --disable-custom-all-reduce --chunked-prefill-size 16384 \
  --host 0.0.0.0 --port 30000 --json-model-override-args '{"index_topk_freq": 4}'
  # 相对现役:镜像 nightly-dev→latest删 --disable-flashinfer-autotune其余逐字不变
挂载(新增,持久化必需): -v <host>/fi_jit_cache:/root/.cache/flashinfer \
                        -v <host>/sglang_cache:/root/.cache/sglang \
                        -e SGLANG_CACHE_DIR=/root/.cache/sglang

关键运维纪律DSV4 §12.6 同款教训)autotune 增益钉在 tactic 缓存上。 SGLANG_CACHE_DIR / flashinfer JIT 缓存必须挂载到宿主持久盘——否则每次重部署 重抽 tactic 签,轻则增益消失、重则抽到差 tactic 比关闭还慢,且引入不可复现性。 缓存目录随部署资产同迁移(本实验用 /data/glm53_exp/{fi_jit_cache,sglang_cache})。

上生产另须补 --tool-call-parser glm47 --reasoning-parser glm45D 配置既有缺口)。

profiledeploy/profiles/pro6000/glm53_nvfp4_pro6000_sglang_tp2pp4_latest_autotune.env 部署器:scripts/deploy_glm53_exp.shEXP_NAME=x EXP_IMAGE=lmsysorg/sglang:latest AUTOTUNE=1

四、机器状态与还原

  • 原生产容器 glm53-pp4 配置全程未动,实验后 docker start 还原health 核验)
  • dsv4_scanDSV4 团队扫描容器,实验前确认已跑完 45min 无日志无 GPU 占用,经授权 stop 保持停止,还原说明在 60.1:/root/dsv4_scan_restore_note.txtdocker start dsv4_scan 即还原)
  • 实验容器 glm53-exp0a/0b/2/3/5 全部拆除,/data/glm53_exp/(缓存+补丁+日志)留盘

五、资产清单

  • scripts/deploy_glm53_exp.sh参数化部署器/ run_exp_s2.sh五点单轮/ run_arm_chain.sh门+3轮链
  • patches/page_mark_verdict_evidence.md判死证据+ base_flash_mla_sm120.py (两镜像共有基础模块 md5 9df4d50d+ page_mark_vectorized/ + native_heads/N/A 留档)
    • pcie_ipc_v1/12 文件判负快照sha256 校验 ok=12
  • results/results_raw.md:逐轮原始数据 + 中位对比 + TPOT + 显存口径
  • 远端60.1 /root/{deploy_glm53_exp.sh,run_exp_s2.sh,run_arm_chain.sh}、 /root/bench_logs/exp_*.log、/data/glm53_exp/{logs,patches,inject}