# DSV4-Flash 优化点迁移实验报告 — GLM-5.3-NVFP4 @ 60.1(6000D-1) 日期:2026-09-09 | 机器:174.1.60.1(8×RTX 6000D,SM120,无 NVLink 纯 PCIe) 基线:方案 D(TP2 PP4 mono,60.1 生产 glm53-pp4 原样配方) 口径:i16384 / o512 / cc∈{8,16,32,40,64},输出吞吐高者优(用户判定规则) 源报告:飞书《DSV4-Flash 优化日报》(A3Fmw6YePikH9lkRx8scN1UYngw) + 《DSV4-Flash 单机八卡推理优化完整报告》(Bby6wiQ9Bi8yGjkB6EIcG1CqnJe) ## 一、迁移性判定总表(先判后测) | DSV4 优化点 | GLM-5.3 迁移判定 | 依据 | |---|---|---| | P0 native-heads(deepseek_v4.py) | **N/A,不实验** | GLM 已原生直通 flashinfer(8/16/32-head 模板齐全),无中间层可剥 | | P1 page-mark 向量化(BLOCK=1024) | **判死(双证据),压测前撤臂** | GLM 入口 `flashinfer_sparse_mla_forward:607` 直调 trtllm_batch_decode_with_kv_cache_mla,不经过 `_split_kv_pages_to_64`(page-mark 唯一入口,DSV4 SWA 专用);运行时 GLM serving 0 个 Triton kernel 启动。证据见 `patches/page_mark_verdict_evidence.md` | | pdi/SWA 相关整族 | **N/A** | GLM-5.3 无滑动窗口注意力 | | chunk2048+radix 命中 | **N/A** | 本场景 16k 独立输入无共享前缀,radix OFF 为既定口径 | | flashinfer autotune + 持久 tactic 缓存 | **可迁移 → 实验(arm2)** | DSV4 E2 实测 autotune-on + 持久缓存胜 autotune-off ~7%;GLM 同为 flashinfer 栈 | | PCIe-IPC AllReduce 包(PR#34528 + fi#4393) | **可迁移 → 实验(arm3)** | 同代 SM120 无 NVLink 平台同痛点;DSV4 TP4 实测 +1.8% | | 最新镜像(sglang 0.5.19 + flashinfer 0.6.18) | **可迁移 → 实验(0b)** | 用户加测;DSV4 团队验证过、IPC manifest 指定镜像 | | DeepGEMM MoE runner / dsa-topk flashinfer / AR-fusion | **勿碰** | DSV4 报告负结果 + 本集群已知 SM120 门禁(见双场景报告勿碰清单) | ## 二、实验臂与判决 | 臂 | 配置 | 判决 | |---|---|---| | 0a | D 配置 @ nightly-dev-20260828(生产镜像) | 基线带 102.2/148.2/191.1/198.4/208.2,与 mono 战役发表 D 数字交叉一致 | | 0b | D 配置 @ latest(d6e72886, 0.5.19+fi0.6.18) | 与 0a 差 ≤0.7% 全点持平 → **按用户规则转 latest 跑后续臂**(镜像中性,无回归) | | 1 | page-mark 向量化 | **压测前撤销**(双证据判死,省一整轮),见判定总表 | | 2 | latest + autotune-on + 持久 SGLANG_CACHE_DIR/fi_jit_cache | **五点全胜 +1.2~+3.2%(唯一胜者)**:104.8/151.1/195.0/200.6/210.0;cc16/32/64 分布与基线不重叠;TPOT 全点改善(−2~−4.6%);代价 available_gpu_mem 15.64→11.79 GB(≈3.9GB/卡 tactic 缓冲),KV 池不缩(1,040,384);门 6/7 不变 | | 3 | latest + PCIe-IPC 12 文件包 + 双 env 开关 | **五点全降判负**:97.9/143.2/187.1/197.3/204.5(−0.4~−3.5%),cc8/16/32/64 分布不重叠(方向为劣),TPOT 全点变差;8 rank 均确认 `FlashInfer PCIe-IPC all-reduce enabled (world=2)`——激活正确、真输。机制:TP2 单对端 NCCL AR 走同 switch P2P 已近最优,IPC 工作区拷贝+跨块同步纯倒贴;DSV4 的 +1.8% 本就是 TP4 口径,TP 度越低收益越小,TP2 翻负。与既有结论「TP2 AR≈free」互证 | | 4 | 冠军组合 | 不需要(唯一胜者 autotune 已完整测量=arm2) | | 5 | 回切确认:stock-latest 全新部署 1 轮 | **PASS**:102.6/147.0/190.9/200.6/207.8 全落 0b 基线带(缓存已热,无 0b r1 式冷 JIT 压低),且低于 arm2 → A/B/A 闭环,**autotune 增益判定为因果非环境漂移** | 原始数据:`results/results_raw.md`。 ## 三、优胜配置交付(已入档未执行) **推荐部署 = 方案 D 配方升级两处:镜像换 latest + 开 autotune(持久缓存)** ``` 镜像: lmsysorg/sglang:latest (sha256:d6e7288627be8b02be88e4bba38e73f6d50e2826869f753c13a4c4385ab3eda9 = sglang 0.5.19 + flashinfer 0.6.18;生产现役 nightly-dev-20260828 同 digest 已本地 tag 为 dev) 启动: python3 -m sglang.launch_server --model-path /data/hf_models/GLM-5.3-NVFP4 \ --tp-size 2 --pp-size 4 --mem-fraction-static 0.85 --max-running-requests 48 \ --disable-radix-cache --disable-shared-experts-fusion \ --moe-runner-backend flashinfer_cutlass \ --disable-custom-all-reduce --chunked-prefill-size 16384 \ --host 0.0.0.0 --port 30000 --json-model-override-args '{"index_topk_freq": 4}' # 相对现役:镜像 nightly-dev→latest;删 --disable-flashinfer-autotune;其余逐字不变 挂载(新增,持久化必需): -v /fi_jit_cache:/root/.cache/flashinfer \ -v /sglang_cache:/root/.cache/sglang \ -e SGLANG_CACHE_DIR=/root/.cache/sglang ``` **关键运维纪律(DSV4 §12.6 同款教训)**:autotune 增益钉在 tactic 缓存上。 SGLANG_CACHE_DIR / flashinfer JIT 缓存**必须挂载到宿主持久盘**——否则每次重部署 重抽 tactic 签,轻则增益消失、重则抽到差 tactic 比关闭还慢,且引入不可复现性。 缓存目录随部署资产同迁移(本实验用 /data/glm53_exp/{fi_jit_cache,sglang_cache})。 上生产另须补 `--tool-call-parser glm47 --reasoning-parser glm45`(D 配置既有缺口)。 profile:`deploy/profiles/pro6000/glm53_nvfp4_pro6000_sglang_tp2pp4_latest_autotune.env` 部署器:`scripts/deploy_glm53_exp.sh`(EXP_NAME=x EXP_IMAGE=lmsysorg/sglang:latest AUTOTUNE=1) ## 四、机器状态与还原 - 原生产容器 `glm53-pp4` 配置全程未动,实验后 `docker start` 还原(health 核验) - `dsv4_scan`(DSV4 团队扫描容器,实验前确认已跑完 45min 无日志无 GPU 占用,经授权 stop) 保持停止,还原说明在 60.1:/root/dsv4_scan_restore_note.txt(`docker start dsv4_scan` 即还原) - 实验容器 glm53-exp0a/0b/2/3/5 全部拆除,/data/glm53_exp/(缓存+补丁+日志)留盘 ## 五、资产清单 - `scripts/`:deploy_glm53_exp.sh(参数化部署器)/ run_exp_s2.sh(五点单轮)/ run_arm_chain.sh(门+3轮链) - `patches/`:page_mark_verdict_evidence.md(判死证据)+ base_flash_mla_sm120.py (两镜像共有基础模块 md5 9df4d50d)+ page_mark_vectorized/ + native_heads/(N/A 留档) + pcie_ipc_v1/(12 文件判负快照,sha256 校验 ok=12) - `results/results_raw.md`:逐轮原始数据 + 中位对比 + TPOT + 显存口径 - 远端:60.1 /root/{deploy_glm53_exp.sh,run_exp_s2.sh,run_arm_chain.sh}、 /root/bench_logs/exp_*.log、/data/glm53_exp/{logs,patches,inject}