诊断 60.5 排队根因:KV 池 276,864 token 纯容量算术(MLA KV 按 PP 分层切分, 池≈PP 度数倍增;TP8 调参无解,fp8 断言封顶 314,944 < c3 需求 394,752)。 四臂对拍(i128k/o512 冷缓存 cc1-4,PG19 真实语料同窗口映射): - A-mirror(60.5 现状):c3 起容量排队,cc4 TTFT p50 119.6s,痛点复现 - r37(TP4PP2+MTP):池 384,960,c3 起排队 - B'(TP4PP2 nomtp):池 589,696,c4 零排队 - TP2PP4 nomtp 池 909,632 优胜:cc4 in 5907 / out 23.1 tok/s, TTFT p50 全场最优(cc1 15.5s),e2e 88.8s 优胜者验证全过:质量门 7/7;512k 单条 TTFT 88.4s;900k 单条可完成 (单条上限 ~909k 实证);并发上限 c6(cc7 第 7 条起排队);hit90 cc4 输入吞吐 17,625 tok/s、TTFT 7.3s。 60.8 末态:TP2PP4 容器在役(restart=unless-stopped)。 60.5 交付:deploy_glm53_605_v2.sh(一键部署+前置检查,原脚本=回滚路径)。 资产:arm_runner.sh / val_runner.sh / all_summaries.json(26 点全量) / profile glm53_nvfp4_pro6000_sglang_tp2pp4_hicache.env / CURRENT.md 两行更新。
4.6 KiB
4.6 KiB
现役部署状态页(live 核验于 2026-09-08)
本页记录 174.1.60.x 集群"现在跑的是什么"。改动机器前后先读这页; 任何变动(停/起/改配置)完成后必须更新本页。核验命令:
docker ps+nvidia-smi。
机器状态(2026-09-08 实测)
| 机器 | 在役 | 口径 / 归属 | 对应 profile |
|---|---|---|---|
| 60.1 (6000D-1) | glm53-pp4(Up,8 卡满载,:30000) |
方案 D 生产。09-08 PD 压测窗口停机 ~2.5h 后已恢复并核验 | profiles/pro6000/glm53_nvfp4_pro6000_sglang_tp2pp4.env |
| 60.2 (6000D-2) | glm53-nvfp4 实验容器(09-08 晚 TP1PP8 phase,run_phase.sh 实验链进行中) |
他人实验进行中,勿动(方案 F PD 链已拆除;GPU7 曾有外部裸金属任务)。动卡前仍先核实归属 | profiles/pro6000/glm53_nvfp4_pro6000_pd_{prefill→decode 侧}.env |
| 60.3 | 无容器,但 8 卡被外部裸金属训练占用(/data/mas/larm,09-08 晚实测) |
外部任务,勿动(此前台账漏记) | — |
| 60.4 | glm53-nvfp4(Up,:30000,restart=unless-stopped,09-09 部署) |
TP2PP4 GLM-5.3-NVFP4 在役(60.1 方案 D 生产配方复刻:TP2/PP4/mem0.85/MRR48/chunk16384/radix-off/无投机/SM120 三件套/disable-custom-all-reduce/index_topk_freq=4,镜像 nightly-dev-20260828-daf63171;health 200、生成冒烟通过)。09-09 经授权清退外部 vllm 评测流水线(tmux mas 的 run_multiseed.sh 链,带 --resume 可续跑)后部署;启动脚本 /root/deploy_s2_test_604.sh(基于 exp602/deploy_s2_test.sh,唯一改动 restart=unless-stopped)。旧 dsv4_scan 容器仍在盘(Exited) |
profiles/pro6000/glm53_nvfp4_pro6000_sglang_tp2pp4.env(同 60.1 D 口径) |
| 60.5 | glm53-nvfp4(Up 29h) |
NVFP4 团队生产(deploy_glm53_605.sh,md5 fcd9109b)。生产机铁律:不实验、不重启、不覆盖脚本。09-09 已交付容量扩容 v2 脚本(TP2PP4-hicache 优胜配置,池 909,632/c6/单条 909k,与 60.8 现役同款),未执行,择维护窗口跑 /root/deploy_glm53_605_v2.sh;回滚=原脚本 |
profiles/pro6000/glm53_nvfp4_pro6000_sglang_tp8eagle.env(方案 A 口径);待切 glm53_nvfp4_pro6000_sglang_tp2pp4_hicache.env |
| 60.6 | 无容器,但 8 卡被外部裸金属实验占用(/data/hzy/sparse-opd-*,09-08 晚实测) |
外部任务,勿动(此前台账漏记) | — |
| 60.7 | 基本空(4 卡仍有 /home/user/dirA_exp 外部小任务,09-08 晚实测) |
09-08 已拆除清空(方案 F 前身单机实验 + 场景一深优资产留盘),不再恢复 | — |
| 60.8 | glm53-nvfp4(Up,:30000,restart=unless-stopped) |
TP2PP4-nomtp 容量扩容口径在役(09-09 按用户决定取代 r37:TP2PP4 + radix/hicache 开 + ctx 1048576 + cu13 栈 9 挂载 + de-GLOO,memfrac 0.85/chunk 8192/MRR 16,KV 池 909,632,启动 bash /root/deploy_ppmtp_r37.sh '--tp 2 --pp-size 4 --disable-overlap-schedule --max-prefill-tokens 16384 --disable-custom-all-reduce --context-length 1048576' nomtp 8192 0.85)。四臂对拍优胜(vs A-mirror/r37/B',i128k/o512 c1-4):c4 输入/输出 5,907/23.1 tok/s、TTFT p50 43.4s、并发上限 c6、单条 ~909k(900k 实跑)、512k 单条 TTFT 88.4s、90% 命中 c4 输入 17,625 tok/s;质量门 7/7。r37 的 MTP 优势区间是 i16k/cc≤16,切回 = deploy_ppmtp_r37.sh mtp 模式(详见 experiments/pro6000/glm53_nvfp4_128k_capacity_topology/) |
profiles/pro6000/glm53_nvfp4_pro6000_sglang_tp2pp4_hicache.env;实验全量 experiments/pro6000/glm53_nvfp4_128k_capacity_topology/;前史 r37 experiments/pro6000/glm53_ppmtp_r37_verify_graph/ |
方案 A-F 一览(GLM-5.3-NVFP4 @ pro6000,2026-09-08 双场景报告口径)
| 方案 | 一句话 | profile / 脚本 |
|---|---|---|
| A | TP8 + EAGLE,基准;60.5 生产口径 | glm53_nvfp4_pro6000_sglang_tp8eagle.env |
| B | TP4 PP2 | glm53_nvfp4_pro6000_sglang_tp4pp2.env |
| C | TP4 PP2 + IndexCache(freq=4) | glm53_nvfp4_pro6000_sglang_tp4pp2_index.env |
| D | TP2 PP4;60.1 生产在役 | glm53_nvfp4_pro6000_sglang_tp2pp4.env |
| E | TP8 + DFlash2 投机 | glm53_nvfp4_pro6000_sglang_tp8dflash2.env |
| F | PD 分离双机链(mc-master→prefill→decode→router) | glm53_nvfp4_pro6000_pd_{master,prefill,decode,router}.env + deploy/PD_CHAIN.md |
压测数据:飞书《GLM-5.3-NVFP4 双场景压测报告》(SZUSdEqY1oRVxGxgILBcHqPJnEc)。
防漂移
每个在役容器用 deploy/verify_profile.sh <profile.env> 定期核验(镜像 digest + 启动参数 +
端口),发现不一致 = 容器被人手改过,先查清归属再处理。