sskj/deploy/CURRENT.md
yy-fighting 498e333730 CURRENT.md: 60.4 now serving TP2PP4 GLM-5.3-NVFP4 (D-recipe replica, 09-09)
60.4 经授权清退外部 vllm 评测流水线(tmux mas / run_multiseed.sh 链,--resume 可续跑)
后部署 D 生产配方复刻:TP2/PP4/mem0.85/MRR48/chunk16384/radix-off/无投机,
restart=unless-stopped,health 200 + 生成冒烟通过。启动脚本 60.4:/root/deploy_s2_test_604.sh
(基于 exp602/deploy_s2_test.sh,唯一改动 restart 策略)。
2026-09-09 10:55:59 +08:00

4.2 KiB
Raw Blame History

现役部署状态页live 核验于 2026-09-08

本页记录 174.1.60.x 集群"现在跑的是什么"。改动机器前后先读这页; 任何变动(停/起/改配置)完成后必须更新本页。核验命令:docker ps + nvidia-smi

机器状态2026-09-08 实测)

机器 在役 口径 / 归属 对应 profile
60.1 (6000D-1) glm53-pp4Up8 卡满载,:30000 方案 D 生产。09-08 PD 压测窗口停机 ~2.5h 后已恢复并核验 profiles/pro6000/glm53_nvfp4_pro6000_sglang_tp2pp4.env
60.2 (6000D-2) glm53-nvfp4 实验容器09-08 晚 TP1PP8 phaserun_phase.sh 实验链进行中) 他人实验进行中,勿动(方案 F PD 链已拆除GPU7 曾有外部裸金属任务)。动卡前仍先核实归属 profiles/pro6000/glm53_nvfp4_pro6000_pd_{prefill→decode 侧}.env
60.3 无容器,但 8 卡被外部裸金属训练占用(/data/mas/larm09-08 晚实测) 外部任务,勿动(此前台账漏记)
60.4 glm53-nvfp4Up:30000restart=unless-stopped09-09 部署) TP2PP4 GLM-5.3-NVFP4 在役60.1 方案 D 生产配方复刻TP2/PP4/mem0.85/MRR48/chunk16384/radix-off/无投机/SM120 三件套/disable-custom-all-reduce/index_topk_freq=4镜像 nightly-dev-20260828-daf63171health 200、生成冒烟通过。09-09 经授权清退外部 vllm 评测流水线tmux mas 的 run_multiseed.sh 链,带 --resume 可续跑)后部署;启动脚本 /root/deploy_s2_test_604.sh(基于 exp602/deploy_s2_test.sh唯一改动 restart=unless-stopped。旧 dsv4_scan 容器仍在盘Exited profiles/pro6000/glm53_nvfp4_pro6000_sglang_tp2pp4.env(同 60.1 D 口径)
60.5 glm53-nvfp4Up 29h NVFP4 团队生产deploy_glm53_605.shmd5 fcd9109b。生产机铁律不实验、不重启、不覆盖脚本 profiles/pro6000/glm53_nvfp4_pro6000_sglang_tp8eagle.env(方案 A 口径)
60.6 无容器,但 8 卡被外部裸金属实验占用(/data/hzy/sparse-opd-*09-08 晚实测) 外部任务,勿动(此前台账漏记)
60.7 基本空4 卡仍有 /home/user/dirA_exp 外部小任务09-08 晚实测) 09-08 已拆除清空(方案 F 前身单机实验 + 场景一深优资产留盘),不再恢复
60.8 glm53-nvfp4Up:30000restart=unless-stopped r37 PP+MTP verify-graph 口径在役09-08 深夜取代 A16TP4PP2 + EAGLE 3/1/4 + verify CUDA graph + draft eager + de-GLOO + SYNC_MASK=1279 挂载文件,启动 bash /root/deploy_ppmtp_r37.sh '--tp 4 --pp-size 2 --disable-overlap-schedule --max-prefill-tokens 16384' mtp 8192 0.88 1 1 0 0)。质量门 7/7 ×2、conc_test×3、killer×6 零崩溃killer cc16 双种子 63.8/64.7s vs A16 105.6/96.0s-40%、TPOT 41.5/39.3ms、TTFT 33s vs 58-61s近乎减半。修复根因=pre-planned 早退路径缺 pp_proxy 补拷(详见 experiments/pro6000/glm53_ppmtp_r37_verify_graph/。A16 切回脚本 deploy_glm53_605.sh 留盘sglang_patch2/eagle_worker_common.py 已升级 bisect 版("1"/"0" 语义兼容) experiments/pro6000/glm53_ppmtp_r37_verify_graph/patches+scripts+results 全量);前史 experiments/pro6000/glm53_ppmtp_r36_degloo/

方案 A-F 一览GLM-5.3-NVFP4 @ pro60002026-09-08 双场景报告口径)

方案 一句话 profile / 脚本
A TP8 + EAGLE基准60.5 生产口径 glm53_nvfp4_pro6000_sglang_tp8eagle.env
B TP4 PP2 glm53_nvfp4_pro6000_sglang_tp4pp2.env
C TP4 PP2 + IndexCache(freq=4) glm53_nvfp4_pro6000_sglang_tp4pp2_index.env
D TP2 PP460.1 生产在役 glm53_nvfp4_pro6000_sglang_tp2pp4.env
E TP8 + DFlash2 投机 glm53_nvfp4_pro6000_sglang_tp8dflash2.env
F PD 分离双机链mc-master→prefill→decode→router glm53_nvfp4_pro6000_pd_{master,prefill,decode,router}.env + deploy/PD_CHAIN.md

压测数据飞书《GLM-5.3-NVFP4 双场景压测报告》(SZUSdEqY1oRVxGxgILBcHqPJnEc)。

防漂移

每个在役容器用 deploy/verify_profile.sh <profile.env> 定期核验(镜像 digest + 启动参数 + 端口),发现不一致 = 容器被人手改过,先查清归属再处理。