sskj/deploy/CURRENT.md
yy-fighting 0d929948a5 60.4 redeploy: TP8+EAGLE+custom-AR 1stage (E7b recipe) replaces TP2PP4 (09-09)
CURRENT.md 60.4 行更新为 E7b 配方在役(EAGLE 4/1/5/mem0.90/MRR16/hicache3/图桶1-8,
CAR 补丁 8 rank 激活,质量门 7/7)。deploy_glm53_604_exp.sh 入库(=607 实验版逐字拷贝,
仅改 header;补丁 md5 与 car_patch/ 归档一致)。

注:本提交同时带入并行会话对 CURRENT.md 60.5(v2 容量脚本交付)与 60.8(TP2PP4-nomtp
容量口径在役)两行的未提交更新,内容为当日实测状态。
2026-09-09 15:55:43 +08:00

4.8 KiB
Raw Blame History

现役部署状态页live 核验于 2026-09-08

本页记录 174.1.60.x 集群"现在跑的是什么"。改动机器前后先读这页; 任何变动(停/起/改配置)完成后必须更新本页。核验命令:docker ps + nvidia-smi

机器状态2026-09-08 实测)

机器 在役 口径 / 归属 对应 profile
60.1 (6000D-1) glm53-pp4Up8 卡满载,:30000 方案 D 生产。09-08 PD 压测窗口停机 ~2.5h 后已恢复并核验 profiles/pro6000/glm53_nvfp4_pro6000_sglang_tp2pp4.env
60.2 (6000D-2) glm53-nvfp4 实验容器09-08 晚 TP1PP8 phaserun_phase.sh 实验链进行中) 他人实验进行中,勿动(方案 F PD 链已拆除GPU7 曾有外部裸金属任务)。动卡前仍先核实归属 profiles/pro6000/glm53_nvfp4_pro6000_pd_{prefill→decode 侧}.env
60.3 无容器,但 8 卡被外部裸金属训练占用(/data/mas/larm09-08 晚实测) 外部任务,勿动(此前台账漏记)
60.4 glm53-nvfp4Up:30000restart=unless-stopped TP8+EAGLE+custom-AR 1stageE7b 配方)在役09-09 下午部署EAGLE 4/1/5/mem0.90/MRR16/chunk8192/ctxlen270336/fp8KV+hicache3/decode 图桶 1-8/双 parserCAR 补丁三处全注入、8 rank SSKJ_CAR_PATCH_ACTIVE 确认health 200、生成冒烟、质量门 7/7 见 /root/qg_604_car.log)。启动 /root/deploy_glm53_604_exp.sh=60.7 实验版逐字拷贝,RESTART=yes CAR_PATCH=1),补丁 /root/patches/md5 与仓库 car_patch 归档一致)。当日早间曾短暂部署 TP2PP4 D 配方复刻deploy_s2_test_604.sh 留盘可切回)后被本方案替换;同日经授权清退外部 vllm 评测流水线tmux mas 的 run_multiseed.sh 链,--resume 可续跑) experiments/pro6000/glm53_nvfp4_pro6000d_sglang_dual_scenario_bench/scripts/deploy_glm53_604_exp.sh + car_patch/ 补丁快照)
60.5 glm53-nvfp4Up 29h NVFP4 团队生产deploy_glm53_605.shmd5 fcd9109b。生产机铁律不实验、不重启、不覆盖脚本。09-09 已交付容量扩容 v2 脚本TP2PP4-hicache 优胜配置,池 909,632/c6/单条 909k与 60.8 现役同款),未执行,择维护窗口跑 /root/deploy_glm53_605_v2.sh;回滚=原脚本 profiles/pro6000/glm53_nvfp4_pro6000_sglang_tp8eagle.env(方案 A 口径);待切 glm53_nvfp4_pro6000_sglang_tp2pp4_hicache.env
60.6 无容器,但 8 卡被外部裸金属实验占用(/data/hzy/sparse-opd-*09-08 晚实测) 外部任务,勿动(此前台账漏记)
60.7 基本空4 卡仍有 /home/user/dirA_exp 外部小任务09-08 晚实测) 09-08 已拆除清空(方案 F 前身单机实验 + 场景一深优资产留盘),不再恢复
60.8 glm53-nvfp4Up:30000restart=unless-stopped TP2PP4-nomtp 容量扩容口径在役09-09 按用户决定取代 r37TP2PP4 + radix/hicache 开 + ctx 1048576 + cu13 栈 9 挂载 + de-GLOOmemfrac 0.85/chunk 8192/MRR 16KV 池 909,632,启动 bash /root/deploy_ppmtp_r37.sh '--tp 2 --pp-size 4 --disable-overlap-schedule --max-prefill-tokens 16384 --disable-custom-all-reduce --context-length 1048576' nomtp 8192 0.85。四臂对拍优胜vs A-mirror/r37/B'i128k/o512 c1-4c4 输入/输出 5,907/23.1 tok/s、TTFT p50 43.4s、并发上限 c6、单条 ~909k900k 实跑、512k 单条 TTFT 88.4s、90% 命中 c4 输入 17,625 tok/s质量门 7/7。r37 的 MTP 优势区间是 i16k/cc≤16切回 = deploy_ppmtp_r37.sh mtp 模式(详见 experiments/pro6000/glm53_nvfp4_128k_capacity_topology/ profiles/pro6000/glm53_nvfp4_pro6000_sglang_tp2pp4_hicache.env;实验全量 experiments/pro6000/glm53_nvfp4_128k_capacity_topology/;前史 r37 experiments/pro6000/glm53_ppmtp_r37_verify_graph/

方案 A-F 一览GLM-5.3-NVFP4 @ pro60002026-09-08 双场景报告口径)

方案 一句话 profile / 脚本
A TP8 + EAGLE基准60.5 生产口径 glm53_nvfp4_pro6000_sglang_tp8eagle.env
B TP4 PP2 glm53_nvfp4_pro6000_sglang_tp4pp2.env
C TP4 PP2 + IndexCache(freq=4) glm53_nvfp4_pro6000_sglang_tp4pp2_index.env
D TP2 PP460.1 生产在役 glm53_nvfp4_pro6000_sglang_tp2pp4.env
E TP8 + DFlash2 投机 glm53_nvfp4_pro6000_sglang_tp8dflash2.env
F PD 分离双机链mc-master→prefill→decode→router glm53_nvfp4_pro6000_pd_{master,prefill,decode,router}.env + deploy/PD_CHAIN.md

压测数据飞书《GLM-5.3-NVFP4 双场景压测报告》(SZUSdEqY1oRVxGxgILBcHqPJnEc)。

防漂移

每个在役容器用 deploy/verify_profile.sh <profile.env> 定期核验(镜像 digest + 启动参数 + 端口),发现不一致 = 容器被人手改过,先查清归属再处理。