sskj/deploy/CURRENT.md
yy-fighting c5d91ceafe b300-equivalent matrix: E7b high-concurrency retest (MRR64 + decode-graph buckets 1-64) - graph-drop cliff fixed, report numbers overwritten in place
- deploy_glm53_e7b_hicc.sh (md5 165db732): only delta vs 607_exp = MRR 16->64 + cuda-graph-bs-decode 1..64; KV pool 276,480 unchanged, avail 6.11GB after capture
- 10 retest points (16K/4.1/4.2 at c8/16/32/64) all OK, hit=0.0 (fresh container = recycled windows virgin again), 0 retraction, QG 7/7
- verdicts: 16K output 92.1/97.6/99.6 (+18~33% vs initial, still TP2PP4-dominated, prefill wall ~100 plateau); 4.1 c32/64 229/272 (gap narrowed to 1.2x); 4.2 402/676/826.5 - E7b wins ALL cc tiers, c64 826.5 tok/s = machine-wide best output (+72% vs TP2PP4 482), TTFT 12.18s / TPOT 85.1ms; c8 anchors within +-3% prove no env drift
- REPORT.md + Feishu A7V3wZTQeifCB4krdi6cA834nW9 overwritten in place (user directive: no appended chapter); initial MRR16 run archived as baseline in results/e7b/
- provenance.md: e7b64 VRAM (idle 79.3k, peak 83,627 MiB), second in-service restore verified (fired up/health 200/16K+C4 spot/KV pool 647,040 identical)
2026-09-10 18:52:54 +08:00

7.1 KiB
Raw Blame History

现役部署状态页live 核验于 2026-09-1060.8 当日核验;其余机器 09-09 口径)

本页记录 174.1.60.x 集群"现在跑的是什么"。改动机器前后先读这页; 任何变动(停/起/改配置)完成后必须更新本页。核验命令:docker ps + nvidia-smi

机器状态2026-09-09 实测)

机器 在役 口径 / 归属 对应 profile
60.1 (6000D-1) glm53-pp4Up8 卡满载,:30000 方案 D 生产。09-09 DSV4 优化点迁移实验窗口停机 ~7h 后已恢复并核验09-08 PD 窗口 2.5h 前史)。升级路径已交付未执行latest 镜像(d6e72886=sglang0.5.19+fi0.6.18)+开 autotune+持久 SGLANG_CACHE_DIR/fi_jit_cache 挂载16k/512 cc8-64 五点 +1.2+3.2%A/B/A 回切确认因果),代价 ~3.9GB/卡 tactic 缓冲、KV 池不缩profile ..._tp2pp4_latest_autotune.env,实验全量 experiments/pro6000/glm53_nvfp4_dsv4_migration_bench/。同轮判决PCIe-IPC AR 包五点全降判负勿叠用page-mark 向量化对 GLM 双证据判死GLM 入口不经过该 kerneldsv4_scanDSV4 团队扫描容器)经授权保持停止,还原说明 /root/dsv4_scan_restore_note.txt profiles/pro6000/glm53_nvfp4_pro6000_sglang_tp2pp4.env(现役);升级候选 ..._tp2pp4_latest_autotune.env
60.2 (6000D-2) glm53-nvfp4 实验容器09-08 晚 TP1PP8 phaserun_phase.sh 实验链进行中) 他人实验进行中,勿动(方案 F PD 链已拆除GPU7 曾有外部裸金属任务)。动卡前仍先核实归属 profiles/pro6000/glm53_nvfp4_pro6000_pd_{prefill→decode 侧}.env
60.3 无容器,但 8 卡被外部裸金属训练占用(/data/mas/larm09-08 晚实测) 外部任务,勿动(此前台账漏记)
60.4 glm53-nvfp4Up:30000restart=unless-stopped TP8+EAGLE+custom-AR 1stageE7b 配方)在役09-09 下午部署EAGLE 4/1/5/mem0.90/MRR16/chunk8192/ctxlen270336/fp8KV+hicache3/decode 图桶 1-8/双 parserCAR 补丁三处全注入、8 rank SSKJ_CAR_PATCH_ACTIVE 确认health 200、生成冒烟、质量门 7/7 见 /root/qg_604_car.log)。启动 /root/deploy_glm53_604_exp.sh=60.7 实验版逐字拷贝,RESTART=yes CAR_PATCH=1),补丁 /root/patches/md5 与仓库 car_patch 归档一致)。当日早间曾短暂部署 TP2PP4 D 配方复刻deploy_s2_test_604.sh 留盘可切回)后被本方案替换;同日经授权清退外部 vllm 评测流水线tmux mas 的 run_multiseed.sh 链,--resume 可续跑) experiments/pro6000/glm53_nvfp4_pro6000d_sglang_dual_scenario_bench/scripts/deploy_glm53_604_exp.sh + car_patch/ 补丁快照)
60.5 glm53-nvfp4Up 2d09-09 只读核验) NVFP4 团队生产deploy_glm53_605.shmd5 fcd9109b。生产机铁律不实验、不重启、不覆盖脚本。交付升级路径已更新为 v309-09 hit90 场景优胜 TP4PP2-hicache@0.90,池 647,040/c4 并发独立文档/hit90 cc8 out +34% vs 现役):脚本 experiments/pro6000/glm53_nvfp4_hit90_dp_dcp_bench/scripts/deploy_glm53_605_v3.sh + 补丁束60.8:/root/glm53_r37_patch_bundle_v3.tar.gzmd5 6922e534需 scp 至 60.5+ 需 docker pull cu13 镜像;未执行、未落 60.5 磁盘60.5:/root 仅有原脚本,核验过)。此前 v2TP2PP4-hicache冷缓存口径优胜被 v3 取代,仍留仓库可作"容量优先 6 条文档/512k 单条最快"备选;回滚=原脚本 profiles/pro6000/glm53_nvfp4_pro6000_sglang_tp8eagle.env(方案 A 口径);待切 glm53_nvfp4_pro6000_sglang_tp4pp2_hicache.env(容量优先备选 ..._tp2pp4_hicache.env
60.6 无容器,但 8 卡被外部裸金属实验占用(/data/hzy/sparse-opd-*09-08 晚实测) 外部任务,勿动(此前台账漏记)
60.7 基本空4 卡仍有 /home/user/dirA_exp 外部小任务09-08 晚实测) 09-08 已拆除清空(方案 F 前身单机实验 + 场景一深优资产留盘),不再恢复
60.8 glm53-nvfp4Up:30000restart=unless-stopped TP4PP2-nomtp@0.90 hit90 优胜口径在役09-09 晚接替同日早间的 TP2PP4@0.85:同 r37 栈 cu13+9 挂载+de-GLOO仅改 tp4/pp2 + memfrac 0.90KV 池 647,040;实测实例原样保留切 restart 策略,未重建容器。启动 bash /root/deploy_ppmtp_r37.sh '--tp 4 --pp-size 2 --disable-overlap-schedule --max-prefill-tokens 16384 --disable-custom-all-reduce --context-length 1048576' nomtp 8192 0.90 1 1 0 0。hit9090% 命中 i128k/o512out cc1/2/3/4/8/16 = 28.8/47.5/63.9/76.2/106.4/125.7vs TP2PP4 基线 cc4 +14%/cc8 +15%);并发独立 128k 文档 4 条cap cc4 98.5 零排队、512k 单条 ✓ TTFT 135.8s、质量门 7/7同轮判决DP attention 容量负收益判死、DCP 对 DSA 静默算错禁用、MTP@128k accept 2.07 判负。让步项(知情):容量 4 条TP2PP4 为 6、512k 单条慢 33%。回滚 TP2PP4 = 同命令改 '--tp 2 --pp-size 4' + memfrac 0.85。09-10 B300 对标战役:停役(容器 rename 保全 glm53-nvfp4-insvc)→ 双臂 B300 场景矩阵TP2PP4-D 口径 24 点 + E7b 配方)→ E7b 高并发调参复测(初测 MRR16+图1-8 掉图断崖 → MRR64+图桶 1-64deploy_glm53_e7b_hicc.sh,三场景 c8-c64 共 10 点全 OK报告正文采用复测值掉图断崖已修复、16K 仍 TP2PP4 占优E7b 被 prefill 墙封 ~100 tok/s 平台、decode 密集 1K→4K E7b 全档反超c64 out 826.5 tok/s 全场最高、超 TP2PP4 72%)、边界仅 TP2PP4 可达、与 B300 绝对差 4-5×报告飞书 wiki A7V3wZTQeifCB4krdi6cA834nW9,已整文更新)→ 原容器恢复并二次核验rename 回 + startfired up/health 200/16K 单发+C4 抽测 ok、KV 池 647,040 与启动口径逐字一致) profiles/pro6000/glm53_nvfp4_pro6000_sglang_tp4pp2_hicache.env;实验全量 experiments/pro6000/glm53_nvfp4_hit90_dp_dcp_bench/B300 对标 experiments/pro6000/glm53_nvfp4_b300_equivalent_matrix/;前史 experiments/pro6000/glm53_nvfp4_128k_capacity_topology/TP2PP4 口径)+ r37 experiments/pro6000/glm53_ppmtp_r37_verify_graph/

方案 A-F 一览GLM-5.3-NVFP4 @ pro60002026-09-08 双场景报告口径)

方案 一句话 profile / 脚本
A TP8 + EAGLE基准60.5 生产口径 glm53_nvfp4_pro6000_sglang_tp8eagle.env
B TP4 PP2 glm53_nvfp4_pro6000_sglang_tp4pp2.env
C TP4 PP2 + IndexCache(freq=4) glm53_nvfp4_pro6000_sglang_tp4pp2_index.env
D TP2 PP460.1 生产在役 glm53_nvfp4_pro6000_sglang_tp2pp4.env
E TP8 + DFlash2 投机 glm53_nvfp4_pro6000_sglang_tp8dflash2.env
F PD 分离双机链mc-master→prefill→decode→router glm53_nvfp4_pro6000_pd_{master,prefill,decode,router}.env + deploy/PD_CHAIN.md

压测数据飞书《GLM-5.3-NVFP4 双场景压测报告》(SZUSdEqY1oRVxGxgILBcHqPJnEc)。

防漂移

每个在役容器用 deploy/verify_profile.sh <profile.env> 定期核验(镜像 digest + 启动参数 + 端口),发现不一致 = 容器被人手改过,先查清归属再处理。