- deploy_glm53_pp4_mrr64.sh: byte-diff vs original = MRR 48->64 only; decode graph stack-default bs<=256 (no graph change needed, arm never fell off graph) - pass-1 + v2 (fresh instance, retraction-prone 16K c64 ordered last): all 6 points aligned <=1.8% -> post-retraction contamination hypothesis disproved; anchor regression is reproducible MRR64 behavior - MRR48 fresh-instance control (4.1 c32 = 266.42): decomposes -17% anchor into -3.3% instance freshness + -14.4% MRR64 config cost (per-req TPOT p50 87->102ms, three instances, mechanism unidentified) - 16K c64: pool-capped ~59 active, 3 retractions both runs (deterministic); out -5% vs MRR48 queue-mode but TTFT P95 135->89s - report/README/provenance/CURRENT.md overwritten in place per user instruction; feishu wiki revision 13
8.4 KiB
8.4 KiB
现役部署状态页(live 核验于 2026-09-10,60.8 当日核验;其余机器 09-09 口径)
本页记录 174.1.60.x 集群"现在跑的是什么"。改动机器前后先读这页; 任何变动(停/起/改配置)完成后必须更新本页。核验命令:
docker ps+nvidia-smi。
机器状态(2026-09-09 实测)
| 机器 | 在役 | 口径 / 归属 | 对应 profile |
|---|---|---|---|
| 60.1 (6000D-1) | glm53-pp4(Up,8 卡满载,:30000) |
方案 D 生产。09-09/10 两轮实验窗口停机(凌晨 D 基线战役 ..._tp2pp4_latest_autotune.env——仅适用 D 配置:09-10 A 基线(TP8+EAGLE)战役证明 latest 与 autotune 在 A 配置上均负收益(eager 路径对代差/ tactic 敏感,图内不敏感),A 配置维持 nightly+autotune off;**IPC@TP8 真增益 +4.6experiments/pro6000/glm53_nvfp4_dsv4_migration_bench/(REPORT.md + REPORT_A_BASELINE.md)。dsv4_scan 经授权保持停止,还原说明 /root/dsv4_scan_restore_note.txt |
profiles/pro6000/glm53_nvfp4_pro6000_sglang_tp2pp4.env(现役);升级候选 ..._tp2pp4_latest_autotune.env(仅 D 配置) |
| 60.2 (6000D-2) | glm53-nvfp4 实验容器(09-08 晚 TP1PP8 phase,run_phase.sh 实验链进行中) |
他人实验进行中,勿动(方案 F PD 链已拆除;GPU7 曾有外部裸金属任务)。动卡前仍先核实归属 | profiles/pro6000/glm53_nvfp4_pro6000_pd_{prefill→decode 侧}.env |
| 60.3 | 无容器,但 8 卡被外部裸金属训练占用(/data/mas/larm,09-08 晚实测) |
外部任务,勿动(此前台账漏记) | — |
| 60.4 | glm53-nvfp4(Up,:30000,restart=unless-stopped) |
TP8+EAGLE+custom-AR 1stage(E7b 配方)在役(09-09 下午部署:EAGLE 4/1/5/mem0.90/MRR16/chunk8192/ctxlen270336/fp8KV+hicache3/decode 图桶 1-8/双 parser;CAR 补丁三处全注入、8 rank SSKJ_CAR_PATCH_ACTIVE 确认,health 200、生成冒烟、质量门 7/7 见 /root/qg_604_car.log)。启动 /root/deploy_glm53_604_exp.sh(=60.7 实验版逐字拷贝,RESTART=yes CAR_PATCH=1),补丁 /root/patches/(md5 与仓库 car_patch 归档一致)。当日早间曾短暂部署 TP2PP4 D 配方复刻(deploy_s2_test_604.sh 留盘可切回)后被本方案替换;同日经授权清退外部 vllm 评测流水线(tmux mas 的 run_multiseed.sh 链,--resume 可续跑) |
experiments/pro6000/glm53_nvfp4_pro6000d_sglang_dual_scenario_bench/scripts/(deploy_glm53_604_exp.sh + car_patch/ 补丁快照) |
| 60.5 | glm53-nvfp4(Up 2d,09-09 只读核验) |
NVFP4 团队生产(deploy_glm53_605.sh,md5 fcd9109b)。生产机铁律:不实验、不重启、不覆盖脚本。交付升级路径已更新为 v3(09-09 hit90 场景优胜 TP4PP2-hicache@0.90,池 647,040/c4 并发独立文档/hit90 cc8 out +34% vs 现役):脚本 experiments/pro6000/glm53_nvfp4_hit90_dp_dcp_bench/scripts/deploy_glm53_605_v3.sh + 补丁束(60.8:/root/glm53_r37_patch_bundle_v3.tar.gz,md5 6922e534,需 scp 至 60.5)+ 需 docker pull cu13 镜像;未执行、未落 60.5 磁盘(60.5:/root 仅有原脚本,核验过)。此前 v2(TP2PP4-hicache,冷缓存口径优胜)被 v3 取代,仍留仓库可作"容量优先 6 条文档/512k 单条最快"备选;回滚=原脚本 |
profiles/pro6000/glm53_nvfp4_pro6000_sglang_tp8eagle.env(方案 A 口径);待切 glm53_nvfp4_pro6000_sglang_tp4pp2_hicache.env(容量优先备选 ..._tp2pp4_hicache.env) |
| 60.6 | 无容器,但 8 卡被外部裸金属实验占用(/data/hzy/sparse-opd-*,09-08 晚实测) |
外部任务,勿动(此前台账漏记) | — |
| 60.7 | 基本空(4 卡仍有 /home/user/dirA_exp 外部小任务,09-08 晚实测) |
09-08 已拆除清空(方案 F 前身单机实验 + 场景一深优资产留盘),不再恢复 | — |
| 60.8 | glm53-nvfp4(Up,:30000,restart=unless-stopped) |
TP4PP2-nomtp@0.90 hit90 优胜口径在役(09-09 晚接替同日早间的 TP2PP4@0.85:同 r37 栈 cu13+9 挂载+de-GLOO,仅改 tp4/pp2 + memfrac 0.90;KV 池 647,040;实测实例原样保留切 restart 策略,未重建容器。启动 bash /root/deploy_ppmtp_r37.sh '--tp 4 --pp-size 2 --disable-overlap-schedule --max-prefill-tokens 16384 --disable-custom-all-reduce --context-length 1048576' nomtp 8192 0.90 1 1 0 0)。hit90(90% 命中 i128k/o512)out cc1/2/3/4/8/16 = 28.8/47.5/63.9/76.2/106.4/125.7(vs TP2PP4 基线 cc4 +14%/cc8 +15%);并发独立 128k 文档 4 条(cap cc4 98.5 零排队)、512k 单条 ✓ TTFT 135.8s、质量门 7/7;同轮判决:DP attention 容量负收益判死、DCP 对 DSA 静默算错禁用、MTP@128k accept 2.07 判负。让步项(知情):容量 4 条(TP2PP4 为 6)、512k 单条慢 33%。回滚 TP2PP4 = 同命令改 '--tp 2 --pp-size 4' + memfrac 0.85。09-10 B300 对标战役:停役(容器 rename 保全 glm53-nvfp4-insvc)→ 双臂 B300 场景矩阵(TP2PP4-D 口径 24 点 + E7b 配方)→ E7b 高并发调参复测(初测 MRR16+图1-8 掉图断崖 → MRR64+图桶 1-64,deploy_glm53_e7b_hicc.sh,三场景 c8-c64 共 10 点全 OK;报告正文采用复测值:掉图断崖已修复、16K 仍 TP2PP4 占优(E7b 被 prefill 墙封 ~100 tok/s 平台)、decode 密集 1K→4K E7b 全档反超(c64 out 826.5 tok/s 全场最高、超 TP2PP4 72%)、边界仅 TP2PP4 可达、与 B300 绝对差 4-5×;报告飞书 wiki A7V3wZTQeifCB4krdi6cA834nW9,已整文更新)→ TP2PP4 高并发调参复测(初测 C=64 受 MRR48 封顶 48 活跃+16 排队、decode 图默认覆盖 bs≤256 从未掉图 → MRR64,deploy_glm53_pp4_mrr64.sh 逐 token 仅改 MRR;三场景 c32/c64 共 6 点两轮对齐 ≤1.8%(pass-1 + v2 有序版)+ 全新实例 MRR48 对照归因;正文采用 v2 值:4.1/4.2 c64 out +27%/+19%(433/572)、三场景 c64 TTFT P95 全塌缩(20.0/337.9/134.8s → 7.2/7.3/89.2s)、16K c64 到池顶 ~59 活跃 + 3 次回退(确定性行为)、1K 短输入 c32 付 −14% MRR64 配置代价(276→266→228 = −3% 新鲜度 −14% 配置,三实例可复现、机制未定位)、16K c32 无代价;报告已再次整文更新)→ 原容器恢复并三次核验(rename 回 + start,fired up/health 200/16K 抽测 ok、KV 池 647,040 与启动口径逐字一致、显存水位 77.2/82.3 GiB 与停役前一致) |
profiles/pro6000/glm53_nvfp4_pro6000_sglang_tp4pp2_hicache.env;实验全量 experiments/pro6000/glm53_nvfp4_hit90_dp_dcp_bench/;B300 对标 experiments/pro6000/glm53_nvfp4_b300_equivalent_matrix/;前史 experiments/pro6000/glm53_nvfp4_128k_capacity_topology/(TP2PP4 口径)+ r37 experiments/pro6000/glm53_ppmtp_r37_verify_graph/ |
方案 A-F 一览(GLM-5.3-NVFP4 @ pro6000,2026-09-08 双场景报告口径)
| 方案 | 一句话 | profile / 脚本 |
|---|---|---|
| A | TP8 + EAGLE,基准;60.5 生产口径 | glm53_nvfp4_pro6000_sglang_tp8eagle.env |
| B | TP4 PP2 | glm53_nvfp4_pro6000_sglang_tp4pp2.env |
| C | TP4 PP2 + IndexCache(freq=4) | glm53_nvfp4_pro6000_sglang_tp4pp2_index.env |
| D | TP2 PP4;60.1 生产在役 | glm53_nvfp4_pro6000_sglang_tp2pp4.env |
| E | TP8 + DFlash2 投机 | glm53_nvfp4_pro6000_sglang_tp8dflash2.env |
| F | PD 分离双机链(mc-master→prefill→decode→router) | glm53_nvfp4_pro6000_pd_{master,prefill,decode,router}.env + deploy/PD_CHAIN.md |
压测数据:飞书《GLM-5.3-NVFP4 双场景压测报告》(SZUSdEqY1oRVxGxgILBcHqPJnEc)。
防漂移
每个在役容器用 deploy/verify_profile.sh <profile.env> 定期核验(镜像 digest + 启动参数 +
端口),发现不一致 = 容器被人手改过,先查清归属再处理。