# GLM-5.3-NVFP4 双方案 B300 对标场景矩阵压测 — 60.8(6000D) 日期:2026-09-10 | 机器:174.1.60.8(8×RTX 6000D,96GB GDDR7,无 NVLink) 模型:GLM-5.3-NVFP4(modelopt)| 镜像:`nightly-dev-20260828-daf63171`(两臂同) 对标基线:飞书《GLM 5.3 | SGLang | Low-latency & High-Throughput 测试结果》(B300 报告,wiki UPB2w4Y5yi65qwkMxJJcZko5nUc) 完整报告:本目录 `REPORT.md`(= 飞书发布版 A7V3wZTQeifCB4krdi6cA834nW9) ## 目标 在 6000D 上复刻 B300 报告的全部场景(主场景 16K→512、4.1 短输入、4.2 长输出、5.1 长上下文、5.2 边界),对两套在役部署方案各跑一遍完整矩阵,产出对齐 B300 8 章结构的对标报告。测后 60.8 在役服务(TP4PP2@0.90)原容器恢复(已验证:health 200 + 16K 抽测 ok + 显存水位一致)。 ## 实验臂 | 臂 | 方案 | 关键配置 | 质量门 | |---|---|---|---| | tp2pp4 | **D 生产口径**(deploy_glm53_pp4.sh) | TP2PP4、mem0.85、MRR48、cps16384、radix 关、KV fp8_e4m3 池 1,040,384、无投机、index_topk_freq=4(=原生默认,恒等)、ctx 1,048,576 | 6/7(仅 tool-call:无 parser,历史已知) | | e7b | **TP8+EAGLE3+AR**(deploy_glm53_607_exp.sh + CAR 补丁注入) | TP8、EAGLE 4/1/5、mem0.90、MRR16、cps8192、radix 开+hicache×3、KV fp8_e4m3 GPU 池 276,480、decode 图 bs1-8、ctx 270,336、custom-AR 1stage(`SGLANG_CUSTOM_ALLREDUCE_ALGO=1stage`,8 rank `SSKJ_CAR_PATCH_ACTIVE` 验证) | 7/7 | ## 场景矩阵与并发档位(用户裁决收敛:16K 封 64、64K/128K 封 8/4) | B300 章节 | 场景 | 并发档位 | TP2PP4 活跃上限 | E7b 活跃上限 | |---|---|---|---|---| | §3 主场景 | 16K→512 | 1/8/16/32/64 | 48(MRR) | 16(MRR=池贴边) | | §4.1 | 1K→128 | 1/8/32/64 | 48 | 16 | | §4.2 | 1K→4K | 1/8/32/64 | 48 | 16(c64 用户中止 rc=143) | | §5.1 | 64K→512 | 1/4/8 | 15(池) | 4(池) | | §5.1 | 128K→512 | 1/2/4 | 7(池) | 2(池) | | §5.2 | 256K→1 | 1/2/3 | 3(池) | 1(池贴边) | | §5.2 | 512K→1 | 1 | 1 | 结构性不可(ctx) | | §5.2 | 896K→1(代 B300"约1M") | 1 | 1 | 结构性不可(ctx) | 测量协议:冷缓存(shared-frac 0)+ 每点 flush + 服务端命中核验 ≤0.01(超限重试一次);nreq=max(8, 2×cc);P95 nearest-rank 对齐 B300;语料耗尽(21.23M/21.30M)下用回收窗口(`--pool-override` 基址映射见 REPORT 附录 A)。有效测量点 41 个(tp2pp4 24 + e7b 16 + e7b 256K C=1 全新文本重测),全点 0 retraction、0 OOM。 ## 判决速览(详见 REPORT.md) - **分界 C=8**:E7b 全场景 C=1 占优(16K out 49.6 vs 16.7=3.0×、TPOT 13.7 vs 50.3ms=3.7×;1K→4K out 135 vs 20.3=6.7×);C≥8 TP2PP4 全指标反超并随并发拉大(16K c64 out 211 vs 84=2.5×)。 - **E7b 可用窗口 ≤C8**:MRR16 + decode 掉图(bs>8)双击,16K c16 TPOT 298ms 断崖。 - **decode 密集甜点 = E7b c8**:1K→4K out 412 tok/s、TPOT 22.5ms、accept 4.0。 - **TP2PP4 甜点 c16+**:16K 近线性至 c64(MRR48 未饱和);全场最高输出 4.2 c64 482 tok/s(但 TTFT 338s,仅离线)。 - **边界只有 TP2PP4 可达**:256K/512K/896K 全测(input 7,050/5,662/4,153 tok/s);E7b ctx 270,336 结构性封顶。 - **DSA 复现**:C=1 TPOT 对上下文不敏感(50.3/50.0/49.7ms @16/64/128K),并发才是驱动(c8: 70.9→161.8ms)。 - **vs B300**:定性结构完全复现(LL/HT 分野一致),绝对差 4-5×,边界 prefill 差距收窄至 ~2×;分界点本机更靠前(C8 vs C64-128),原因是容量上限(MRR/池)而非算力。 ## 关键坑位(复测必读) 1. **hicache 宿主层陷阱**:256K prewarm KV 占池 94.8% 触发宿主层下放,`flush_cache` 清不掉宿主层 → 同文本测量命中 0.9998。冷缓存复测**必须换该实例从未发过的文本**(本战役 E7b 256K C=1 用窗口 9,900,000 重测达标)。 2. 语料已耗尽:回收窗口复用仅在 flush+命中核验协议下有效;TP2PP4 臂 radix 本来就关,零污染。 3. 在役保全流程:`docker stop` → `docker rename glm53-nvfp4 glm53-nvfp4-insvc`(必须先改名,E7b 部署脚本会 rm -f 同名容器)→ 测毕 `rename` 回 + `start`。docker stop/rm 偶发 "zombie PID" 报错是收尾边界现象,容器终态 exited(137)、显存归零,稍等重试即可。 ## 资产与 md5 台账(60.8 执行件 = 本目录 = 60.7 原件 三方一致) ``` 1e34dd8d813ccb7ac8243e8d1573a49e bench_corpus_v2.py (scripts/) 4c126d067d33b5ea27c268f37561634c extract_summary.py (scripts/) 5892b44610b2ce61f533f1721105625e run_b300_matrix.sh (scripts/) def3c64c5dc19e1d507080e3366c3762 deploy_glm53_pp4.sh (见 dual_scenario_bench/scripts/,md5 对照一致) 21db641f1d997e26fcf1ddc97163b87e deploy_glm53_607_exp.sh (见 dual_scenario_bench/scripts/,md5 对照一致) a8fc9a504c041acc40831a848b4985d8 patches/custom_all_reduce.py 65a4d22bd87ae343e7d68c4879c14f98 patches/custom_all_reduce_utils.py ``` gen_report_tables.py 为本地表格生成器(md5 未入台账,60.8 侧执行件同源)。 ## 原始数据 - 本目录 `results/{tp2pp4,e7b}/`:all_results.jsonl(逐点 SUMMARY + 命中核验)、status.txt、server_facts.txt(启动参数+池分配日志摘录)、gpu_inventory_idle/final.csv、vram_timeline.csv(30s 采样全矩阵) - 60.8 侧:`/root/bench_logs/b300eq_tp2pp4_20260910_1138/`、`/root/bench_logs/b300eq_e7b_20260910_1428/` - E7b 256K C=1:all_results.jsonl 同 tag 共 4 条,最后一条为干净重测值(生成器 dict 载入后写覆盖,天然生效)