# GLM-5.3-NVFP4 双方案 B300 对标场景矩阵压测 — 60.8(6000D) 日期:2026-09-10 | 机器:174.1.60.8(8×RTX 6000D,96GB GDDR7,无 NVLink) 模型:GLM-5.3-NVFP4(modelopt)| 镜像:`nightly-dev-20260828-daf63171`(两臂同) 对标基线:飞书《GLM 5.3 | SGLang | Low-latency & High-Throughput 测试结果》(B300 报告,wiki UPB2w4Y5yi65qwkMxJJcZko5nUc) 完整报告:本目录 `REPORT.md`(= 飞书发布版 A7V3wZTQeifCB4krdi6cA834nW9;两臂高并发复测后整文更新,正文一律采用复测值) ## 目标 在 6000D 上复刻 B300 报告的全部场景(主场景 16K→512、4.1 短输入、4.2 长输出、5.1 长上下文、5.2 边界),对两套在役部署方案各跑一遍完整矩阵,产出对齐 B300 8 章结构的对标报告。两臂各完成一轮当日调参复测:E7b 初测暴露 MRR16 + decode 图 bs1-8 的高并发掉图断崖,按用户决策调参为 MRR64 + 图桶 1-64(`deploy_glm53_e7b_hicc.sh`,其余配方逐字不变)复测三场景 C=8/16/32/64 共 10 点;TP2PP4 初测的 C=64 点受 MRR48 封顶(48 活跃+16 排队;decode 图栈默认覆盖 bs≤256、本臂从未掉图),按用户决策调参为 MRR64(`deploy_glm53_pp4_mrr64.sh`,逐 token diff 仅 MRR 一处)复测三场景 C=32/C=64 共 6 点两轮(pass-1 + v2 有序版,全部点位对齐 ≤1.8%),另以全新实例跑原版 MRR48 的 4.1 C=32 单点做归因对照。**报告正文一律采用复测值**(C=1 与 5.1/5.2 点受池上限约束、与调参无关,沿用初测值)。测后 60.8 在役服务(TP4PP2@0.90)原容器恢复,当日三轮拆台均按 rename→start 流程保全恢复并逐轮验证。 ## 实验臂 | 臂 | 方案 | 关键配置 | 质量门 | |---|---|---|---| | tp2pp4 | **D 生产口径**(deploy_glm53_pp4.sh) | TP2PP4、mem0.85、MRR48、cps16384、radix 关、KV fp8_e4m3 池 1,040,384、无投机、index_topk_freq=4(=原生默认,恒等)、ctx 1,048,576 | 6/7(仅 tool-call:无 parser,历史已知) | | e7b | **TP8+EAGLE3+AR 初测**(deploy_glm53_607_exp.sh + CAR 补丁注入) | TP8、EAGLE 4/1/5、mem0.90、MRR16、cps8192、radix 开+hicache×3、KV fp8_e4m3 GPU 池 276,480、decode 图 bs1-8、ctx 270,336、custom-AR 1stage(`SGLANG_CUSTOM_ALLREDUCE_ALGO=1stage`,8 rank `SSKJ_CAR_PATCH_ACTIVE` 验证) | 7/7 | | e7b64 | **TP8+EAGLE3+AR 高并发复测**(deploy_glm53_e7b_hicc.sh,= e7b 仅改 MRR 16→64 + decode 图桶 1-64) | 其余配方与 e7b 逐字一致;图捕获后 avail 6.11 GB/卡,KV 池 276,480 不变 | 7/7 | | pp4mrr64 | **D 生产口径高并发复测**(deploy_glm53_pp4_mrr64.sh,= tp2pp4 仅改 MRR 48→64) | 其余配方与 tp2pp4 逐字一致;decode 图栈默认覆盖 bs≤256(无需扩图);KV 池 1,040,384 不变;16K 场景活跃上限转为池 ~59 条 | 6/7(v2 实例复验,仅 tool-call 已知项) | | mrr48ctl | **归因对照**(原版 deploy_glm53_pp4.sh 全新实例,4.1 C=32 单点) | = tp2pp4 逐字一致(MRR48);用于分解 4.1 C=32 锚点 −17%(−3% 实例新鲜度 + −14% MRR64 配置代价) | 未跑(配置同 tp2pp4 已验) | ## 场景矩阵与并发档位(用户裁决收敛:16K 封 64、64K/128K 封 8/4) | B300 章节 | 场景 | 并发档位 | TP2PP4 活跃上限 | E7b 活跃上限 | |---|---|---|---|---| | §3 主场景 | 16K→512 | 1/8/16/32/64 | ~59(池 1,040,384÷17.4K;复测臂 MRR64 超配,c64 3 次回退) | 16(池 276,480÷17.4K;复测臂 MRR64 不再是约束) | | §4.1 | 1K→128 | 1/8/32/64 | 64(复测臂 MRR;初测 48) | 64(复测臂 MRR;初测 16) | | §4.2 | 1K→4K | 1/8/32/64 | 64(复测臂 MRR;初测 48) | ~52(池;复测臂 c64 有 12 条排队;初测 c64 中止 rc=143,复测已补齐) | | §5.1 | 64K→512 | 1/4/8 | 15(池) | 4(池) | | §5.1 | 128K→512 | 1/2/4 | 7(池) | 2(池) | | §5.2 | 256K→1 | 1/2/3 | 3(池) | 1(池贴边) | | §5.2 | 512K→1 | 1 | 1 | 结构性不可(ctx) | | §5.2 | 896K→1(代 B300"约1M") | 1 | 1 | 结构性不可(ctx) | 测量协议:冷缓存(shared-frac 0)+ 每点 flush + 服务端命中核验 ≤0.01(超限重试一次);nreq=max(8, 2×cc);P95 nearest-rank 对齐 B300;语料耗尽(21.23M/21.30M)下用回收窗口(`--pool-override` 基址映射见 REPORT 附录 A;复测臂为全新容器实例,同基址文本对 hicache 宿主层重新成为处女文本,命中核验全 0.0)。有效测量点 57 个(tp2pp4 24 + pp4mrr64 复测 12 + mrr48ctl 对照 1 + e7b/e7b64 合计 20),全点 0 OOM;唯一 retraction 点 = TP2PP4 主场景 C=64(MRR64 对 16K 池超配,两轮各 3 次,其余全点 0)。 ## 判决速览(详见 REPORT.md,两臂数值均为复测值) - **掉图断崖已修复(E7b 复测核心判决)**:初测 MRR16 + 图 bs1-8 把 E7b 窗口封死 C≤8(16K c16 TPOT 298ms 断崖);调参 MRR64 + 图桶 1-64 后 C=16 TPOT 降至 228.8ms,16K c16/32/64 输出 92.1/97.6/99.6 tok/s(较初测 +18~33%),窗口扩到 C=64。 - **TP2PP4 C=64 档全面提升(pp4mrr64 复测核心判决)**:初测 C=64 损失全部来自 MRR48(48 活跃+16 排队;decode 图默认覆盖 bs≤256 从未掉图)。MRR64 后:4.1 c64 输出 341→433(+27%)、4.2 c64 482→572(+19%)、16K c64 TTFT 135→89s(−34%);4.1/4.2 c64 TTFT 从 20.0/337.9s 塌缩到 7.2/7.3s。16K c64 到达池顶(活跃 ~59、吞吐 −5%、3 次回退为确定性行为,两轮一致)。 - **MRR64 的 −14% 代价(1K 短输入 c32)与归因对照**:4.1 c32 锚点 276→228(−17%),全新实例 MRR48 对照 266.42 分解 = −3% 实例新鲜度 + −14% MRR64 配置本身(逐请求 TPOT p50 87→102ms 均匀抬高,三实例可复现、机制未定位);4.2 c32 −6%、16K c32 持平。MRR 按负载形态选:1K 短输入为主且并发 ≤48 可保持 MRR48。 - **分界负载形态化**:prefill 密集(16K 主场景)仍 TP2PP4 占优——c64 out 201 vs 99.6 = 2.0×,E7b 输出被 prefill 墙(chunk8192+TP8 无 PP 流水)封在 ~100 tok/s 平台;短输入 c32 两方案打平(228 vs 229)、c64 TP2PP4 1.6×(433 vs 272)且 TTFT/TPOT 双优。 - **decode 密集(1K→4K)E7b 全档反超**:c8/32/64 = 402/676/**826.5 tok/s**,c64 为全场最高输出吞吐(超 TP2PP4 同点 572 达 45%),TPOT 85.1ms 仍优、TTFT 被 TP2PP4 MRR64 反超(7.30 vs 12.18s);初测排队断崖(c32 TTFT 305s)消除为 6.19s。 - **E7b C=1 优势不变**:16K out 49.6 vs 16.7=3.0×、TPOT 13.7 vs 50.3ms=3.7×;1K→4K out 135 vs 20.3=6.7×、TPOT 8.7ms。 - **TP2PP4 甜点 c16+**:16K 爬至 c64 池顶(活跃 ~59 封顶);边界 256K/512K/896K 只有 TP2PP4 可达(input 7,050/5,662/4,153 tok/s);E7b ctx 270,336 结构性封顶。 - **DSA 复现**:C=1 TPOT 对上下文不敏感(50.3/50.0/49.7ms @16/64/128K),并发才是驱动(c8: 70.9→161.8ms)。 - **vs B300**:定性结构复现(LL/HT 分野一致),绝对差 4-5×,边界 prefill 差距收窄至 ~2×;主场景分界本机更靠前(C8 vs C64-128,容量上限而非算力),decode 密集场景调参后 E7b 全档无交叉(B300 报告未呈现该形态)。 ## 关键坑位(复测必读) 1. **hicache 宿主层陷阱**:256K prewarm KV 占池 94.8% 触发宿主层下放,`flush_cache` 清不掉宿主层 → 同文本测量命中 0.9998。冷缓存复测**必须换该实例从未发过的文本**(本战役 E7b 256K C=1 用窗口 9,900,000 重测达标;e7b64 复测臂为全新容器实例,沿用同基址窗口即满足该条件,10 点命中全 0.0)。 2. 语料已耗尽:回收窗口复用仅在 flush+命中核验协议下有效;TP2PP4 臂 radix 本来就关,零污染。 3. 在役保全流程:`docker stop` → `docker rename glm53-nvfp4 glm53-nvfp4-insvc`(必须先改名,E7b 部署脚本会 rm -f 同名容器)→ 测毕 `rename` 回 + `start`。docker stop/rm 偶发 "zombie PID" 报错是收尾边界现象,容器终态 exited(137)、显存归零,稍等重试即可。 ## 资产与 md5 台账(60.8 执行件 = 本目录 = 60.7 原件 三方一致) ``` 1e34dd8d813ccb7ac8243e8d1573a49e bench_corpus_v2.py (scripts/) 4c126d067d33b5ea27c268f37561634c extract_summary.py (scripts/) 5892b44610b2ce61f533f1721105625e run_b300_matrix.sh (scripts/) 165db732fa3237a80a4d53a963a128e7 deploy_glm53_e7b_hicc.sh (scripts/,E7b 高并发版:MRR64+图桶1-64,其余与 607_exp 逐字一致) fe46da2eb22f5ae23eb963bb9d467922 run_retest_e7b64.sh (scripts/,10 点复测驱动,run-id 96xx) 376bedfd42fa29ba9de8bfdf0c67c3b2 gen_retest_compare.py (scripts/,复测前后对比表生成器) 533440efc04e89bf5bbec3e0efbb35ed deploy_glm53_pp4_mrr64.sh (scripts/,TP2PP4 高并发版:仅 MRR 48→64,其余与 deploy_glm53_pp4.sh 逐 token 一致) c9b6361d8679c41e59aced298e0f50bf run_retest_pp4mrr64.sh (scripts/,pass-1 6 点复测驱动,run-id 966x) 7d8578169b2e7d3d1c9d461f53c44e87 run_retest_pp4mrr64_v2.sh (scripts/,v2 有序版:回退点 16K c64 排末位,run-id 967x,正文采用值) 889c242859e46a0d41240a818f754bd1 launch_v2_after_pass1.sh (scripts/,pass-1→拆台→重部署→QG→v2 全自动衔接 wrapper) 1ff8a21f12a79a3b2aaa8c2dafb4af32 control_mrr48_41c32.sh (scripts/,MRR48 归因对照 + 自动链接在役恢复) 20cea216bce9aeda4ec4ecea4569a3de gen_retest_compare_pp4.py (scripts/,TP2PP4 复测前后对比表生成器) def3c64c5dc19e1d507080e3366c3762 deploy_glm53_pp4.sh (见 dual_scenario_bench/scripts/,md5 对照一致) 21db641f1d997e26fcf1ddc97163b87e deploy_glm53_607_exp.sh (见 dual_scenario_bench/scripts/,md5 对照一致) a8fc9a504c041acc40831a848b4985d8 patches/custom_all_reduce.py 65a4d22bd87ae343e7d68c4879c14f98 patches/custom_all_reduce_utils.py ``` gen_report_tables.py 为本地表格生成器(md5 未入台账,60.8 侧执行件同源)。 ## 原始数据 - 本目录 `results/{tp2pp4,e7b,e7b64,pp4mrr64}/`:all_results*.jsonl(逐点 SUMMARY + 命中核验)、status*.txt、server_facts*.txt(启动参数+池分配日志摘录)、gpu_inventory_idle/final.csv、vram_timeline.csv(30s 采样全矩阵;csv/log 属 gitignore 中间件,关键事实折叠于 provenance.md);pp4mrr64/ 含 pass-1、v2(正文采用值)、mrr48ctl(归因对照)三套 jsonl + retest_compare_pp4_v2.md 前后对比表 - 60.8 侧:`/root/bench_logs/b300eq_tp2pp4_20260910_1138/`、`/root/bench_logs/b300eq_e7b_20260910_1428/`(初测留档基线)、`/root/bench_logs/b300eq_e7b64_20260910_1732/`(E7b 复测,正文采用值)+ `/root/bench_logs/retest_compare.md`(前后对比)、`/root/bench_logs/b300eq_pp4mrr64_20260910_1927/`(TP2PP4 复测 pass-1)、`/root/bench_logs/b300eq_pp4mrr64v2_20260910_2021/`(TP2PP4 复测 v2,正文采用值)+ `/root/bench_logs/retest_compare_pp4_v2.md`、`/root/bench_logs/b300eq_mrr48ctl_20260910_2112/`(MRR48 对照) - E7b 256K C=1:all_results.jsonl 同 tag 共 4 条,最后一条为干净重测值(生成器 dict 载入后写覆盖,天然生效)