sskj/experiments/pro6000/glm53_nvfp4_b300_equivalent_matrix
yy-fighting 97c208cfdb b300eq: TP2PP4 MRR64 retest (pass-1 + ordered v2 + MRR48 control) — c64 gains +27%/+19%, TTFT collapse, -14% 1K c32 config cost attributed
- deploy_glm53_pp4_mrr64.sh: byte-diff vs original = MRR 48->64 only; decode graph
  stack-default bs<=256 (no graph change needed, arm never fell off graph)
- pass-1 + v2 (fresh instance, retraction-prone 16K c64 ordered last): all 6 points
  aligned <=1.8% -> post-retraction contamination hypothesis disproved; anchor
  regression is reproducible MRR64 behavior
- MRR48 fresh-instance control (4.1 c32 = 266.42): decomposes -17% anchor into
  -3.3% instance freshness + -14.4% MRR64 config cost (per-req TPOT p50 87->102ms,
  three instances, mechanism unidentified)
- 16K c64: pool-capped ~59 active, 3 retractions both runs (deterministic);
  out -5% vs MRR48 queue-mode but TTFT P95 135->89s
- report/README/provenance/CURRENT.md overwritten in place per user instruction;
  feishu wiki revision 13
2026-09-10 21:29:05 +08:00
..

GLM-5.3-NVFP4 双方案 B300 对标场景矩阵压测 — 60.86000D

日期2026-09-10 机器174.1.60.88×RTX 6000D96GB GDDR7无 NVLink 模型GLM-5.3-NVFP4modelopt 镜像:nightly-dev-20260828-daf63171(两臂同) 对标基线飞书《GLM 5.3 SGLang Low-latency & High-Throughput 测试结果》B300 报告wiki UPB2w4Y5yi65qwkMxJJcZko5nUc 完整报告:本目录 REPORT.md= 飞书发布版 A7V3wZTQeifCB4krdi6cA834nW9两臂高并发复测后整文更新正文一律采用复测值

目标

在 6000D 上复刻 B300 报告的全部场景(主场景 16K→512、4.1 短输入、4.2 长输出、5.1 长上下文、5.2 边界),对两套在役部署方案各跑一遍完整矩阵,产出对齐 B300 8 章结构的对标报告。两臂各完成一轮当日调参复测E7b 初测暴露 MRR16 + decode 图 bs1-8 的高并发掉图断崖,按用户决策调参为 MRR64 + 图桶 1-64deploy_glm53_e7b_hicc.sh,其余配方逐字不变)复测三场景 C=8/16/32/64 共 10 点TP2PP4 初测的 C=64 点受 MRR48 封顶48 活跃+16 排队decode 图栈默认覆盖 bs≤256、本臂从未掉图按用户决策调参为 MRR64deploy_glm53_pp4_mrr64.sh,逐 token diff 仅 MRR 一处)复测三场景 C=32/C=64 共 6 点两轮pass-1 + v2 有序版,全部点位对齐 ≤1.8%),另以全新实例跑原版 MRR48 的 4.1 C=32 单点做归因对照。报告正文一律采用复测值C=1 与 5.1/5.2 点受池上限约束、与调参无关,沿用初测值)。测后 60.8 在役服务TP4PP2@0.90)原容器恢复,当日三轮拆台均按 rename→start 流程保全恢复并逐轮验证。

实验臂

方案 关键配置 质量门
tp2pp4 D 生产口径deploy_glm53_pp4.sh TP2PP4、mem0.85、MRR48、cps16384、radix 关、KV fp8_e4m3 池 1,040,384、无投机、index_topk_freq=4=原生默认恒等、ctx 1,048,576 6/7仅 tool-call无 parser历史已知
e7b TP8+EAGLE3+AR 初测deploy_glm53_607_exp.sh + CAR 补丁注入) TP8、EAGLE 4/1/5、mem0.90、MRR16、cps8192、radix 开+hicache×3、KV fp8_e4m3 GPU 池 276,480、decode 图 bs1-8、ctx 270,336、custom-AR 1stageSGLANG_CUSTOM_ALLREDUCE_ALGO=1stage8 rank SSKJ_CAR_PATCH_ACTIVE 验证) 7/7
e7b64 TP8+EAGLE3+AR 高并发复测deploy_glm53_e7b_hicc.sh= e7b 仅改 MRR 16→64 + decode 图桶 1-64 其余配方与 e7b 逐字一致;图捕获后 avail 6.11 GB/卡KV 池 276,480 不变 7/7
pp4mrr64 D 生产口径高并发复测deploy_glm53_pp4_mrr64.sh= tp2pp4 仅改 MRR 48→64 其余配方与 tp2pp4 逐字一致decode 图栈默认覆盖 bs≤256无需扩图KV 池 1,040,384 不变16K 场景活跃上限转为池 ~59 条 6/7v2 实例复验,仅 tool-call 已知项)
mrr48ctl 归因对照(原版 deploy_glm53_pp4.sh 全新实例4.1 C=32 单点) = tp2pp4 逐字一致MRR48用于分解 4.1 C=32 锚点 17%3% 实例新鲜度 + 14% MRR64 配置代价) 未跑(配置同 tp2pp4 已验)

场景矩阵与并发档位用户裁决收敛16K 封 64、64K/128K 封 8/4

B300 章节 场景 并发档位 TP2PP4 活跃上限 E7b 活跃上限
§3 主场景 16K→512 1/8/16/32/64 ~59池 1,040,384÷17.4K;复测臂 MRR64 超配c64 3 次回退) 16池 276,480÷17.4K;复测臂 MRR64 不再是约束)
§4.1 1K→128 1/8/32/64 64复测臂 MRR初测 48 64复测臂 MRR初测 16
§4.2 1K→4K 1/8/32/64 64复测臂 MRR初测 48 ~52复测臂 c64 有 12 条排队;初测 c64 中止 rc=143复测已补齐
§5.1 64K→512 1/4/8 15 4
§5.1 128K→512 1/2/4 7 2
§5.2 256K→1 1/2/3 3 1池贴边
§5.2 512K→1 1 1 结构性不可ctx
§5.2 896K→1代 B300"约1M" 1 1 结构性不可ctx

测量协议冷缓存shared-frac 0+ 每点 flush + 服务端命中核验 ≤0.01超限重试一次nreq=max(8, 2×cc)P95 nearest-rank 对齐 B300语料耗尽21.23M/21.30M)下用回收窗口(--pool-override 基址映射见 REPORT 附录 A复测臂为全新容器实例同基址文本对 hicache 宿主层重新成为处女文本,命中核验全 0.0)。有效测量点 57 个tp2pp4 24 + pp4mrr64 复测 12 + mrr48ctl 对照 1 + e7b/e7b64 合计 20全点 0 OOM唯一 retraction 点 = TP2PP4 主场景 C=64MRR64 对 16K 池超配,两轮各 3 次,其余全点 0

判决速览(详见 REPORT.md两臂数值均为复测值

  • 掉图断崖已修复E7b 复测核心判决):初测 MRR16 + 图 bs1-8 把 E7b 窗口封死 C≤816K c16 TPOT 298ms 断崖);调参 MRR64 + 图桶 1-64 后 C=16 TPOT 降至 228.8ms16K c16/32/64 输出 92.1/97.6/99.6 tok/s较初测 +18~33%),窗口扩到 C=64。
  • TP2PP4 C=64 档全面提升pp4mrr64 复测核心判决):初测 C=64 损失全部来自 MRR4848 活跃+16 排队decode 图默认覆盖 bs≤256 从未掉图。MRR64 后4.1 c64 输出 341→433+27%、4.2 c64 482→572+19%、16K c64 TTFT 135→89s34%4.1/4.2 c64 TTFT 从 20.0/337.9s 塌缩到 7.2/7.3s。16K c64 到达池顶(活跃 ~59、吞吐 5%、3 次回退为确定性行为,两轮一致)。
  • MRR64 的 14% 代价1K 短输入 c32与归因对照4.1 c32 锚点 276→22817%),全新实例 MRR48 对照 266.42 分解 = 3% 实例新鲜度 + 14% MRR64 配置本身(逐请求 TPOT p50 87→102ms 均匀抬高三实例可复现、机制未定位4.2 c32 6%、16K c32 持平。MRR 按负载形态选1K 短输入为主且并发 ≤48 可保持 MRR48。
  • 分界负载形态化prefill 密集16K 主场景)仍 TP2PP4 占优——c64 out 201 vs 99.6 = 2.0×E7b 输出被 prefill 墙chunk8192+TP8 无 PP 流水)封在 ~100 tok/s 平台;短输入 c32 两方案打平228 vs 229、c64 TP2PP4 1.6×433 vs 272且 TTFT/TPOT 双优。
  • decode 密集1K→4KE7b 全档反超c8/32/64 = 402/676/826.5 tok/sc64 为全场最高输出吞吐(超 TP2PP4 同点 572 达 45%TPOT 85.1ms 仍优、TTFT 被 TP2PP4 MRR64 反超7.30 vs 12.18s初测排队断崖c32 TTFT 305s消除为 6.19s。
  • E7b C=1 优势不变16K out 49.6 vs 16.7=3.0×、TPOT 13.7 vs 50.3ms=3.7×1K→4K out 135 vs 20.3=6.7×、TPOT 8.7ms。
  • TP2PP4 甜点 c16+16K 爬至 c64 池顶(活跃 ~59 封顶);边界 256K/512K/896K 只有 TP2PP4 可达input 7,050/5,662/4,153 tok/sE7b ctx 270,336 结构性封顶。
  • DSA 复现C=1 TPOT 对上下文不敏感50.3/50.0/49.7ms @16/64/128K并发才是驱动c8: 70.9→161.8ms)。
  • vs B300定性结构复现LL/HT 分野一致),绝对差 4-5×边界 prefill 差距收窄至 ~2×主场景分界本机更靠前C8 vs C64-128容量上限而非算力decode 密集场景调参后 E7b 全档无交叉B300 报告未呈现该形态)。

关键坑位(复测必读)

  1. hicache 宿主层陷阱256K prewarm KV 占池 94.8% 触发宿主层下放,flush_cache 清不掉宿主层 → 同文本测量命中 0.9998。冷缓存复测必须换该实例从未发过的文本(本战役 E7b 256K C=1 用窗口 9,900,000 重测达标e7b64 复测臂为全新容器实例沿用同基址窗口即满足该条件10 点命中全 0.0)。
  2. 语料已耗尽:回收窗口复用仅在 flush+命中核验协议下有效TP2PP4 臂 radix 本来就关,零污染。
  3. 在役保全流程:docker stopdocker rename glm53-nvfp4 glm53-nvfp4-insvc必须先改名E7b 部署脚本会 rm -f 同名容器)→ 测毕 rename 回 + start。docker stop/rm 偶发 "zombie PID" 报错是收尾边界现象,容器终态 exited(137)、显存归零,稍等重试即可。

资产与 md5 台账60.8 执行件 = 本目录 = 60.7 原件 三方一致)

1e34dd8d813ccb7ac8243e8d1573a49e  bench_corpus_v2.py        (scripts/)
4c126d067d33b5ea27c268f37561634c  extract_summary.py        (scripts/)
5892b44610b2ce61f533f1721105625e  run_b300_matrix.sh        (scripts/)
165db732fa3237a80a4d53a963a128e7  deploy_glm53_e7b_hicc.sh  (scripts/E7b 高并发版MRR64+图桶1-64其余与 607_exp 逐字一致)
fe46da2eb22f5ae23eb963bb9d467922  run_retest_e7b64.sh       (scripts/10 点复测驱动run-id 96xx)
376bedfd42fa29ba9de8bfdf0c67c3b2  gen_retest_compare.py     (scripts/,复测前后对比表生成器)
533440efc04e89bf5bbec3e0efbb35ed  deploy_glm53_pp4_mrr64.sh (scripts/TP2PP4 高并发版:仅 MRR 48→64其余与 deploy_glm53_pp4.sh 逐 token 一致)
c9b6361d8679c41e59aced298e0f50bf  run_retest_pp4mrr64.sh    (scripts/pass-1 6 点复测驱动run-id 966x)
7d8578169b2e7d3d1c9d461f53c44e87  run_retest_pp4mrr64_v2.sh (scripts/v2 有序版:回退点 16K c64 排末位run-id 967x正文采用值)
889c242859e46a0d41240a818f754bd1  launch_v2_after_pass1.sh  (scripts/pass-1→拆台→重部署→QG→v2 全自动衔接 wrapper)
1ff8a21f12a79a3b2aaa8c2dafb4af32  control_mrr48_41c32.sh    (scripts/MRR48 归因对照 + 自动链接在役恢复)
20cea216bce9aeda4ec4ecea4569a3de  gen_retest_compare_pp4.py (scripts/TP2PP4 复测前后对比表生成器)
def3c64c5dc19e1d507080e3366c3762  deploy_glm53_pp4.sh       (见 dual_scenario_bench/scripts/md5 对照一致)
21db641f1d997e26fcf1ddc97163b87e  deploy_glm53_607_exp.sh   (见 dual_scenario_bench/scripts/md5 对照一致)
a8fc9a504c041acc40831a848b4985d8  patches/custom_all_reduce.py
65a4d22bd87ae343e7d68c4879c14f98  patches/custom_all_reduce_utils.py

gen_report_tables.py 为本地表格生成器md5 未入台账60.8 侧执行件同源)。

原始数据

  • 本目录 results/{tp2pp4,e7b,e7b64,pp4mrr64}/all_results*.jsonl逐点 SUMMARY + 命中核验、status*.txt、server_facts*.txt启动参数+池分配日志摘录、gpu_inventory_idle/final.csv、vram_timeline.csv30s 采样全矩阵csv/log 属 gitignore 中间件,关键事实折叠于 provenance.mdpp4mrr64/ 含 pass-1、v2正文采用值、mrr48ctl归因对照三套 jsonl + retest_compare_pp4_v2.md 前后对比表
  • 60.8 侧:/root/bench_logs/b300eq_tp2pp4_20260910_1138//root/bench_logs/b300eq_e7b_20260910_1428/(初测留档基线)、/root/bench_logs/b300eq_e7b64_20260910_1732/E7b 复测,正文采用值)+ /root/bench_logs/retest_compare.md(前后对比)、/root/bench_logs/b300eq_pp4mrr64_20260910_1927/TP2PP4 复测 pass-1/root/bench_logs/b300eq_pp4mrr64v2_20260910_2021/TP2PP4 复测 v2正文采用值+ /root/bench_logs/retest_compare_pp4_v2.md/root/bench_logs/b300eq_mrr48ctl_20260910_2112/MRR48 对照)
  • E7b 256K C=1all_results.jsonl 同 tag 共 4 条,最后一条为干净重测值(生成器 dict 载入后写覆盖,天然生效)