yy-fighting c5d91ceafe b300-equivalent matrix: E7b high-concurrency retest (MRR64 + decode-graph buckets 1-64) - graph-drop cliff fixed, report numbers overwritten in place
- deploy_glm53_e7b_hicc.sh (md5 165db732): only delta vs 607_exp = MRR 16->64 + cuda-graph-bs-decode 1..64; KV pool 276,480 unchanged, avail 6.11GB after capture
- 10 retest points (16K/4.1/4.2 at c8/16/32/64) all OK, hit=0.0 (fresh container = recycled windows virgin again), 0 retraction, QG 7/7
- verdicts: 16K output 92.1/97.6/99.6 (+18~33% vs initial, still TP2PP4-dominated, prefill wall ~100 plateau); 4.1 c32/64 229/272 (gap narrowed to 1.2x); 4.2 402/676/826.5 - E7b wins ALL cc tiers, c64 826.5 tok/s = machine-wide best output (+72% vs TP2PP4 482), TTFT 12.18s / TPOT 85.1ms; c8 anchors within +-3% prove no env drift
- REPORT.md + Feishu A7V3wZTQeifCB4krdi6cA834nW9 overwritten in place (user directive: no appended chapter); initial MRR16 run archived as baseline in results/e7b/
- provenance.md: e7b64 VRAM (idle 79.3k, peak 83,627 MiB), second in-service restore verified (fired up/health 200/16K+C4 spot/KV pool 647,040 identical)
2026-09-10 18:52:54 +08:00

29 KiB
Raw Blame History

GLM-5.3-NVFP4 RTX 6000D SGLang 双方案 B300 对标场景压测报告

  • 测试日期2026-09-10单日单机完成两臂E7b 臂当日调参 MRR 64 + decode 图 ≤64 后完成高并发复测,正文一律采用复测值)
  • 测试机174.1.60.86000D8 卡)
  • 对标基线飞书《GLM 5.3 SGLang Low-latency & High-Throughput 测试结果》B300 报告wiki UPB2w4Y5yi65qwkMxJJcZko5nUc
  • 测后状态60.8 在役服务TP4PP2@0.90 口径KV 池 647,040已原容器恢复并二次验证两轮测试后均按 rename→start 流程恢复;本轮复测拆台后 fired up + health 200 + 16K 单发与 C=4 抽测 ok配置与池逐字一致

1. 结论摘要

本轮在单台 8 卡 RTX 6000D 上,用 GLM-5.3-NVFP4 完整复刻 B300 报告的场景矩阵,测试了两套在役部署方案。两套方案代表完整部署形态,不是单参数 A/BTP2PP4 为 D 生产口径(吞吐/长上下文形态),TP8+EAGLE3+AR 为 E7b 配方(低延迟形态,含 custom allreduce 1stage 补丁)。

  • 低并发优先 E7bTP8+EAGLE3+AR:主场景 16K→512, C=1 输出 49.6 tok/s、TPOT 13.7 ms对 TP2PP416.7 tok/s、50.3 ms分别是 3.0×3.7×;长输出 1K→4K, C=1 输出 135 tok/s、TPOT 8.7 ms对 TP2PP420.3、49.8 ms6.7×5.7×
  • prefill 密集场景16K 输入)高并发优先 TP2PP4:主场景 C=64 达到 6,748 input tok/s / 211 output tok/s对 E7b3,188 / 99.6)为 2.1×;短输入 C=32/64 TP2PP4 仍占优276/341 vs 229/272 tok/s但差距收窄到 1.2×
  • E7b 初测的掉图断崖是配置产物,调参后已消除:初测 MRR=16 + decode 图仅覆盖 bs 18并发 >8 即掉图(主场景 C=16 TPOT P95 298 ms。按决策调参为 MRR=64 + decode 图桶 164其余配方逐字不变后复测C=16 TPOT P95 降至 228.8 ms16K 场景 C=16/32/64 输出 92.1/97.6/99.6 tok/s较初测 +18~33%E7b 可用并发窗口从 C≤8 扩到 C=64
  • TP2PP4 甜点在 C=16 之后:主场景输出吞吐从 C=8 的 101 近线性爬到 C=64 的 211 tok/sMRR48 尚未饱和);其 4.2 长输出 C=64 的 482 tok/s 已被 E7b 反超826.5),但 16K 主场景仍是本机 prefill 吞吐之王。
  • decode 密集负载1K 进、长出E7b 全并发档最优1K→4K C=8/32/64 输出 402/676/826.5 tok/s——C=64 为全场最高输出吞吐(超 TP2PP4 同点 482 达 72%TTFT P95 12.2 s、TPOT P95 85.1 msEAGLE accept 3.8~4.0。
  • 长上下文与容量边界只有 TP2PP4 可达128K C=1 两方案输出打平11.8 vs 11.9 tok/s但 TP2PP4 TTFT 减半18.2 s vs 37.6 s256K/512K/896K 边界 E7b 结构性不可测ctx 270,336 封顶 + KV 池 276,480 贴边TP2PP4 全部完成256K C=1/2/3、512K/896K C=1
  • DSA 特性在 6000D 复现TP2PP4 C=1 的 TPOT 对上下文长度不敏感16K/64K/128K = 50.3/50.0/49.7 ms 恒定),并发才是 TPOT 驱动因子16K 行 C=8→C=6470.9→203.7 ms
  • 与 B300 的绝对差距约 4~5×,边界 prefill 差距收窄到约 2×256K C=1 input 7,050 vs 17,457896K 4,153 vs 约1M 行 7,897。硬件与量化口径不同B300 报告未写明量化方式),绝对值仅量级可比,两份报告的结构性结论一致(见第 9 章)。
  • 全部 44 个有效测量点 0 回退retraction、0 OOM,冷缓存命中核验全部 ≤0.01E7b 256K C=1 首测触 hicache 宿主层陷阱,用全新文本重测达标,见 5.2 注记E7b 复测 10 点命中核验全部 0.0)。

2. 测试环境与配置

项目 TP2PP4D 生产口径) TP8+EAGLE3+ARE7b 配方)
硬件 单机 8 × NVIDIA RTX 6000D96 GB GDDR7nvidia-smi 可见 85,651 MiB/卡) 同左
模型 GLM-5.3-NVFP4modelopt 量化,/data/hf_models/GLM-5.3-NVFP4 同左
镜像 nightly-dev-20260828-daf63171 同左
并行 TP2 × PP4 TP8
投机解码 EAGLE3num_steps=4topk=1draft_tokens=5
mem-fraction-static 0.85 0.90
最大活跃请求MRR 48 64
Chunk Prefill 16,384 8,192
KV dtype fp8_e4m3 fp8_e4m3
KV 池(服务端实测) 1,040,384 tokens12.6~13.4 GB/rank无宿主层 276,480 tokens GPU15.8 GB/rank+ 分层缓存 hicache×3 宿主层write_through
radix cache 关(disable_radix_cache=True 开(分层缓存)
上下文上限 1,048,576config 原生) 270,336显存约束下的部署值
CUDA graph 常规捕获 decode/verify 图桶 bs 1641,2,3,4,6,8,12,16,24,32,48,64
custom allreduce 1stage 补丁注入(SGLANG_CUSTOM_ALLREDUCE_ALGO=1stage 环境强制8 rank SSKJ_CAR_PATCH_ACTIVE 日志验证全出现)
index_topk_freq 4override等于原生默认恒等 原生默认 4
质量门 6/7仅 tool-call 失败D 口径未配 parser历史已知其余全过 7/7

E7b 臂配置演进注记E7b 初测为 MRR=16 + decode 图桶 bs 18高并发点C>8出现 decode 掉图 + MRR 排队双击。按决策将 MRR 调至 64、decode 图桶扩至 164部署脚本 deploy_glm53_e7b_hicc.sh,其余配方与在役 E7b 逐字一致),三场景 C=8/16/32/64 共 10 点全部重测正文一律采用复测值C=1 各点与 5.1/5.2 长上下文点受 KV 池上限约束(活跃 1~4 条行为与该调参无关沿用初测值。C=8 锚点前后偏差 ≤3%16K 81.4→83.9、1K 152→151、1K→4K 412→402 tok/s证明两轮环境无漂移。初测原始数据留档于服务器 b300eq_e7b_20260910_1428/ 与库内 results/e7b/

因此,下文比较回答的是"两种部署形态谁更适合该负载",不能把差异单独归因于 EAGLE、PP 流水、chunk、radix 或图覆盖中的某一项(与 B300 报告同款声明)。

测量协议(对齐 B300 口径):

  • 冷缓存:--shared-frac 0,每点前 POST /flush_cache,服务端 Prefill 日志核算命中率,>0.01 重测一次,仍超停点排查;全矩阵命中核验最终全部达标。
  • 指标Input TPS / Output TPS / TTFT P95 / TPOT P95P95 为 nearest-rankInput TPS = 输入 token / 全程墙钟,与 B300 口径一致)。
  • 负载PG19 真实语料 token 切片(corpus_ids.jsoninput_ids 直打 /generatetemperature=0、ignore_eos、流式nreq = max(8, 2×并发),边界行 nreq=并发。
  • 并发档位按决策收敛16K/1K 类封顶 6464K 封 8、128K 封 4128K C=2 补一档);超出活跃上限的档位是排队观察点(与 B300 C=256 同性质,保留为有效观察)。
  • 语料已耗尽21.23M/21.30M),冷缓存口径下用回收窗口复用(窗口基址见附录 A逐记录 corpus_window 字段留档)。

两臂活跃上限MRR 与 KV 池决定,解释各行哪些并发是排队观察点):

场景 TP2PP4 活跃上限 E7b 活跃上限
16K 48MRR 16池 276,480 ÷ 约17.4KMRR64 不再是约束)
1K→128 48MRR 64MRR
1K→4K 48MRR ~52C=64 有 12 条排队)
64K 15 4
128K 7 2
256K 3 1池 262K KV / 276K 贴边)
512K / 896K 1 结构性不可ctx 270,336

3. 主场景16K 输入、512 输出

B300 跑了 C=1/8/32/64/128/256本机按 MRR 上限收敛为 C=1/8/16/32/64C=16 为本机甜点档B300 无此档C=128/256 超出两臂 MRR

并发 方案 Input TPS Output TPS TTFT P95 TPOT P95
1 TP2PP4 534 16.7 5.36 s 50.3 ms
1 TP8+EAGLE3+AR 1,587 49.6 3.98 s 13.7 ms
8 TP2PP4 3,236 101 14.79 s 70.9 ms
8 TP8+EAGLE3+AR 2,684 83.9 32.47 s 136.1 ms
16 TP2PP4 4,674 146 25.78 s 98.5 ms
16 TP8+EAGLE3+AR 2,947 92.1 59.91 s 228.8 ms
32 TP2PP4 6,185 193 46.43 s 152.0 ms
32 TP8+EAGLE3+AR 3,123 97.6 140.33 s 213.6 ms
64 TP2PP4 6,748 211 134.78 s 203.7 ms
64 TP8+EAGLE3+AR 3,188 99.6 293.21 s 214.6 ms

趋势:

  • 分界仍在 C=8但差距显著收窄C=1 E7b 全指标占优C=8 起 TP2PP4 四指标反超。输出吞吐差距从初测的 2.5× 收到 2.1×211 vs 99.6TPOT P95 在 C=64 已接近203.7 vs 214.6 ms
  • 调参消除掉图断崖E7b 输出从 C=8 的 83.9 单调爬到 C=64 的 99.6 tok/s+19%C=16 TPOT P95 从初测 298 ms 降到 228.8 msC=32/64 稳定在 ~214 ms——decode 图全程覆盖运行批。EAGLE accept 随并发从 2.56 爬到 2.95。
  • prefill 墙成为 E7b 的输出上限:其 input TPS 从 C=8 的 2,684 到 C=64 仅 +19%3,188TP2PP4 同区间 +108%3,236→6,748——chunk 8192 + TP8 无 PP 流水 vs chunk 16384 + PP4 摊满。16K 场景 E7b 输出被 prefill 封死在 ~100 tok/s 平台,并发再高也不突破。
  • E7b 本场景活跃上限 = KV 池(~16 条)C=32/64 为排队观察点TTFT P95 140/293 sTP2PP4 到 C=64 仍在爬坡C=32→64 +9%MRR48 未饱和),其 TTFT P95 134.8 s 同样需要准入控制。

4. 短输入与长输出

4.1 1K -> 128

并发 方案 Input TPS Output TPS TTFT P95 TPOT P95
1 TP2PP4 155 19.3 386 ms 49.3 ms
1 TP8+EAGLE3+AR 518 64.7 326 ms 14.3 ms
8 TP2PP4 815 102 1.69 s 72.9 ms
8 TP8+EAGLE3+AR 1,211 151 2.17 s 53.7 ms
32 TP2PP4 2,204 276 4.87 s 98.5 ms
32 TP8+EAGLE3+AR 1,833 229 7.09 s 150.6 ms
64 TP2PP4 2,724 341 19.96 s 101.8 ms
64 TP8+EAGLE3+AR 2,178 272 12.15 s 292.7 ms

短输入下 E7b 在 C≤8 显著占优C=8 输出 151 vs 1021.5×C=32/64 TP2PP4 输出仍领先276 vs 229、341 vs 272但差距只有 1.2×(初测为 2.73.3×),且 E7b 的 C=64 TTFT P95 反而更优12.15 vs 19.96 s——代价是 TPOT P95 292.7 ms64 条同时在飞TP2PP4 同点 MRR48 只保持 48 活跃TPOT 101.8 ms。B300 同场景 Low-Latency 到 C=128 才被反超,本机在 C=832 之间,主因是 MRR/池容量而非算力。

4.2 1K -> 4K

并发 方案 Output TPS TTFT P95 TPOT P95
1 TP2PP4 20.3 395 ms 49.8 ms
1 TP8+EAGLE3+AR 135 320 ms 8.7 ms
8 TP2PP4 101 1.87 s 79.4 ms
8 TP8+EAGLE3+AR 402 1.65 s 24.3 ms
32 TP2PP4 367 4.14 s 90.5 ms
32 TP8+EAGLE3+AR 676 6.19 s 54.6 ms
64 TP2PP4 482 337.92 s 95.5 ms
64 TP8+EAGLE3+AR 826.5 12.18 s 85.1 ms

长输出放大了两形态的差异——调参后 E7b 在本场景全并发档反超:

  • E7b 全档最优C=64 = 826.5 tok/s 为全场最高输出吞吐C=1/8/32/64 输出 135/402/676/826.5,对 TP2PP420.3/101/367/482为 6.7×/4.0×/1.8×/1.7×C=64 同时拿下 TTFT12.18 vs 337.92 s与 TPOT85.1 vs 95.5 ms双优。EAGLE accept 3.74.0——长输出让草稿模型进入"顺笔"状态,显著高于 4.1 短输出行2.02.1)。
  • 初测的排队断崖已消除C=32 TTFT P95 从初测 304.75 snreq=64 / MRR=16 四波串行)降到 6.19 sC=64 从未完成变为 12.18 s。MRR64 下 1K→4K 的池上限约 52 条活跃C=64 仅 12 条排队,请求几乎全程满飞。
  • TP2PP4 本场景全程被压:其优势场景是 prefill 密集16K 主场景1K 短进长出下既无 prefill 墙可摊、也无投机解码加成C=64 输出 482 tok/s 且 TTFT P95 338 s只适合离线批处理。

5. 长上下文观察

5.1 64K/128K -> 512

并发档位按用户指示收敛64K 封 8、128K 封 4另补 128K C=2B300 同场景为 64K C=8/32/64、128K C=8/32。

场景 并发 方案 Input TPS Output TPS TTFT P95 TPOT P95
64K→512 1 TP2PP4 1,834 14.3 10.32 s 50.0 ms
64K→512 1 TP8+EAGLE3+AR 2,877 22.5 17.17 s 13.5 ms
64K→512 4 TP2PP4 4,287 33.5 28.83 s 99.5 ms
64K→512 4 TP8+EAGLE3+AR 3,292 25.7 68.87 s 154.6 ms
64K→512 8 TP2PP4 5,650 44.1 53.38 s 161.8 ms
64K→512 8 TP8+EAGLE3+AR 3,280 25.6 149.45 s 157.5 ms
128K→512 1 TP2PP4 3,017 11.8 18.23 s 49.7 ms
128K→512 1 TP8+EAGLE3+AR 3,054 11.9 37.60 s 12.3 ms
128K→512 2 TP2PP4 4,310 16.8 32.42 s 83.7 ms
128K→512 2 TP8+EAGLE3+AR 3,145 12.3 75.81 s 162.2 ms
128K→512 4 TP2PP4 5,626 22.0 60.35 s 146.8 ms
128K→512 4 TP8+EAGLE3+AR 3,133 12.2 159.50 s 163.4 ms
  • 64K C=1 E7b 仍占优22.5 vs 14.3 tok/s但 128K C=1 两方案输出打平11.8 vs 11.9——prefill 逐渐成为长上下文的主导成本E7b 的 decode 优势被稀释;其 TTFT 反而慢 2×37.6 vs 18.2 s
  • C≥2 起 TP2PP4 全指标占优E7b 的 output TPS 在 64K/128K 行几乎不随并发变化22.5→25.6、11.9→12.2——KV 池把活跃钉在 ~4/~2 条,并发收益被容量封死(与 MRR/图调参无关,故沿用初测值)。
  • DSA 的 TPOT 上下文不变性TP2PP4 C=150.0 ms @64K ≈ 49.7 ms @128K ≈ 50.3 ms @16K与并发驱动性C=870.9 ms @16K → 161.8 ms @64K在本组完整呈现。

5.2 上下文边界

OSL=1只验证容量与 prefill不比较 Output TPS/TPOT——与 B300 同声明。B300 完成到约 1M本机以 896K=917,504 tokens 对应 B300"约 1M"档。)

输入长度 方案 已完成并发 C=1 Input TPS 最高并发 TTFT P95
256K TP2PP4 1/2/3 7,050 102.99 sC=3
256K TP8+EAGLE3+AR 1 2,867 91.45 sC=1
512K TP2PP4 1 5,662 92.60 sC=1
512K TP8+EAGLE3+AR 结构性不可ctx 270,336
896K TP2PP4 1 4,153 220.91 sC=1
896K TP8+EAGLE3+AR 结构性不可ctx 270,336
  • 256K C=1 两臂相差 2.5×7,050 vs 2,867 tok/sTP2PP4 的 chunk 16384 + PP4 流水对超长 prefill 的摊满优势,在边界长度上比 128K 行几乎打平进一步放大E7b 的 chunk 8192 代价随长度累积。
  • TP2PP4 边界 input TPS 随长度衰减平缓7,050 → 5,662 → 4,153896K 单条 220.9 s 完成、池 1,040,384 tokens 单条可容KV 917,504 + 余量)。
  • E7b 256K C=1 命中核验注记hicache 宿主层陷阱):首测命中率 0.9998、重试仍超——根因是该点 nreq=1 测量文本与预热完全相同256K 预热 KV262,160 tokens占池 94.8% 触发分层缓存宿主层下放,flush_cache 只清 GPU radix 树、清不掉宿主层。改用该服务实例从未发过的文本(窗口基址 9,900,000无预热重测命中 0.0,数据干净。此为分层缓存运维要点:宿主层缓存不受 flush_cache 影响,冷测必须换文本

6. 显存状态

  • TP2PP4:服务加载后空载 64.6 GiB/卡,矩阵峰值 85.0 GiB/卡(主场景 C=64 时逼近打满,最紧张卡余量约 0.6 GiB。mem 0.85 下 KV 池按卡容量贴满分配,属预期;继续上调 MRR 或上下文没有余量,扩容前必须先降 mem-fraction。
  • TP8+EAGLE3+AR:空载 77.5 GiB/卡EAGLE 草稿权重 + mem 0.90 大池 + 13 档 decode 图,图捕获完成后余 6.11 GB/卡),复测矩阵峰值 81.7 GiB/卡(余量约 3.9 GiB初测臂含 64K/128K/256K 长上下文的 hicache 传输,峰值 83.6 GiB/卡)。
  • 两臂全矩阵 0 OOM、0 retraction(全部 44 点 retractions_total=0——B300 未披露该指标,本机在自身容量上限内运行无回退。
  • 显存时间线逐 30 s 采样留档vram_timeline.csv可复核任一时刻的卡间分布。

7. 建议

  1. 低并发交互/agent 长思考C≤8用 E7b:主场景 C=1 TPOT 13.7 ms、长输出 C=8 输出 402 tok/s该区间对 TP2PP4 的优势最大3.0~6.7×)。
  2. prefill 密集/长上下文16K 主场景、输入 ≥64K用 TP2PP4:主场景 C=64 输出 211 tok/sE7b 99.6、128K C=1 TTFT 18.2 s、896K 可达MRR48 内未饱和,吞吐上限即 MRR。
  3. 负载形态分界线(调参后)decode 密集短进长出1K→4K任何并发档 E7b 全优C=64 输出 826 vs 482 tok/sprefill 密集16K 主场景C≥8 TP2PP4 全优211 vs 100短输入短输出1K→128C≤8 E7b、C≥32 TP2PP4差距仅 1.2×)。选型看输入/输出长度分布,不能只看并发。
  4. E7b 剩余瓶颈在 prefill 墙与 KV 池,不再在图MRR64 + 图桶 164 已消掉掉图断崖本报告即复测值16K 主场景输出封顶 ~100 tok/s 是 chunk 8192 + TP8 无 PP 流水所致。扩并发容量的唯一杠杆是 KV 池hicache 宿主层只救命中场景,不增并发容量)。
  5. 边界与超长上下文只有 TP2PP4 口径可服务E7b 若要对标 B300 512K/约1M 行,需要 ctx ≥524,288 与池 ≥52 万 tokens 的部署形态本版ctx 270,336 / 池 276,480结构性不可达。
  6. 不要把两臂差异单归因 EAGLE两臂同时差在并行拓扑、chunk、radix、MRR 与图覆盖;单变量消融未做(与 B300 报告建议 3 同款)。
  7. 生产容量同时设吞吐和延迟 SLOTP2PP4 主场景 C=64 输出最高但 TTFT P95 已到 135 sE7b 主场景 C=64 TTFT P95 293 s池限 16 活跃的排队)。只看峰值 TPS 会掩盖排队长尾。
  8. 分层缓存运维:宿主层缓存不受 flush_cache 影响,任何冷缓存测量/复测必须更换输入文本(见 5.2 注记)。

8. 原始结果与复现

  • 服务器原始结果60.8
    • TP2PP4 臂:/root/bench_logs/b300eq_tp2pp4_20260910_1138/all_results.jsonl 24 点、status.txt、server_facts.txt、gpu_inventory、vram_timeline.csv
    • E7b 臂初测MRR16/图 18留档基线/root/bench_logs/b300eq_e7b_20260910_1428/all_results.jsonl 20 条16 点 OK + 4.2 C=64 用户中止 + 256K C=1 干净重测status.txt 含 4 个结构性跳过与 HIT_FAIL_FINAL 首测记录)
    • E7b 臂复测MRR64/图 164正文采用值/root/bench_logs/b300eq_e7b64_20260910_1732/all_results.jsonl 10 点全 OK16K/4.1/4.2 三场景 C=8/16/32/64命中核验全 0.0、0 retraction前后对比表 /root/bench_logs/retest_compare.md
    • 资产 md5 台账:/root/bench_logs/b300eq_md5_ledger.txt
  • 本地镜像:D:\sskj\b300eq\{tp2pp4,e7b,e7b64}\(上述全部文件)、D:\sskj\b300eq\report_tables.md(表格生成器输出)、D:\sskj\b300eq\retest_compare.md(复测前后对比)
  • 部署脚本:/root/deploy_glm53_pp4.shmd5 def3c64c…与库内 sskj main 副本一致)、/root/deploy_glm53_607_exp.shE7b 在役配方)、/root/deploy_glm53_e7b_hicc.sh165db732…E7b 高并发版MRR64 + 图桶 164其余与前者逐字一致复测驱动 /root/run_retest_e7b64.shfe46da2e…、对比生成器 /root/gen_retest_compare.pyCAR 补丁:/root/patches/custom_all_reduce.pya8fc9a50…+ custom_all_reduce_utils.py65a4d22b…三处60.7 原件/本地/库内md5 一致
  • 测量工具:/root/bench_corpus_v2.pymd5 1e34dd8d…p95 nearest-rank + 逐请求 dump/root/extract_summary.py4c126d06…/root/run_b300_matrix.sh5892b446…矩阵驱动alive/idle_wait/prewarm/flush/命中核验/重试/VRAM 采样)
  • 复现命令(单点示例):
# 冷缓存压测E7b 256K C=1 干净版)
python3 /root/bench_corpus_v2.py --input-len 262144 --output-len 1 --shared-frac 0 \
  --concurrency 1 --num-requests 1 --run-id 9551 --pool-override 9900000 \
  --dump-records $L/b52_256k_c1_v2_records.jsonl
# 全矩阵nohup bash /root/run_b300_matrix.sh <arm> > <progress.log> 2>&1 &
# E7b 高并发复测MRR64/图≤6410 点nohup bash /root/run_retest_e7b64.sh > <progress.log> 2>&1 &

9. 与 B300 对比观察

口径声明B300 报告未写明模型量化方式(若为原始 BF16 权重,则与本机 NVFP4 非同模型形态);硬件为 8×B300288 GB HBM3evs 本机 8×RTX 6000D96 GB GDDR7镜像 v0.5.18-cu130-dev4 vs nightly-20260828-daf63171。绝对值仅量级可比,本对比只对结构性结论负责

  • 定性结构完全复现低延迟配方B300 Low-Latency = TP8+EAGLE vs 本机 E7b = TP8+EAGLE3+AR在 C=1 占优、吞吐配方B300 High-Throughput = DP8+DeepEP vs 本机 TP2PP4 = D 生产口径)在高并发占优——两套硬件上"低延迟 vs 高吞吐"的分野方向一致。
  • 分界点本机更靠前,且调参后由负载形态决定B300 的交叉点在 C=64~128主场景 HT C=128 反超 33%);本机主场景交叉仍在 C=8 附近(容量上限所致:本臂 MRR64/池贴边 16 活跃 vs B300 配方 256/默认,先于算力撞墙),但 decode 密集场景1K→4KE7b 调参后全档占优、无交叉——这一形态差异 B300 报告未呈现。
  • 绝对差距 4~5×主场景C=1 输出 246 vs 49.6 tok/s5.0×、input 7,882 vs 1,5875.0×);吞吐侧峰值 997 vs 2114.7×、31,889 vs 6,7484.7×)。与显存带宽硬件代差量级一致。
  • 边界 prefill 差距收窄到 ~2×256K C=1 input 7,050 vs 17,4572.5×)→ 512K 5,662 vs 12,4212.2×)→ 896K/约1M 4,153 vs 7,8971.9×)。计算密集的超长 prefill 是 6000D 相对最能打的位置PP 流水摊满 + 带宽占比下降)。
  • TPOT 差距小于吞吐差距B300 LL C=1 4.36 ms vs E7b 13.7 ms3.1×);高并发侧 B300 HT C=128 165 ms vs TP2PP4 C=64 204 ms1.2×——NVFP4 + DSA 把 decode 单步成本压得相对不差,差距主要在吞吐面。
  • 饱和形态不同B300 LL 在 C=64 后进入 24K input tok/s 平台、HT 在 C=128 达峰后 C=256 回退 19%;本机 TP2PP4 到 C=64 仍在爬坡MRR 未饱和E7b 调参后在 16K 场景呈 ~100 tok/s 输出平台(池限 16 活跃 + prefill 墙)、在 1K→4K 场景爬到 826 tok/s 无回退。本机没有一档出现吞吐回退——"甜点=并发上限"由 MRR/池决定而非算力。
  • EAGLE 配方差异B300 LL 为 5 steps/6 draft tokens本机 E7b 为 4 steps/topk1/5 draft tokens本机实测 accept 2.04.0(短输出 2.0、主场景 2.13.0、长输出 3.7~4.0,随 decode 深入上升。B300 未披露 accept无法直接对比投机效率。
  • 容量边界差距最大B300 两模式都完成约 1M 输入 C=1/2/4本机仅 TP2PP4 可达 896K 且 C=1 单条(池 1,040,384 刚容一条E7b 连 512K 都结构性不可测ctx 270,336。96 GB 卡上"上下文边界=显存边界"比 B300 严酷得多。

附录 A语料窗口映射回收窗口

语料总量 21,296,780 tokens此前场景一/二战役已消费至 21,235,008。冷缓存协议下回收复用窗口基址 --pool-override 显式指定,每点窗口在基址上顺序推进(逐记录 corpus_window.start/end 留档),每点 flush + 命中核验 ≤0.01 保证冷。E7b 复测臂沿用与初测相同的窗口基址2,300,000 / 4,500,000 / 4,700,000——复测为全新容器实例这些文本对 hicache 宿主层重新成为"处女文本",冷缓存协议成立(复测 10 点命中核验全部 0.0)。

场景 窗口基址 备注
主场景 16K→512 2,300,000
4.1 短输入 1K→128 4,500,000
4.2 长输出 1K→4K 4,700,000
5.1 64K→512 5,000,000
5.1 128K→512 6,200,000
5.2 256K→1 8,400,000 E7b 干净重测改用 9,900,000实例首用文本避 hicache 宿主层残留)
5.2 512K→1 9,300,000 仅 TP2PP4
5.2 896K→1 9,900,000 仅 TP2PP4

附录 B全量指标含 mean/p95/max、回退、投机接受长度

场景点 方案 ok/nreq wall(s) out tok/s in tok/s TTFT mean/p95/max(s) TPOT mean/p95/max(ms) retractions accept
b3_16k_c1 TP2PP4 8/8 245.55 16.68 533.8 5.35/5.36/5.36 49.6/50.3/50.3 0 None
b3_16k_c1 TP8+EAGLE3+AR 8/8 82.58 49.6 1587.15 3.93/3.98/3.98 12.5/13.7/13.7 0 2.138
b3_16k_c8 TP2PP4 16/16 81.0 101.13 3236.22 10.05/14.79/14.79 59.5/70.9/70.9 0 None
b3_16k_c8 TP8+EAGLE3+AR 16/16 97.66 83.88 2684.26 12.12/32.47/32.47 69.2/136.1/136.1 0 2.556
b3_16k_c16 TP2PP4 32/32 112.16 146.08 4674.5 15.53/25.78/25.84 79.2/98.5/101.2 0 None
b3_16k_c16 TP8+EAGLE3+AR 32/32 177.89 92.1 2947.27 19.76/59.91/63.69 129.7/228.8/275.9 0 2.485
b3_16k_c32 TP2PP4 64/64 169.54 193.27 6184.73 26.52/46.43/47.89 113.7/152.0/157.3 0 None
b3_16k_c32 TP8+EAGLE3+AR 64/64 335.79 97.58 3122.67 82.65/140.33/154.66 138.1/213.6/277.5 0 2.777
b3_16k_c64 TP2PP4 128/128 310.79 210.87 6747.91 63.05/134.78/139.99 139.2/203.7/214.3 0 None
b3_16k_c64 TP8+EAGLE3+AR 128/128 657.79 99.63 3188.2 204.27/293.21/322.84 142.5/214.6/276.6 0 2.954
b41_1k_c1 TP2PP4 8/8 52.95 19.34 154.7 0.38/0.39/0.39 49.1/49.3/49.3 0 None
b41_1k_c1 TP8+EAGLE3+AR 8/8 15.82 64.74 517.93 0.30/0.33/0.33 13.2/14.3/14.3 0 2.028
b41_1k_c8 TP2PP4 16/16 20.1 101.91 815.3 1.31/1.69/1.69 68.6/72.9/72.9 0 None
b41_1k_c8 TP8+EAGLE3+AR 16/16 13.53 151.33 1210.61 1.25/2.17/2.17 42.1/53.7/53.7 0 1.992
b41_1k_c32 TP2PP4 64/64 29.73 275.55 2204.4 3.89/4.87/4.88 85.6/98.5/106.8 0 None
b41_1k_c32 TP8+EAGLE3+AR 64/64 35.75 229.18 1833.42 2.99/7.09/7.10 111.9/150.6/179.8 0 2.035
b41_1k_c64 TP2PP4 128/128 48.11 340.53 2724.25 8.14/19.96/20.01 93.3/101.8/125.1 0 None
b41_1k_c64 TP8+EAGLE3+AR 128/128 60.18 272.24 2177.88 4.76/12.15/13.48 191.1/292.7/331.5 0 2.094
b42_1k4k_c1 TP2PP4 8/8 1614.16 20.3 5.08 0.39/0.40/0.40 49.2/49.8/49.8 0 None
b42_1k4k_c1 TP8+EAGLE3+AR 8/8 242.18 135.31 33.83 0.31/0.32/0.32 7.3/8.7/8.7 0 3.701
b42_1k4k_c8 TP2PP4 16/16 649.69 100.87 25.22 1.35/1.87/1.87 79.0/79.4/79.4 0 None
b42_1k4k_c8 TP8+EAGLE3+AR 16/16 162.84 402.47 100.62 0.95/1.65/1.65 18.5/24.3/24.3 0 3.951
b42_1k4k_c32 TP2PP4 64/64 714.14 367.08 91.77 1.98/4.14/4.15 86.1/90.5/91.1 0 None
b42_1k4k_c32 TP8+EAGLE3+AR 64/64 387.9 675.81 168.95 2.58/6.19/6.20 43.0/54.6/60.4 0 3.82
b42_1k4k_c64 TP2PP4 128/128 1088.63 481.6 120.4 80.74/337.92/338.47 91.2/95.5/96.3 0 None
b42_1k4k_c64 TP8+EAGLE3+AR 128/128 634.35 826.5 206.62 4.36/12.18/12.50 69.9/85.1/101.5 0 3.878
b51_64k_c1 TP2PP4 8/8 285.91 14.33 1833.72 10.28/10.32/10.32 49.8/50.0/50.0 0 None
b51_64k_c1 TP8+EAGLE3+AR 8/8 182.23 22.48 2877.06 17.04/17.17/17.17 11.2/13.5/13.5 0 2.468
b51_64k_c4 TP2PP4 8/8 122.3 33.49 4286.94 19.55/28.83/28.83 81.4/99.5/99.5 0 None
b51_64k_c4 TP8+EAGLE3+AR 8/8 159.24 25.72 3292.45 30.55/68.87/68.87 94.9/154.6/154.6 0 2.438
b51_64k_c8 TP2PP4 16/16 185.59 44.14 5650.11 31.83/53.38/53.38 119.2/161.8/161.8 0 None
b51_64k_c8 TP8+EAGLE3+AR 16/16 319.66 25.63 3280.31 90.92/149.45/149.45 105.8/157.5/157.5 0 2.442
b51_128k_c1 TP2PP4 8/8 347.5 11.79 3017.45 18.21/18.23/18.23 49.4/49.7/49.7 0 None
b51_128k_c1 TP8+EAGLE3+AR 8/8 343.36 11.93 3053.83 37.59/37.60/37.60 10.4/12.3/12.3 0 2.728
b51_128k_c2 TP2PP4 8/8 243.3 16.84 4309.84 25.27/32.42/32.42 69.6/83.7/83.7 0 None
b51_128k_c2 TP8+EAGLE3+AR 8/8 333.36 12.29 3145.44 48.21/75.81/75.81 68.0/162.2/162.2 0 2.769
b51_128k_c4 TP2PP4 8/8 186.37 21.98 5626.35 39.29/60.35/60.35 105.4/146.8/146.8 0 None
b51_128k_c4 TP8+EAGLE3+AR 8/8 334.71 12.24 3132.76 110.14/159.50/159.50 68.7/163.4/163.4 0 2.595
b52_256k_c1 TP2PP4 1/1 37.18 0.03 7050.23 37.18/37.18/37.18 0 None
b52_256k_c1 TP8+EAGLE3+AR 1/1 91.45 0.01 2866.59 91.45/91.45/91.45 0 None
b52_256k_c2 TP2PP4 2/2 70.19 0.03 7469.22 53.69/70.12/70.12 0 None
b52_256k_c3 TP2PP4 3/3 103.12 0.03 7626.22 70.12/102.99/102.99 0 None
b52_512k_c1 TP2PP4 1/1 92.6 0.01 5662.03 92.60/92.60/92.60 0 None
b52_896k_c1 TP2PP4 1/1 220.91 0.0 4153.24 220.91/220.91/220.91 0 None

E7b 的 16K/4.1/4.2 场景 C=8~C=64 共 10 点为调参后MRR64/decode 图 164复测值即正文采用值C=1 各点与 5.1/5.2 行沿用初测值活跃数受池上限约束与调参无关。E7b 256K/512K/896K C>1 为结构性跳过256K C=1 为全新文本干净重测值(窗口 9,900,000。初测MRR16/图 18全量原始数据留档于 results/e7b/