- deploy_glm53_e7b_hicc.sh (md5 165db732): only delta vs 607_exp = MRR 16->64 + cuda-graph-bs-decode 1..64; KV pool 276,480 unchanged, avail 6.11GB after capture - 10 retest points (16K/4.1/4.2 at c8/16/32/64) all OK, hit=0.0 (fresh container = recycled windows virgin again), 0 retraction, QG 7/7 - verdicts: 16K output 92.1/97.6/99.6 (+18~33% vs initial, still TP2PP4-dominated, prefill wall ~100 plateau); 4.1 c32/64 229/272 (gap narrowed to 1.2x); 4.2 402/676/826.5 - E7b wins ALL cc tiers, c64 826.5 tok/s = machine-wide best output (+72% vs TP2PP4 482), TTFT 12.18s / TPOT 85.1ms; c8 anchors within +-3% prove no env drift - REPORT.md + Feishu A7V3wZTQeifCB4krdi6cA834nW9 overwritten in place (user directive: no appended chapter); initial MRR16 run archived as baseline in results/e7b/ - provenance.md: e7b64 VRAM (idle 79.3k, peak 83,627 MiB), second in-service restore verified (fired up/health 200/16K+C4 spot/KV pool 647,040 identical)
7.8 KiB
GLM-5.3-NVFP4 双方案 B300 对标场景矩阵压测 — 60.8(6000D)
日期:2026-09-10 | 机器:174.1.60.8(8×RTX 6000D,96GB GDDR7,无 NVLink)
模型:GLM-5.3-NVFP4(modelopt)| 镜像:nightly-dev-20260828-daf63171(两臂同)
对标基线:飞书《GLM 5.3 | SGLang | Low-latency & High-Throughput 测试结果》(B300 报告,wiki UPB2w4Y5yi65qwkMxJJcZko5nUc)
完整报告:本目录 REPORT.md(= 飞书发布版 A7V3wZTQeifCB4krdi6cA834nW9;E7b 高并发复测后整文更新,正文采用复测值)
目标
在 6000D 上复刻 B300 报告的全部场景(主场景 16K→512、4.1 短输入、4.2 长输出、5.1 长上下文、5.2 边界),对两套在役部署方案各跑一遍完整矩阵,产出对齐 B300 8 章结构的对标报告。E7b 初测暴露 MRR16 + decode 图 bs1-8 的高并发掉图断崖后,按用户决策调参为 MRR64 + 图桶 1-64(deploy_glm53_e7b_hicc.sh,其余配方逐字不变)复测三场景 C=8/16/32/64 共 10 点,报告正文一律采用复测值(C=1 与 5.1/5.2 点受池上限约束、与调参无关,沿用初测值;C=8 锚点前后偏差 ≤3% 证两轮环境无漂移)。测后 60.8 在役服务(TP4PP2@0.90)原容器恢复并二次验证。
实验臂
| 臂 | 方案 | 关键配置 | 质量门 |
|---|---|---|---|
| tp2pp4 | D 生产口径(deploy_glm53_pp4.sh) | TP2PP4、mem0.85、MRR48、cps16384、radix 关、KV fp8_e4m3 池 1,040,384、无投机、index_topk_freq=4(=原生默认,恒等)、ctx 1,048,576 | 6/7(仅 tool-call:无 parser,历史已知) |
| e7b | TP8+EAGLE3+AR 初测(deploy_glm53_607_exp.sh + CAR 补丁注入) | TP8、EAGLE 4/1/5、mem0.90、MRR16、cps8192、radix 开+hicache×3、KV fp8_e4m3 GPU 池 276,480、decode 图 bs1-8、ctx 270,336、custom-AR 1stage(SGLANG_CUSTOM_ALLREDUCE_ALGO=1stage,8 rank SSKJ_CAR_PATCH_ACTIVE 验证) |
7/7 |
| e7b64 | TP8+EAGLE3+AR 高并发复测(deploy_glm53_e7b_hicc.sh,= e7b 仅改 MRR 16→64 + decode 图桶 1-64) | 其余配方与 e7b 逐字一致;图捕获后 avail 6.11 GB/卡,KV 池 276,480 不变 | 7/7 |
场景矩阵与并发档位(用户裁决收敛:16K 封 64、64K/128K 封 8/4)
| B300 章节 | 场景 | 并发档位 | TP2PP4 活跃上限 | E7b 活跃上限 |
|---|---|---|---|---|
| §3 主场景 | 16K→512 | 1/8/16/32/64 | 48(MRR) | 16(池 276,480÷17.4K;复测臂 MRR64 不再是约束) |
| §4.1 | 1K→128 | 1/8/32/64 | 48 | 64(复测臂 MRR;初测 16) |
| §4.2 | 1K→4K | 1/8/32/64 | 48 | ~52(池;复测臂 c64 有 12 条排队;初测 c64 中止 rc=143,复测已补齐) |
| §5.1 | 64K→512 | 1/4/8 | 15(池) | 4(池) |
| §5.1 | 128K→512 | 1/2/4 | 7(池) | 2(池) |
| §5.2 | 256K→1 | 1/2/3 | 3(池) | 1(池贴边) |
| §5.2 | 512K→1 | 1 | 1 | 结构性不可(ctx) |
| §5.2 | 896K→1(代 B300"约1M") | 1 | 1 | 结构性不可(ctx) |
测量协议:冷缓存(shared-frac 0)+ 每点 flush + 服务端命中核验 ≤0.01(超限重试一次);nreq=max(8, 2×cc);P95 nearest-rank 对齐 B300;语料耗尽(21.23M/21.30M)下用回收窗口(--pool-override 基址映射见 REPORT 附录 A;复测臂为全新容器实例,同基址文本对 hicache 宿主层重新成为处女文本,命中核验全 0.0)。有效测量点 44 个(tp2pp4 24 + e7b/e7b64 合计 20:初测 10 点沿用 + 复测 10 点采用),全点 0 retraction、0 OOM。
判决速览(详见 REPORT.md,E7b 数值均为复测值)
- 掉图断崖已修复(复测核心判决):初测 MRR16 + 图 bs1-8 把 E7b 窗口封死 C≤8(16K c16 TPOT 298ms 断崖);调参 MRR64 + 图桶 1-64 后 C=16 TPOT 降至 228.8ms,16K c16/32/64 输出 92.1/97.6/99.6 tok/s(较初测 +18~33%),窗口扩到 C=64。
- 分界负载形态化:prefill 密集(16K 主场景)仍 TP2PP4 占优——c64 out 211 vs 99.6 = 2.1×(自初测 2.5× 收窄),E7b 输出被 prefill 墙(chunk8192+TP8 无 PP 流水)封在 ~100 tok/s 平台;短输入 c32/64 TP2PP4 领先收窄到 1.2×(276/341 vs 229/272),且 E7b c64 TTFT 反超(12.15 vs 19.96s)。
- decode 密集(1K→4K)E7b 全档反超:c8/32/64 = 402/676/826.5 tok/s,c64 为全场最高输出吞吐(超 TP2PP4 同点 482 达 72%),TTFT 12.18s、TPOT 85.1ms 双优;初测排队断崖(c32 TTFT 305s)消除为 6.19s。
- E7b C=1 优势不变:16K out 49.6 vs 16.7=3.0×、TPOT 13.7 vs 50.3ms=3.7×;1K→4K out 135 vs 20.3=6.7×、TPOT 8.7ms。
- TP2PP4 甜点 c16+:16K 近线性至 c64(MRR48 未饱和);边界 256K/512K/896K 只有 TP2PP4 可达(input 7,050/5,662/4,153 tok/s);E7b ctx 270,336 结构性封顶。
- DSA 复现:C=1 TPOT 对上下文不敏感(50.3/50.0/49.7ms @16/64/128K),并发才是驱动(c8: 70.9→161.8ms)。
- vs B300:定性结构复现(LL/HT 分野一致),绝对差 4-5×,边界 prefill 差距收窄至 ~2×;主场景分界本机更靠前(C8 vs C64-128,容量上限而非算力),decode 密集场景调参后 E7b 全档无交叉(B300 报告未呈现该形态)。
关键坑位(复测必读)
- hicache 宿主层陷阱:256K prewarm KV 占池 94.8% 触发宿主层下放,
flush_cache清不掉宿主层 → 同文本测量命中 0.9998。冷缓存复测必须换该实例从未发过的文本(本战役 E7b 256K C=1 用窗口 9,900,000 重测达标;e7b64 复测臂为全新容器实例,沿用同基址窗口即满足该条件,10 点命中全 0.0)。 - 语料已耗尽:回收窗口复用仅在 flush+命中核验协议下有效;TP2PP4 臂 radix 本来就关,零污染。
- 在役保全流程:
docker stop→docker rename glm53-nvfp4 glm53-nvfp4-insvc(必须先改名,E7b 部署脚本会 rm -f 同名容器)→ 测毕rename回 +start。docker stop/rm 偶发 "zombie PID" 报错是收尾边界现象,容器终态 exited(137)、显存归零,稍等重试即可。
资产与 md5 台账(60.8 执行件 = 本目录 = 60.7 原件 三方一致)
1e34dd8d813ccb7ac8243e8d1573a49e bench_corpus_v2.py (scripts/)
4c126d067d33b5ea27c268f37561634c extract_summary.py (scripts/)
5892b44610b2ce61f533f1721105625e run_b300_matrix.sh (scripts/)
165db732fa3237a80a4d53a963a128e7 deploy_glm53_e7b_hicc.sh (scripts/,E7b 高并发版:MRR64+图桶1-64,其余与 607_exp 逐字一致)
fe46da2eb22f5ae23eb963bb9d467922 run_retest_e7b64.sh (scripts/,10 点复测驱动,run-id 96xx)
376bedfd42fa29ba9de8bfdf0c67c3b2 gen_retest_compare.py (scripts/,复测前后对比表生成器)
def3c64c5dc19e1d507080e3366c3762 deploy_glm53_pp4.sh (见 dual_scenario_bench/scripts/,md5 对照一致)
21db641f1d997e26fcf1ddc97163b87e deploy_glm53_607_exp.sh (见 dual_scenario_bench/scripts/,md5 对照一致)
a8fc9a504c041acc40831a848b4985d8 patches/custom_all_reduce.py
65a4d22bd87ae343e7d68c4879c14f98 patches/custom_all_reduce_utils.py
gen_report_tables.py 为本地表格生成器(md5 未入台账,60.8 侧执行件同源)。
原始数据
- 本目录
results/{tp2pp4,e7b,e7b64}/:all_results.jsonl(逐点 SUMMARY + 命中核验)、status.txt、server_facts.txt(启动参数+池分配日志摘录)、gpu_inventory_idle/final.csv、vram_timeline.csv(30s 采样全矩阵;csv/log 属 gitignore 中间件,关键事实折叠于 provenance.md) - 60.8 侧:
/root/bench_logs/b300eq_tp2pp4_20260910_1138/、/root/bench_logs/b300eq_e7b_20260910_1428/(初测留档基线)、/root/bench_logs/b300eq_e7b64_20260910_1732/(复测,正文采用值)+/root/bench_logs/retest_compare.md(前后对比,本目录 results/e7b64/ 有同名镜像) - E7b 256K C=1:all_results.jsonl 同 tag 共 4 条,最后一条为干净重测值(生成器 dict 载入后写覆盖,天然生效)