# GLM-5.3-NVFP4 | RTX 6000D | SGLang 双方案 B300 对标场景压测报告 - 测试日期:2026-09-10(单日单机完成两臂) - 测试机:174.1.60.8(6000D,8 卡) - 对标基线:飞书《GLM 5.3 | SGLang | Low-latency & High-Throughput 测试结果》(B300 报告,wiki UPB2w4Y5yi65qwkMxJJcZko5nUc) - 测后状态:60.8 在役服务(TP4PP2@0.90 口径)已原容器恢复并验证(health 200 + 16K 抽测 ok + 显存水位与停役前一致) ## 1. 结论摘要 本轮在单台 8 卡 RTX 6000D 上,用 GLM-5.3-**NVFP4** 完整复刻 B300 报告的场景矩阵,测试了两套在役部署方案。两套方案代表完整部署形态,不是单参数 A/B:**TP2PP4** 为 D 生产口径(吞吐/长上下文形态),**TP8+EAGLE3+AR** 为 E7b 配方(低延迟形态,含 custom allreduce 1stage 补丁)。 - **低并发优先 E7b(TP8+EAGLE3+AR)**:主场景 `16K→512, C=1` 输出 49.6 tok/s、TPOT 13.7 ms,对 TP2PP4(16.7 tok/s、50.3 ms)分别是 **3.0×** 与 **3.7×**;长输出 `1K→4K, C=1` 输出 135 tok/s、TPOT 8.7 ms,对 TP2PP4(20.3、49.8 ms)是 **6.7×** 与 **5.7×**。 - **高并发优先 TP2PP4**:主场景 C=64 达到 6,748 input tok/s / 211 output tok/s,对 E7b(2,697 / 84.3)均为 **2.5×**;短输入 C=32/64 输出 276/341 tok/s,对 E7b(100/103)为 **2.7~3.3×**。 - **E7b 的可用并发窗口比 B300 Low-Latency 窄一个数量级**:MRR=16 且 CUDA graph 仅覆盖 decode bs 1–8,并发 ≥8 即掉图,主场景 C=16 TPOT P95 跳到 297.8 ms(C=8 为 135.1 ms;同点 TP2PP4 仅 98.5 ms)。E7b 的生产甜点上限 = **C≤8**。 - **TP2PP4 甜点在 C=16 之后**:主场景输出吞吐从 C=8 的 101 近线性爬到 C=64 的 211 tok/s(MRR48 尚未饱和),4.2 长输出 C=64 达全场最高 482 tok/s(但 TTFT P95 338 s,需要排队预算)。 - **decode 密集低并发的最优解是 E7b C=8**:`1K→4K, C=8` 输出 412 tok/s、TPOT 22.5 ms,对 TP2PP4(101 tok/s、79.4 ms)为 4.1×;EAGLE 实测 accept length 4.0。 - **长上下文与容量边界只有 TP2PP4 可达**:128K C=1 两方案输出打平(11.8 vs 11.9 tok/s)但 TP2PP4 TTFT 减半(18.2 s vs 37.6 s);256K/512K/896K 边界 E7b 结构性不可测(ctx 270,336 封顶 + KV 池 276,480 贴边),TP2PP4 全部完成(256K C=1/2/3、512K/896K C=1)。 - **DSA 特性在 6000D 复现**:TP2PP4 C=1 的 TPOT 对上下文长度不敏感(16K/64K/128K = 50.3/50.0/49.7 ms 恒定),并发才是 TPOT 驱动因子(16K 行 C=8→C=64:70.9→203.7 ms)。 - **与 B300 的绝对差距约 4~5×**,边界 prefill 差距收窄到约 2×(256K C=1 input 7,050 vs 17,457;896K 4,153 vs 约1M 行 7,897)。硬件与量化口径不同(B300 报告未写明量化方式),绝对值仅量级可比,两份报告的结构性结论一致(见第 9 章)。 - 全部 41 个有效测量点 **0 回退(retraction)、0 OOM**,冷缓存命中核验全部 ≤0.01(E7b 256K C=1 首测触 hicache 宿主层陷阱,用全新文本重测达标,见 5.2 注记)。 ## 2. 测试环境与配置 | 项目 | TP2PP4(D 生产口径) | TP8+EAGLE3+AR(E7b 配方) | |-|-|-| | 硬件 | 单机 8 × NVIDIA RTX 6000D(96 GB GDDR7,nvidia-smi 可见 85,651 MiB/卡) | 同左 | | 模型 | GLM-5.3-NVFP4(modelopt 量化,/data/hf_models/GLM-5.3-NVFP4) | 同左 | | 镜像 | `nightly-dev-20260828-daf63171` | 同左 | | 并行 | TP2 × PP4 | TP8 | | 投机解码 | 无 | EAGLE3,num_steps=4,topk=1,draft_tokens=5 | | `mem-fraction-static` | 0.85 | 0.90 | | 最大活跃请求(MRR) | 48 | 16 | | Chunk Prefill | 16,384 | 8,192 | | KV dtype | fp8_e4m3 | fp8_e4m3 | | KV 池(服务端实测) | **1,040,384 tokens**(12.6~13.4 GB/rank,无宿主层) | **276,480 tokens GPU**(15.8 GB/rank)+ 分层缓存 hicache×3 宿主层(write_through) | | radix cache | 关(`disable_radix_cache=True`) | 开(分层缓存) | | 上下文上限 | 1,048,576(config 原生) | 270,336(显存约束下的部署值) | | CUDA graph | 常规捕获 | decode 图 bs 1–8(bs>8 掉图) | | custom allreduce | — | 1stage 补丁注入(`SGLANG_CUSTOM_ALLREDUCE_ALGO=1stage` 环境强制;8 rank `SSKJ_CAR_PATCH_ACTIVE` 日志验证全出现) | | `index_topk_freq` | 4(override,等于原生默认,恒等) | 原生默认 4 | | 质量门 | 6/7(仅 tool-call 失败:D 口径未配 parser,历史已知;其余全过) | **7/7** | 因此,下文比较回答的是"两种部署形态谁更适合该负载",不能把差异单独归因于 EAGLE、PP 流水、chunk、radix 或图覆盖中的某一项(与 B300 报告同款声明)。 **测量协议**(对齐 B300 口径): - 冷缓存:`--shared-frac 0`,每点前 `POST /flush_cache`,服务端 Prefill 日志核算命中率,>0.01 重测一次,仍超停点排查;全矩阵命中核验最终全部达标。 - 指标:Input TPS / Output TPS / TTFT P95 / TPOT P95(P95 为 nearest-rank;Input TPS = 输入 token / 全程墙钟,与 B300 口径一致)。 - 负载:PG19 真实语料 token 切片(`corpus_ids.json`),input_ids 直打 `/generate`,temperature=0、ignore_eos、流式;nreq = max(8, 2×并发),边界行 nreq=并发。 - 并发档位按决策收敛:16K/1K 类封顶 64;64K 封 8、128K 封 4(128K C=2 补一档);超出活跃上限的档位是**排队观察点**(与 B300 C=256 同性质,保留为有效观察)。 - 语料已耗尽(21.23M/21.30M),冷缓存口径下用**回收窗口**复用(窗口基址见附录 A,逐记录 `corpus_window` 字段留档)。 **两臂活跃上限**(MRR 与 KV 池决定,解释各行哪些并发是排队观察点): | 场景 | TP2PP4 活跃上限 | E7b 活跃上限 | |-|-|-| | 16K / 1K | 48(MRR) | 16(MRR,=池贴边) | | 64K | 15(池) | 4(池) | | 128K | 7(池) | 2(池) | | 256K | 3(池) | 1(池 262K KV / 276K 贴边) | | 512K / 896K | 1(池) | 结构性不可(ctx 270,336) | ## 3. 主场景:16K 输入、512 输出 B300 跑了 C=1/8/32/64/128/256;本机按 MRR 上限收敛为 C=1/8/16/32/64(C=16 为本机甜点档,B300 无此档;C=128/256 超出两臂 MRR)。 | 并发 | 方案 | Input TPS | Output TPS | TTFT P95 | TPOT P95 | |-|-|-|-|-|-| | 1 | TP2PP4 | 534 | 16.7 | 5.36 s | 50.3 ms | | 1 | TP8+EAGLE3+AR | 1,587 | 49.6 | **3.98 s** | **13.7 ms** | | 8 | TP2PP4 | 3,236 | **101** | **14.79 s** | **70.9 ms** | | 8 | TP8+EAGLE3+AR | 2,605 | 81.4 | 32.52 s | 135.1 ms | | 16 | TP2PP4 | 4,674 | **146** | **25.78 s** | **98.5 ms** | | 16 | TP8+EAGLE3+AR | 2,217 | 69.3 | 60.86 s | 297.8 ms | | 32 | TP2PP4 | **6,185** | **193** | **46.43 s** | **152.0 ms** | | 32 | TP8+EAGLE3+AR | 2,527 | 79.0 | 169.68 s | 259.9 ms | | 64 | TP2PP4 | **6,748** | **211** | **134.78 s** | **203.7 ms** | | 64 | TP8+EAGLE3+AR | 2,697 | 84.3 | 345.69 s | 231.5 ms | 趋势: - **分界在 C=8**:C=1 E7b 全指标占优;C=8 起 TP2PP4 全指标反超,且输出吞吐差距随并发拉大(101 vs 81 → 211 vs 84)。 - **E7b 在 C=8→16 输出吞吐倒退**(81.4→69.3 tok/s):MRR=16 开始排队 + decode 掉图(bs>8 无图)双击;TPOT P95 从 135 ms 跳到 298 ms。EAGLE accept length 随并发从 2.14 爬到 2.99,但被掉图抵消。 - **prefill 墙的差异**:E7b 的 input TPS 几乎不随并发增长(C=8→64:2,605→2,697,+3%),TP2PP4 翻倍(3,236→6,748,+108%)——chunk 8192 + TP8 无 PP 流水的 prefill 瓶颈 vs chunk 16384 + PP4 流水摊满。 - TP2PP4 到 C=64 仍在爬坡(C=32→64 +9%),MRR48 未饱和;TTFT P95 在 C=64 达 134.8 s,同 B300 一样高并发 TTFT 需要准入控制。 ## 4. 短输入与长输出 ### 4.1 `1K -> 128` | 并发 | 方案 | Input TPS | Output TPS | TTFT P95 | TPOT P95 | |-|-|-|-|-|-| | 1 | TP2PP4 | 155 | 19.3 | 386 ms | 49.3 ms | | 1 | TP8+EAGLE3+AR | **518** | **64.7** | **326 ms** | **14.3 ms** | | 8 | TP2PP4 | 815 | 102 | **1.69 s** | 72.9 ms | | 8 | TP8+EAGLE3+AR | **1,219** | **152** | 2.16 s | **53.7 ms** | | 32 | TP2PP4 | **2,204** | **276** | **4.87 s** | **98.5 ms** | | 32 | TP8+EAGLE3+AR | 801 | 100 | 25.60 s | 190.5 ms | | 64 | TP2PP4 | **2,724** | **341** | **19.96 s** | **101.8 ms** | | 64 | TP8+EAGLE3+AR | 826 | 103 | 65.81 s | 177.7 ms | 短输入下 E7b 在 C≤8 显著占优(C=8 输出 152 vs 102,1.5×),C=32 起 TP2PP4 大幅拉开(2.7~3.3×)。E7b 的 input TPS 反而在 C=8 最高(1,219)后回落——MRR16 排队开始挤占 prefill。B300 同场景 Low-Latency 到 C=128 才被反超,本机提前到 C=8~32 之间,同样是容量上限(MRR16/池)而非算力所致。 ### 4.2 `1K -> 4K` | 并发 | 方案 | Output TPS | TTFT P95 | TPOT P95 | |-|-|-|-|-| | 1 | TP2PP4 | 20.3 | 395 ms | 49.8 ms | | 1 | TP8+EAGLE3+AR | **135** | **320 ms** | **8.7 ms** | | 8 | TP2PP4 | 101 | 1.87 s | 79.4 ms | | 8 | TP8+EAGLE3+AR | **412** | **1.68 s** | **22.5 ms** | | 32 | TP2PP4 | **367** | **4.14 s** | **90.5 ms** | | 32 | TP8+EAGLE3+AR | 252 | 304.75 s | 74.6 ms | | 64 | TP2PP4 | **482** | 337.92 s | 95.5 ms | | 64 | TP8+EAGLE3+AR | 用户中止*(见注) | — | — | \* E7b C=64 点按用户指示中止("并发 64 太高",rc=143),未获得有效数据;同点 TP2PP4 已完成。E7b 该点 nreq=128 远超 MRR=16,属排队观察点,中止不影响结论完整性。 长输出放大了两形态的差异: - **E7b C=1/C=8 是 decode 密集负载的最优区间**:C=1 输出 135 tok/s、TPOT 8.7 ms(全场最低),C=8 输出 412 tok/s(全场第二),EAGLE accept 长达 3.7~4.0——长输出让草稿模型进入"顺笔"状态,accept 显著高于 4.1 短输出行(2.0~2.1)。 - **E7b C=32 的 TTFT P95 304.75 s** 是纯排队(nreq=64 / MRR=16,4 波串行),其 TPOT 74.6 ms 与掉图后水平一致。 - **TP2PP4 C=64 输出 482 tok/s 为全场最高**,但 TTFT P95 338 s 意味着该点只适合离线批处理;交互负载应压在 C=32(367 tok/s、TTFT 4.1 s)。 ## 5. 长上下文观察 ### 5.1 `64K/128K -> 512` (并发档位按用户指示收敛:64K 封 8、128K 封 4,另补 128K C=2;B300 同场景为 64K C=8/32/64、128K C=8/32。) | 场景 | 并发 | 方案 | Input TPS | Output TPS | TTFT P95 | TPOT P95 | |-|-|-|-|-|-|-| | 64K→512 | 1 | TP2PP4 | 1,834 | 14.3 | **10.32 s** | 50.0 ms | | 64K→512 | 1 | TP8+EAGLE3+AR | **2,877** | **22.5** | 17.17 s | **13.5 ms** | | 64K→512 | 4 | TP2PP4 | **4,287** | **33.5** | **28.83 s** | **99.5 ms** | | 64K→512 | 4 | TP8+EAGLE3+AR | 3,292 | 25.7 | 68.87 s | 154.6 ms | | 64K→512 | 8 | TP2PP4 | **5,650** | **44.1** | **53.38 s** | **161.8 ms** | | 64K→512 | 8 | TP8+EAGLE3+AR | 3,280 | 25.6 | 149.45 s | 157.5 ms | | 128K→512 | 1 | TP2PP4 | 3,017 | 11.8 | **18.23 s** | 49.7 ms | | 128K→512 | 1 | TP8+EAGLE3+AR | **3,054** | **11.9** | 37.60 s | **12.3 ms** | | 128K→512 | 2 | TP2PP4 | **4,310** | **16.8** | **32.42 s** | **83.7 ms** | | 128K→512 | 2 | TP8+EAGLE3+AR | 3,145 | 12.3 | 75.81 s | 162.2 ms | | 128K→512 | 4 | TP2PP4 | **5,626** | **22.0** | **60.35 s** | **146.8 ms** | | 128K→512 | 4 | TP8+EAGLE3+AR | 3,133 | 12.2 | 159.50 s | 163.4 ms | - 64K C=1 E7b 仍占优(22.5 vs 14.3 tok/s),但 128K C=1 两方案输出打平(11.8 vs 11.9)——prefill 逐渐成为长上下文的主导成本,E7b 的 decode 优势被稀释;其 TTFT 反而慢 2×(37.6 vs 18.2 s)。 - C≥2 起 TP2PP4 全指标占优;E7b 的 output TPS 在 64K/128K 行几乎不随并发变化(22.5→25.6、11.9→12.2),与主场景同一形态:容量上限 + 掉图封死并发收益。 - DSA 的 TPOT 上下文不变性(TP2PP4 C=1:50.0 ms @64K ≈ 49.7 ms @128K ≈ 50.3 ms @16K)与并发驱动性(C=8:70.9 ms @16K → 161.8 ms @64K)在本组完整呈现。 ### 5.2 上下文边界 (OSL=1,只验证容量与 prefill,不比较 Output TPS/TPOT——与 B300 同声明。B300 完成到约 1M;本机以 896K=917,504 tokens 对应 B300"约 1M"档。) | 输入长度 | 方案 | 已完成并发 | C=1 Input TPS | 最高并发 TTFT P95 | |-|-|-|-|-| | 256K | TP2PP4 | 1/2/3 | **7,050** | 102.99 s(C=3) | | 256K | TP8+EAGLE3+AR | 1 | 2,867 | 91.45 s(C=1) | | 512K | TP2PP4 | 1 | **5,662** | 92.60 s(C=1) | | 512K | TP8+EAGLE3+AR | 结构性不可(ctx 270,336) | — | — | | 896K | TP2PP4 | 1 | **4,153** | 220.91 s(C=1) | | 896K | TP8+EAGLE3+AR | 结构性不可(ctx 270,336) | — | — | - 256K C=1 两臂相差 2.5×(7,050 vs 2,867 tok/s):TP2PP4 的 chunk 16384 + PP4 流水对超长 prefill 的摊满优势,在边界长度上比 128K 行(几乎打平)进一步放大;E7b 的 chunk 8192 代价随长度累积。 - TP2PP4 边界 input TPS 随长度衰减平缓(7,050 → 5,662 → 4,153),896K 单条 220.9 s 完成、池 1,040,384 tokens 单条可容(KV 917,504 + 余量)。 - **E7b 256K C=1 命中核验注记(hicache 宿主层陷阱)**:首测命中率 0.9998、重试仍超——根因是该点 nreq=1 测量文本与预热完全相同,256K 预热 KV(262,160 tokens)占池 94.8% 触发分层缓存宿主层下放,`flush_cache` 只清 GPU radix 树、清不掉宿主层。改用该服务实例从未发过的文本(窗口基址 9,900,000)无预热重测,命中 0.0,数据干净。此为分层缓存运维要点:**宿主层缓存不受 flush_cache 影响,冷测必须换文本**。 ## 6. 显存状态 - **TP2PP4**:服务加载后空载 64.6 GiB/卡,矩阵峰值 **85.0 GiB/卡**(主场景 C=64 时逼近打满,最紧张卡余量约 0.6 GiB)。mem 0.85 下 KV 池按卡容量贴满分配,属预期;继续上调 MRR 或上下文没有余量,扩容前必须先降 mem-fraction。 - **TP8+EAGLE3+AR**:空载 77.9 GiB/卡(EAGLE 草稿权重 + mem 0.90 大池),矩阵峰值 **83.6 GiB/卡**(余量约 2.1 GiB)。 - 两臂全矩阵 **0 OOM、0 retraction**(全部 41 点 retractions_total=0)——B300 未披露该指标,本机在自身容量上限内运行无回退。 - 显存时间线逐 30 s 采样留档(vram_timeline.csv),可复核任一时刻的卡间分布。 ## 7. 建议 1. **低并发交互/agent 长思考(C≤8)用 E7b**:主场景 C=1 TPOT 13.7 ms、长输出 C=8 输出 412 tok/s。生产并发上限建议钉在 ≤8:C=16 起 decode 掉图 + MRR16 排队使其全面劣于 TP2PP4。 2. **高并发吞吐/长上下文(C≥8 或输入 ≥64K)用 TP2PP4**:主场景 C=64 输出 211 tok/s、128K C=1 TTFT 18.2 s、896K 可达;MRR48 内未饱和,吞吐上限即 MRR。 3. **负载形态分界线**:prefill 吞吐需求 >2.2K tok/s 或并发 >8 → TP2PP4;decode 为主且并发 ≤8 → E7b。两臂在 C=8 附近的输出吞吐交叉(主场景 101 vs 81、短输入 102 vs 152、长输出 101 vs 412)——按输出长度分布选型,不能只看并发。 4. **E7b 扩窗口的两个前置**:MRR 16→更高需先扩 KV 池(hicache 宿主层只救命中场景,不增并发容量);decode 图覆盖 bs 8→16/32 才能消掉 C=16 的 298 ms TPOT 断崖。 5. **边界与超长上下文只有 TP2PP4 口径可服务**:E7b 若要对标 B300 512K/约1M 行,需要 ctx ≥524,288 与池 ≥52 万 tokens 的部署形态,本版(ctx 270,336 / 池 276,480)结构性不可达。 6. **不要把两臂差异单归因 EAGLE**:两臂同时差在并行拓扑、chunk、radix、MRR 与图覆盖;单变量消融未做(与 B300 报告建议 3 同款)。 7. **生产容量同时设吞吐和延迟 SLO**:TP2PP4 主场景 C=64 输出最高但 TTFT P95 已到 135 s;E7b C=32 长输出 TTFT P95 305 s。只看峰值 TPS 会掩盖排队长尾。 8. **分层缓存运维**:宿主层缓存不受 `flush_cache` 影响,任何冷缓存测量/复测必须更换输入文本(见 5.2 注记)。 ## 8. 原始结果与复现 - 服务器原始结果(60.8): - TP2PP4 臂:`/root/bench_logs/b300eq_tp2pp4_20260910_1138/`(all_results.jsonl 24 点、status.txt、server_facts.txt、gpu_inventory、vram_timeline.csv) - E7b 臂:`/root/bench_logs/b300eq_e7b_20260910_1428/`(all_results.jsonl 20 条:16 点 OK + 4.2 C=64 用户中止 + 256K C=1 干净重测覆盖前 3 条污染记录;status.txt 含 4 个结构性跳过与 HIT_FAIL_FINAL 首测记录) - 资产 md5 台账:`/root/bench_logs/b300eq_md5_ledger.txt` - 本地镜像:`D:\sskj\b300eq\{tp2pp4,e7b}\`(上述全部文件)、`D:\sskj\b300eq\report_tables.md`(表格生成器输出) - 部署脚本:`/root/deploy_glm53_pp4.sh`(md5 def3c64c…,与库内 sskj main 副本一致)、`/root/deploy_glm53_607_exp.sh`;CAR 补丁:`/root/patches/custom_all_reduce.py`(a8fc9a50…)+ `custom_all_reduce_utils.py`(65a4d22b…),三处(60.7 原件/本地/库内)md5 一致 - 测量工具:`/root/bench_corpus_v2.py`(md5 1e34dd8d…,p95 nearest-rank + 逐请求 dump)、`/root/extract_summary.py`(4c126d06…)、`/root/run_b300_matrix.sh`(5892b446…,矩阵驱动:alive/idle_wait/prewarm/flush/命中核验/重试/VRAM 采样) - 复现命令(单点示例): ```bash # 冷缓存压测(E7b 256K C=1 干净版) python3 /root/bench_corpus_v2.py --input-len 262144 --output-len 1 --shared-frac 0 \ --concurrency 1 --num-requests 1 --run-id 9551 --pool-override 9900000 \ --dump-records $L/b52_256k_c1_v2_records.jsonl # 全矩阵:nohup bash /root/run_b300_matrix.sh > 2>&1 & ``` ## 9. 与 B300 对比观察 > **口径声明**:B300 报告未写明模型量化方式(若为原始 BF16 权重,则与本机 NVFP4 非同模型形态);硬件为 8×B300(288 GB HBM3e)vs 本机 8×RTX 6000D(96 GB GDDR7);镜像 v0.5.18-cu130-dev4 vs nightly-20260828-daf63171。**绝对值仅量级可比,本对比只对结构性结论负责**。 - **定性结构完全复现**:低延迟配方(B300 Low-Latency = TP8+EAGLE vs 本机 E7b = TP8+EAGLE3+AR)在 C=1 占优、吞吐配方(B300 High-Throughput = DP8+DeepEP vs 本机 TP2PP4 = D 生产口径)在高并发占优——两套硬件上"低延迟 vs 高吞吐"的分野方向一致。 - **分界点本机更靠前**:B300 的交叉点在 C=64~128(主场景 HT C=128 反超 33%);本机在 C=8 附近。原因不是算力而是**容量上限**:本机两臂 MRR/池上限(48/16)远小于 B300 配方的 256/默认,先于算力撞墙。 - **绝对差距 4~5×(主场景)**:C=1 输出 246 vs 49.6 tok/s(5.0×)、input 7,882 vs 1,587(5.0×);吞吐侧峰值 997 vs 211(4.7×)、31,889 vs 6,748(4.7×)。与显存带宽硬件代差量级一致。 - **边界 prefill 差距收窄到 ~2×**:256K C=1 input 7,050 vs 17,457(2.5×)→ 512K 5,662 vs 12,421(2.2×)→ 896K/约1M 4,153 vs 7,897(1.9×)。计算密集的超长 prefill 是 6000D 相对最能打的位置(PP 流水摊满 + 带宽占比下降)。 - **TPOT 差距小于吞吐差距**:B300 LL C=1 4.36 ms vs E7b 13.7 ms(3.1×);高并发侧 B300 HT C=128 165 ms vs TP2PP4 C=64 204 ms(1.2×)——NVFP4 + DSA 把 decode 单步成本压得相对不差,差距主要在吞吐面。 - **饱和形态不同**:B300 LL 在 C=64 后进入 24K input tok/s 平台、HT 在 C=128 达峰后 C=256 回退 19%;本机 TP2PP4 到 C=64 仍在爬坡(MRR 未饱和),E7b 则被 MRR16+掉图封死在 C=8。本机没有一档出现吞吐回退——"甜点=并发上限"由 MRR 决定而非算力。 - **EAGLE 配方差异**:B300 LL 为 5 steps/6 draft tokens,本机 E7b 为 4 steps/topk1/5 draft tokens;本机实测 accept 2.0~4.0(短输出 2.0、主场景 2.1~3.0、长输出 3.7~4.0,随 decode 深入上升)。B300 未披露 accept,无法直接对比投机效率。 - **容量边界差距最大**:B300 两模式都完成约 1M 输入 C=1/2/4;本机仅 TP2PP4 可达 896K 且 C=1 单条(池 1,040,384 刚容一条),E7b 连 512K 都结构性不可测(ctx 270,336)。96 GB 卡上"上下文边界=显存边界"比 B300 严酷得多。 ## 附录 A:语料窗口映射(回收窗口) 语料总量 21,296,780 tokens,此前场景一/二战役已消费至 21,235,008。冷缓存协议下回收复用:窗口基址 `--pool-override` 显式指定,每点窗口在基址上顺序推进(逐记录 `corpus_window.start/end` 留档),每点 flush + 命中核验 ≤0.01 保证冷。 | 场景 | 窗口基址 | 备注 | |-|-|-| | 主场景 16K→512 | 2,300,000 | | | 4.1 短输入 1K→128 | 4,500,000 | | | 4.2 长输出 1K→4K | 4,700,000 | | | 5.1 64K→512 | 5,000,000 | | | 5.1 128K→512 | 6,200,000 | | | 5.2 256K→1 | 8,400,000 | E7b 干净重测改用 9,900,000(实例首用文本,避 hicache 宿主层残留) | | 5.2 512K→1 | 9,300,000 | 仅 TP2PP4 | | 5.2 896K→1 | 9,900,000 | 仅 TP2PP4 | ## 附录 B:全量指标(含 mean/p95/max、回退、投机接受长度) | 场景点 | 方案 | ok/nreq | wall(s) | out tok/s | in tok/s | TTFT mean/p95/max(s) | TPOT mean/p95/max(ms) | retractions | accept | |---|---|---|---|---|---|---|---|---|---| | b3_16k_c1 | TP2PP4 | 8/8 | 245.55 | 16.68 | 533.8 | 5.35/5.36/5.36 | 49.6/50.3/50.3 | 0 | None | | b3_16k_c1 | TP8+EAGLE3+AR | 8/8 | 82.58 | 49.6 | 1587.15 | 3.93/3.98/3.98 | 12.5/13.7/13.7 | 0 | 2.138 | | b3_16k_c8 | TP2PP4 | 16/16 | 81.0 | 101.13 | 3236.22 | 10.05/14.79/14.79 | 59.5/70.9/70.9 | 0 | None | | b3_16k_c8 | TP8+EAGLE3+AR | 16/16 | 100.63 | 81.41 | 2605.13 | 11.75/32.52/32.52 | 71.6/135.1/135.1 | 0 | 2.375 | | b3_16k_c16 | TP2PP4 | 32/32 | 112.16 | 146.08 | 4674.5 | 15.53/25.78/25.84 | 79.2/98.5/101.2 | 0 | None | | b3_16k_c16 | TP8+EAGLE3+AR | 32/32 | 236.44 | 69.29 | 2217.4 | 23.60/60.86/90.39 | 173.3/297.8/305.5 | 0 | 2.517 | | b3_16k_c32 | TP2PP4 | 64/64 | 169.54 | 193.27 | 6184.73 | 26.52/46.43/47.89 | 113.7/152.0/157.3 | 0 | None | | b3_16k_c32 | TP8+EAGLE3+AR | 64/64 | 414.96 | 78.97 | 2526.91 | 100.26/169.68/190.73 | 169.8/259.9/319.1 | 0 | 2.767 | | b3_16k_c64 | TP2PP4 | 128/128 | 310.79 | 210.87 | 6747.91 | 63.05/134.78/139.99 | 139.2/203.7/214.3 | 0 | None | | b3_16k_c64 | TP8+EAGLE3+AR | 128/128 | 777.55 | 84.29 | 2697.14 | 240.10/345.69/380.96 | 168.0/231.5/311.9 | 0 | 2.986 | | b41_1k_c1 | TP2PP4 | 8/8 | 52.95 | 19.34 | 154.7 | 0.38/0.39/0.39 | 49.1/49.3/49.3 | 0 | None | | b41_1k_c1 | TP8+EAGLE3+AR | 8/8 | 15.82 | 64.74 | 517.93 | 0.30/0.33/0.33 | 13.2/14.3/14.3 | 0 | 2.028 | | b41_1k_c8 | TP2PP4 | 16/16 | 20.1 | 101.91 | 815.3 | 1.31/1.69/1.69 | 68.6/72.9/72.9 | 0 | None | | b41_1k_c8 | TP8+EAGLE3+AR | 16/16 | 13.44 | 152.4 | 1219.24 | 1.21/2.16/2.16 | 41.4/53.7/53.7 | 0 | 2.048 | | b41_1k_c32 | TP2PP4 | 64/64 | 29.73 | 275.55 | 2204.4 | 3.89/4.87/4.88 | 85.6/98.5/106.8 | 0 | None | | b41_1k_c32 | TP8+EAGLE3+AR | 64/64 | 81.8 | 100.14 | 801.15 | 17.56/25.60/27.89 | 146.6/190.5/195.2 | 0 | 2.054 | | b41_1k_c64 | TP2PP4 | 128/128 | 48.11 | 340.53 | 2724.25 | 8.14/19.96/20.01 | 93.3/101.8/125.1 | 0 | None | | b41_1k_c64 | TP8+EAGLE3+AR | 128/128 | 158.73 | 103.22 | 825.75 | 46.74/65.81/70.71 | 144.5/177.7/212.5 | 0 | 2.087 | | b42_1k4k_c1 | TP2PP4 | 8/8 | 1614.16 | 20.3 | 5.08 | 0.39/0.40/0.40 | 49.2/49.8/49.8 | 0 | None | | b42_1k4k_c1 | TP8+EAGLE3+AR | 8/8 | 242.18 | 135.31 | 33.83 | 0.31/0.32/0.32 | 7.3/8.7/8.7 | 0 | 3.701 | | b42_1k4k_c8 | TP2PP4 | 16/16 | 649.69 | 100.87 | 25.22 | 1.35/1.87/1.87 | 79.0/79.4/79.4 | 0 | None | | b42_1k4k_c8 | TP8+EAGLE3+AR | 16/16 | 159.24 | 411.54 | 102.89 | 0.96/1.68/1.68 | 18.1/22.5/22.5 | 0 | 4.003 | | b42_1k4k_c32 | TP2PP4 | 64/64 | 714.14 | 367.08 | 91.77 | 1.98/4.14/4.15 | 86.1/90.5/91.1 | 0 | None | | b42_1k4k_c32 | TP8+EAGLE3+AR | 64/64 | 1040.79 | 251.87 | 62.97 | 195.07/304.75/334.69 | 60.7/74.6/92.3 | 0 | 3.852 | | b42_1k4k_c64 | TP2PP4 | 128/128 | 1088.63 | 481.6 | 120.4 | 80.74/337.92/338.47 | 91.2/95.5/96.3 | 0 | None | | b51_64k_c1 | TP2PP4 | 8/8 | 285.91 | 14.33 | 1833.72 | 10.28/10.32/10.32 | 49.8/50.0/50.0 | 0 | None | | b51_64k_c1 | TP8+EAGLE3+AR | 8/8 | 182.23 | 22.48 | 2877.06 | 17.04/17.17/17.17 | 11.2/13.5/13.5 | 0 | 2.468 | | b51_64k_c4 | TP2PP4 | 8/8 | 122.3 | 33.49 | 4286.94 | 19.55/28.83/28.83 | 81.4/99.5/99.5 | 0 | None | | b51_64k_c4 | TP8+EAGLE3+AR | 8/8 | 159.24 | 25.72 | 3292.45 | 30.55/68.87/68.87 | 94.9/154.6/154.6 | 0 | 2.438 | | b51_64k_c8 | TP2PP4 | 16/16 | 185.59 | 44.14 | 5650.11 | 31.83/53.38/53.38 | 119.2/161.8/161.8 | 0 | None | | b51_64k_c8 | TP8+EAGLE3+AR | 16/16 | 319.66 | 25.63 | 3280.31 | 90.92/149.45/149.45 | 105.8/157.5/157.5 | 0 | 2.442 | | b51_128k_c1 | TP2PP4 | 8/8 | 347.5 | 11.79 | 3017.45 | 18.21/18.23/18.23 | 49.4/49.7/49.7 | 0 | None | | b51_128k_c1 | TP8+EAGLE3+AR | 8/8 | 343.36 | 11.93 | 3053.83 | 37.59/37.60/37.60 | 10.4/12.3/12.3 | 0 | 2.728 | | b51_128k_c2 | TP2PP4 | 8/8 | 243.3 | 16.84 | 4309.84 | 25.27/32.42/32.42 | 69.6/83.7/83.7 | 0 | None | | b51_128k_c2 | TP8+EAGLE3+AR | 8/8 | 333.36 | 12.29 | 3145.44 | 48.21/75.81/75.81 | 68.0/162.2/162.2 | 0 | 2.769 | | b51_128k_c4 | TP2PP4 | 8/8 | 186.37 | 21.98 | 5626.35 | 39.29/60.35/60.35 | 105.4/146.8/146.8 | 0 | None | | b51_128k_c4 | TP8+EAGLE3+AR | 8/8 | 334.71 | 12.24 | 3132.76 | 110.14/159.50/159.50 | 68.7/163.4/163.4 | 0 | 2.595 | | b52_256k_c1 | TP2PP4 | 1/1 | 37.18 | 0.03 | 7050.23 | 37.18/37.18/37.18 | — | 0 | None | | b52_256k_c1 | TP8+EAGLE3+AR | 1/1 | 91.45 | 0.01 | 2866.59 | 91.45/91.45/91.45 | — | 0 | None | | b52_256k_c2 | TP2PP4 | 2/2 | 70.19 | 0.03 | 7469.22 | 53.69/70.12/70.12 | — | 0 | None | | b52_256k_c3 | TP2PP4 | 3/3 | 103.12 | 0.03 | 7626.22 | 70.12/102.99/102.99 | — | 0 | None | | b52_512k_c1 | TP2PP4 | 1/1 | 92.6 | 0.01 | 5662.03 | 92.60/92.60/92.60 | — | 0 | None | | b52_896k_c1 | TP2PP4 | 1/1 | 220.91 | 0.0 | 4153.24 | 220.91/220.91/220.91 | — | 0 | None | 注:E7b 4.2 C=64 用户中止(rc=143)无 SUMMARY,不在表内;E7b 256K/512K/896K C>1 为结构性跳过;E7b 256K C=1 为全新文本干净重测值(窗口 9,900,000)。