GLM-5.3-NVFP4 i8k/o1k/c16 三方案部署对比压测(2026-09-08)
- 机器:174.1.60.8(6000D-8,8×H20,单机串行三方案轮换)
- 场景:input=8192 / output=1024 / cc=16 / nreq=32(2 波),全唯一 PG19 真实语料,temp=0、ignore_eos、stream
- 完整报告:本目录
GLM53_NVFP4_i8k_o1k_c16_压测报告_2026-09-08.md(判决、主表、机理分析、复现命令)
方案与结果(r1/r2 均值)
| 方案 | 配置要点 | out tok/s | in tok/s | TTFT p50 | TPOT p50 | e2e P50 | 质量门 |
|---|---|---|---|---|---|---|---|
| A 生产口径 | TP8+EAGLE 4/1/5,MRR16,chunk8192,graph bs≤8,池 276,864 | 115.0 | 920 | 3.8s | 123ms | 139.6s | 7/7 |
| A16 | A + --max-running-requests 32 --cuda-graph-max-bs-decode 16 --cuda-graph-bs-decode 4 8 12 16 |
218.9 | 1,751 | 4.0s | 55ms | 66.2s | 7/7 |
| B | TP4PP2,MRR48,chunk16384,radix-off,池 569,600 | 264.9 | 2,119 | 10.5s | 50ms | 61.8s | 6/7* |
* B 的 tool-call 失败 = 脚本无 --tool-call-parser(已知配置缺口,非质量问题)。
判决:B 全面最优(out 为 A 的 2.30×);A16 把差距收窄到 1.21×,是 EAGLE 家族在本场景的正确口径。 60.8 收官保留 A16 在役(:30000,restart=unless-stopped)。
核心结论(引用时注意)
- A 生产口径在 cc16 有 decode 陷阱:bs 9–16 掉出 cuda graph,EAGLE 掉图后 TPOT 123ms,比 B 裸 decode(50ms)慢 2.4×——"EAGLE 大胜"仅成立于 cc≤4 或 graph 覆盖到位时。
- EAGLE 在 cc16 优势摊薄至零:A16 accept 2.50,但 verify 批 80 token/步打满算力,折算单 token 55ms ≈ B 的 50ms。
- 历史场景二(16k/512)的"A"行实为 A16 变体口径,与 A 原口径相差 1.9×,引用历史数据须区分。
资产
scripts/:bench_8k.sh(轮次编排)、bench_corpus.py(c6d92126,60.7 同源)、deploy_glm53_605.sh(fcd9109b,8 机标准)、deploy_glm53_optimal.sh(22685f56)results/bench_logs/:3×gate(A 7/7、B 6/7、A16 7/7)、9 轮 bench 日志(A/A16/B × warm/r1/r2)、runner/deploy 日志- 语料窗口:本轮消费 corpus_ids.json 至 ~19.66M / 21.30M(A [17.0,17.86M)、B [17.9,18.76M)、A16 [18.8,19.66M)),剩余 ~1.63M,复测须取 ≥19.7M 新窗口
- 压测机执行前经授权清理了 60.8 GPU3/6 的 dirA_ext 外部 eval 进程(PID 2421844/2421852,SIGTERM)