2.4 KiB
Raw Permalink Blame History

GLM-5.3-NVFP4 i8k/o1k/c16 三方案部署对比压测2026-09-08

  • 机器174.1.60.86000D-88×H20单机串行三方案轮换
  • 场景input=8192 / output=1024 / cc=16 / nreq=322 波),全唯一 PG19 真实语料temp=0、ignore_eos、stream
  • 完整报告:本目录 GLM53_NVFP4_i8k_o1k_c16_压测报告_2026-09-08.md(判决、主表、机理分析、复现命令)

方案与结果r1/r2 均值)

方案 配置要点 out tok/s in tok/s TTFT p50 TPOT p50 e2e P50 质量门
A 生产口径 TP8+EAGLE 4/1/5MRR16chunk8192graph bs≤8池 276,864 115.0 920 3.8s 123ms 139.6s 7/7
A16 A + --max-running-requests 32 --cuda-graph-max-bs-decode 16 --cuda-graph-bs-decode 4 8 12 16 218.9 1,751 4.0s 55ms 66.2s 7/7
B TP4PP2MRR48chunk16384radix-off池 569,600 264.9 2,119 10.5s 50ms 61.8s 6/7*

* B 的 tool-call 失败 = 脚本无 --tool-call-parser(已知配置缺口,非质量问题)。

判决B 全面最优out 为 A 的 2.30×A16 把差距收窄到 1.21×,是 EAGLE 家族在本场景的正确口径。 60.8 收官保留 A16 在役:30000restart=unless-stopped

核心结论(引用时注意)

  1. A 生产口径在 cc16 有 decode 陷阱bs 916 掉出 cuda graphEAGLE 掉图后 TPOT 123ms比 B 裸 decode50ms慢 2.4×——"EAGLE 大胜"仅成立于 cc≤4 或 graph 覆盖到位时。
  2. EAGLE 在 cc16 优势摊薄至零A16 accept 2.50,但 verify 批 80 token/步打满算力,折算单 token 55ms ≈ B 的 50ms。
  3. 历史场景二16k/512的"A"行实为 A16 变体口径,与 A 原口径相差 1.9×,引用历史数据须区分。

资产

  • scripts/bench_8k.sh轮次编排、bench_corpus.pyc6d9212660.7 同源、deploy_glm53_605.shfcd9109b8 机标准、deploy_glm53_optimal.sh22685f56
  • results/bench_logs/3×gateA 7/7、B 6/7、A16 7/7、9 轮 bench 日志A/A16/B × warm/r1/r2、runner/deploy 日志
  • 语料窗口:本轮消费 corpus_ids.json 至 ~19.66M / 21.30MA [17.0,17.86M)、B [17.9,18.76M)、A16 [18.8,19.66M)),剩余 ~1.63M,复测须取 ≥19.7M 新窗口
  • 压测机执行前经授权清理了 60.8 GPU3/6 的 dirA_ext 外部 eval 进程PID 2421844/2421852SIGTERM