[Docs] add standalone B300 DeepSeek-V4-Flash report
This commit is contained in:
parent
81d17407bc
commit
35512db505
@ -0,0 +1,154 @@
|
|||||||
|
# DeepSeek-V4-Flash 在 B300 上的文本性能报告
|
||||||
|
|
||||||
|
## 1. 结论摘要
|
||||||
|
|
||||||
|
本轮在一台 8 卡 NVIDIA B300 服务器上测试 DeepSeek-V4-Flash 的 Low-Latency 与 Balanced 两套部署方案;两套服务均以 TP4 启动,实际通信域为 4 个 GPU rank。两种模式合计完成 85/118 个终态测试点,完成率 72.03%;其中 83 个 PASS、1 个 TIMEOUT_PASS、1 个真实 OOM。因机器回收,Balanced 的部分长上下文点未执行。
|
||||||
|
|
||||||
|
- **交互式长输入长输出优先 Low-Latency**:`16K -> 512` 的全部并发点上,Low-Latency 的 Input/Output TPS 和 TTFT P95 均优于 Balanced。C=8 时吞吐高 100.2%,TTFT P95 低 41.2%;C=256 时吞吐仍高 5.3%,TTFT P95 低 23.0%。
|
||||||
|
- **Balanced 的优势集中在高并发短输出**:`1K -> 128` 从 C=8 开始反超,C=256 达到 36,265 input tok/s,比 Low-Latency 高 21.2%,TPOT P95 也低 39.8%。
|
||||||
|
- **长输出仍明显偏向 Low-Latency**:`1K -> 4K, C=256` 的 Output TPS 为 21,132,是 Balanced 9,764 的 2.16 倍。
|
||||||
|
- **64K Prefill 吞吐 Balanced 略高**:`64K -> 1` 在 C=8 至 C=128 约为 65K input tok/s,比 Low-Latency 的约 59K 高约 11%。
|
||||||
|
- **已确认的容量边界**:Low-Latency 可完成 `256K -> 1, C=4`,但 `512K -> 1, C=1` 在申请约 2.25-3.00 GiB 连续显存时 OOM。Balanced 仅测试到 `64K -> 1, C=128`,未触及其容量边界。
|
||||||
|
|
||||||
|
## 2. 测试环境与服务配置
|
||||||
|
|
||||||
|
| 项目 | Low-Latency | Balanced |
|
||||||
|
|---|---|---|
|
||||||
|
| 硬件 | 单机 8 x NVIDIA B300;服务使用 4 GPU ranks | 同左 |
|
||||||
|
| 模型 | DeepSeek-V4-Flash-0731 | 同左 |
|
||||||
|
| 镜像 | `registry.sy.com/lmsysorg/sglang:v0.5.18-cu130-dev4` | 同左 |
|
||||||
|
| SGLang commit | `71de97b264b04dcd514cf904003028aefe9775c8` | 同左 |
|
||||||
|
| FlashInfer | 0.6.17 | 0.6.17 |
|
||||||
|
| 并行 | TP4 / DP1 / EP1 | TP4 / DP4 / EP4 + DP Attention |
|
||||||
|
| MoE | `flashinfer_mxfp4`,无 A2A | runner `auto` + DeepEP A2A |
|
||||||
|
| 投机解码 | DSpark,1 step,6 draft tokens | 关闭 |
|
||||||
|
| KV Cache | FP8 E4M3 | FP8 E4M3 |
|
||||||
|
| `mem-fraction-static` | 0.903 | 0.862 |
|
||||||
|
| Chunk Prefill | 16K | 4K |
|
||||||
|
| `max-prefill-tokens` | 16K | 16K |
|
||||||
|
| 活跃请求 | 全局 256 | 全局 256;每个 DP worker 64 |
|
||||||
|
|
||||||
|
两套配置同时改变了 DP Attention、EP/DeepEP、MoE runner、Chunk Prefill 和投机解码,因此结果用于比较完整部署方案,不用于把差异归因到某一个参数。
|
||||||
|
|
||||||
|
## 3. 主场景:16K 输入、512 输出
|
||||||
|
|
||||||
|
| 并发 | 模式 | Input TPS | Output TPS | TTFT P95 | TPOT P95 |
|
||||||
|
|---:|---|---:|---:|---:|---:|
|
||||||
|
| 1 | Low-Latency | 13,129 | 410 | 0.27 s | 3.07 ms |
|
||||||
|
| 1 | Balanced | 2,518 | 79 | 1.07 s | 11.26 ms |
|
||||||
|
| 8 | Low-Latency | 33,937 | 1,061 | 1.52 s | 10.23 ms |
|
||||||
|
| 8 | Balanced | 16,955 | 530 | 2.58 s | 12.69 ms |
|
||||||
|
| 32 | Low-Latency | 49,778 | 1,556 | 6.23 s | 31.87 ms |
|
||||||
|
| 32 | Balanced | 36,100 | 1,128 | 8.09 s | 25.54 ms |
|
||||||
|
| 64 | Low-Latency | 55,645 | 1,739 | 12.09 s | 57.79 ms |
|
||||||
|
| 64 | Balanced | 45,337 | 1,417 | 16.04 s | 41.92 ms |
|
||||||
|
| 128 | Low-Latency | 59,108 | 1,847 | 24.71 s | 114.28 ms |
|
||||||
|
| 128 | Balanced | 52,116 | 1,629 | 31.96 s | 73.50 ms |
|
||||||
|
| 256 | Low-Latency | **60,486** | **1,890** | **48.39 s** | 226.23 ms |
|
||||||
|
| 256 | Balanced | 57,436 | 1,795 | 62.85 s | **134.28 ms** |
|
||||||
|
|
||||||
|
Low-Latency 在该场景中始终提供更高的系统吞吐和更低的首 token 延迟。Balanced 从 C=32 起拥有更低的 TPOT P95,说明其 Decode 尾延迟更平稳,但不足以抵消 Prefill 和排队阶段的损失。两种模式在 C=128 之后吞吐增幅都已明显收窄,继续提高并发主要抬升 TTFT。
|
||||||
|
|
||||||
|
## 4. 短输入场景
|
||||||
|
|
||||||
|
### 4.1 `1K -> 128`
|
||||||
|
|
||||||
|
| 并发 | 模式 | Input TPS | Output TPS | TTFT P95 | TPOT P95 |
|
||||||
|
|---:|---|---:|---:|---:|---:|
|
||||||
|
| 1 | Low-Latency | 2,042 | 255 | 0.18 s | 3.53 ms |
|
||||||
|
| 1 | Balanced | 643 | 80 | 0.34 s | 10.62 ms |
|
||||||
|
| 8 | Low-Latency | 3,579 | 447 | 3.39 s | 31.29 ms |
|
||||||
|
| 8 | Balanced | 4,392 | 549 | 0.65 s | 10.73 ms |
|
||||||
|
| 32 | Low-Latency | 7,185 | 898 | 1.71 s | 49.89 ms |
|
||||||
|
| 32 | Balanced | 13,757 | 1,720 | 0.94 s | 12.48 ms |
|
||||||
|
| 128 | Low-Latency | 20,917 | 2,615 | 2.10 s | 68.93 ms |
|
||||||
|
| 128 | Balanced | 29,473 | 3,684 | 2.84 s | 27.68 ms |
|
||||||
|
| 256 | Low-Latency | 29,913 | 3,739 | 3.54 s | 99.14 ms |
|
||||||
|
| 256 | Balanced | **36,265** | **4,533** | 4.51 s | **59.65 ms** |
|
||||||
|
|
||||||
|
短输入下,C=1 仍是 Low-Latency 更快;从 C=8 起,Balanced 的 DP4 能被有效填充,吞吐和 TPOT 均明显占优。C=128/256 时 Balanced 的 TTFT P95 略高,但整体仍更适合短请求高并发吞吐。
|
||||||
|
|
||||||
|
### 4.2 `1K -> 4K`
|
||||||
|
|
||||||
|
| 并发 | 模式 | Output TPS | TTFT P95 | TPOT P95 |
|
||||||
|
|---:|---|---:|---:|---:|
|
||||||
|
| 1 | Low-Latency | 605 | 0.18 s | 2.28 ms |
|
||||||
|
| 1 | Balanced | 88 | 0.37 s | 14.15 ms |
|
||||||
|
| 8 | Low-Latency | 2,837 | 0.45 s | 3.52 ms |
|
||||||
|
| 8 | Balanced | 752 | 0.80 s | 10.62 ms |
|
||||||
|
| 32 | Low-Latency | 6,717 | 0.75 s | 6.34 ms |
|
||||||
|
| 32 | Balanced | 2,527 | 0.92 s | 12.59 ms |
|
||||||
|
| 128 | Low-Latency | 12,869 | 2.19 s | 14.14 ms |
|
||||||
|
| 128 | Balanced | 7,653 | 3.16 s | 16.57 ms |
|
||||||
|
| 256 | Low-Latency | **21,132** | **3.66 s** | **17.31 ms** |
|
||||||
|
| 256 | Balanced | 9,764 | 4.39 s | 26.51 ms |
|
||||||
|
|
||||||
|
长 Decode 充分体现了 Low-Latency 配方中 DSpark 和单副本执行路径的优势。Balanced 虽可利用 DP4,但本轮配置下没有投机解码,Output TPS 在全部并发点均落后。
|
||||||
|
|
||||||
|
## 5. 长上下文与容量
|
||||||
|
|
||||||
|
### 5.1 `64K -> 1`
|
||||||
|
|
||||||
|
| 并发 | Low-Latency Input TPS | Balanced Input TPS | Low-Latency TTFT P95 | Balanced TTFT P95 |
|
||||||
|
|---:|---:|---:|---:|---:|
|
||||||
|
| 1 | 57,080 | 17,118 | 1.18 s | 3.87 s |
|
||||||
|
| 4 | 58,914 | 61,303 | 4.44 s | 4.41 s |
|
||||||
|
| 8 | 58,819 | 65,564 | 8.88 s | 8.36 s |
|
||||||
|
| 16 | 58,871 | **65,865** | 17.76 s | **15.82 s** |
|
||||||
|
| 32 | 58,822 | 65,505 | 35.52 s | 32.07 s |
|
||||||
|
| 64 | 58,852 | 65,617 | 71.23 s | 64.08 s |
|
||||||
|
| 128 | 58,702 | 65,401 | 142.74 s | 128.67 s |
|
||||||
|
|
||||||
|
Balanced 在 C>=4 后进入约 65K input tok/s 平台,较 Low-Latency 高约 11%,表明 DP Attention + EP4/DeepEP 的 Prefill 吞吐在足够 batch 下有效。但绝对 TTFT 仍随并发近似线性增长,不能只依据 Input TPS 判断在线体验。
|
||||||
|
|
||||||
|
### 5.2 Low-Latency 已测边界
|
||||||
|
|
||||||
|
| 场景 | 并发 | Input TPS | TTFT P95 | 状态 |
|
||||||
|
|---|---:|---:|---:|---|
|
||||||
|
| 128K -> 1 | 1 | 50,299 | 2.61 s | PASS |
|
||||||
|
| 128K -> 1 | 4 | 51,297 | 10.31 s | PASS |
|
||||||
|
| 128K -> 1 | 64 | 51,257 | 163.69 s | PASS |
|
||||||
|
| 256K -> 1 | 1 | 39,876 | 6.61 s | PASS |
|
||||||
|
| 256K -> 1 | 4 | 40,372 | 26.03 s | PASS |
|
||||||
|
| 512K -> 1 | 1 | - | - | OOM |
|
||||||
|
|
||||||
|
`512K -> 1, C=1` 的服务日志记录了多 rank 显存分配失败,属于真实容量问题。Balanced 因机器回收只完成到 `64K -> 1`,不能据此比较 128K 以上容量。
|
||||||
|
|
||||||
|
## 6. 完成范围
|
||||||
|
|
||||||
|
| 模式 | 终态/计划 | PASS | TIMEOUT_PASS | FAIL | 未执行 |
|
||||||
|
|---|---:|---:|---:|---:|---:|
|
||||||
|
| Low-Latency | 54/59 | 53 | 0 | 1 | 5 |
|
||||||
|
| Balanced | 31/59 | 30 | 1 | 0 | 28 |
|
||||||
|
| 合计 | 85/118 | 83 | 1 | 1 | 33 |
|
||||||
|
|
||||||
|
Balanced 的 `1K -> 4K, C=1` 超过 30 分钟限制后以 TIMEOUT_PASS 保留了完整指标。其余 33 个点没有原始性能数据,不能插值或推断为成功;主要缺口是 Balanced 的 `64K -> 512` 以及 128K 以上场景。
|
||||||
|
|
||||||
|
## 7. 部署建议
|
||||||
|
|
||||||
|
1. 以长 Prompt、长输出和交互体验为主时,优先 Low-Latency 配方。
|
||||||
|
2. 以短请求、高并发吞吐为主时,Balanced 在 C>=8 后更有优势。
|
||||||
|
3. 纯 Prefill 压力下,Balanced 在 batch 充足时可获得约 11% 的 64K 输入吞吐提升。
|
||||||
|
4. 线上并发上限不能只按峰值 TPS 设置。`16K -> 512` 从 C=128 增加到 C=256 的吞吐收益很小,但 TTFT P95 接近翻倍。
|
||||||
|
5. FP8 KV 日志提示未提供缩放因子、默认使用 1.0。正式质量验收应补充精度测试,性能结果本身不代表生成质量已验证。
|
||||||
|
|
||||||
|
## 8. 原始证据
|
||||||
|
|
||||||
|
服务器原始目录:
|
||||||
|
|
||||||
|
```text
|
||||||
|
/data/b300-dsv4-glm53-text-matrix/b300-dsv4-glm53-dev4-20260909-084427/
|
||||||
|
```
|
||||||
|
|
||||||
|
关键目录与文件:
|
||||||
|
|
||||||
|
```text
|
||||||
|
dsv4-low-latency/
|
||||||
|
dsv4-balanced/
|
||||||
|
final-summary/summary.csv
|
||||||
|
final-summary/summary.md
|
||||||
|
final-summary/comparison.md
|
||||||
|
final-summary/progress.json
|
||||||
|
```
|
||||||
|
|
||||||
|
每个点保留 benchmark JSON、终端日志、服务尾日志、GPU 状态和 `.done/.failed` 标记。完整服务命令位于对应模式的 `server_command.txt`。
|
||||||
Loading…
x
Reference in New Issue
Block a user