Update README.md with new experiments and RTX 6000D platform

- Add all H200 experiments: TP/DP matrix, adaptive concurrency, custom bench,
  MTP vs default, long context matrix, 64k/256k probes
- Add RTX 6000D platform and experiments (sglang/vllm TP/DP adaptive)
- Update environment requirements section with RTX 6000D details
- Update platforms directory description to include RTX 6000D
This commit is contained in:
Quantong Qiu 2026-07-13 03:04:46 +00:00
parent d904d663a4
commit 819850c4a1

View File

@ -7,7 +7,7 @@
| 目录/文件 | 说明 |
|---|---|
| `platforms/` | 芯片/加速器平台配置(`*.env`),如 P800、H200 |
| `platforms/` | 芯片/加速器平台配置(`*.env`),如 P800、H200、RTX 6000D |
| `scripts/common/` | 跨实验复用的 orchestration 组件server 启停、health check、元数据生成、结果解析 |
| `scripts/` | 仅保留仍在使用的 legacy DSpark 脚本与 SLO 标准 |
| `experiments/` | 以实验为单位的自包含目录(脚本 + 配置 + 结果) |
@ -30,6 +30,19 @@
| DSV4 H200 SGLang vs vLLM | `experiments/dsv4_h200_sglang_vs_vllm/run_bench.sh` | NVIDIA H200 上 SGLang 与 vLLM 控制变量对比TP=8最长 200k 上下文) |
| DSV4 H200 vLLM DSpark vs default | `experiments/dsv4_h200_vllm_dspark_vs_default/run_bench.sh` | vLLM 开启 DSpark 投机解码 vs 默认配置,验证 TTFT 差异 |
| DSV4 H200 max context length | `experiments/dsv4_h200_max_context_length/run_bench.sh` | 探索 SGLang / vLLM 在 H200 上能支持的最大输入长度 |
| DSV4 H200 SGLang TP/DP Matrix | `experiments/dsv4_h200_sglang_tp_dp_matrix/run_bench.sh` | H200 上 SGLang 不同 TP×DP 配置的固定并发矩阵测试 |
| DSV4 H200 SGLang TP/DP Adaptive | `experiments/dsv4_h200_sglang_tp_dp_matrix/run_adaptive_concurrency.sh` | H200 上 SGLang 不同 TP×DP 配置的自适应并发饱和点搜索 |
| DSV4 H200 vLLM TP/DP Matrix | `experiments/dsv4_h200_vllm_tp_dp_matrix/run_bench.sh` | H200 上 vLLM 不同 TP×DP 配置的固定并发矩阵测试 |
| DSV4 H200 vLLM TP/DP Adaptive | `experiments/dsv4_h200_vllm_tp_dp_matrix/run_adaptive_concurrency.sh` | H200 上 vLLM 不同 TP×DP 配置的自适应并发饱和点搜索 |
| DSV4 H200 64k SGLang vs vLLM | `experiments/dsv4_h200_64k_sglang_vs_vllm/run_bench.sh` | H200 上 64k 上下文 SGLang 与 vLLM 对比 |
| DSV4 H200 256k 4k Probe | `experiments/dsv4_h200_256k_4k_probe/run_bench.sh` | H200 上 256k 输入/4k 输出长上下文探测 |
| DSV4 H200 vLLM TP2 Custom Bench | `experiments/dsv4_h200_vllm_tp2_custom_bench/run_bench.sh` | H200 上 vLLM TP=2 自定义压测客户端(多服务负载均衡) |
| DSV4 H200 vLLM TP4 Custom Bench | `experiments/dsv4_h200_vllm_tp4_custom_bench/run_bench.sh` | H200 上 vLLM TP=4 自定义压测客户端 |
| DSV4 H200 vLLM TP8 Custom Bench | `experiments/dsv4_h200_vllm_tp8_custom_bench/run_bench.sh` | H200 上 vLLM TP=8 自定义压测客户端 |
| DSV4 H200 vLLM MTP vs Default | `experiments/dsv4_h200_vllm_mtp_vs_default/run_bench.sh` | H200 上 vLLM MTPMulti-Token Predictionvs 默认配置对比 |
| DSV4 H200 Long Context Matrix | `experiments/dsv4_h200_long_context_matrix/run_bench.sh` | H200 上长上下文矩阵测试(多后端对比) |
| **DSV4 RTX 6000D SGLang TP/DP Adaptive** | `experiments/dsv4_pro6000_sglang_tp_dp_matrix/run_adaptive_concurrency.sh` | **RTX 6000D 上 SGLang 自适应并发饱和点搜索** |
| **DSV4 RTX 6000D vLLM TP/DP Adaptive** | `experiments/dsv4_pro6000_vllm_tp_dp_matrix/run_adaptive_concurrency.sh` | **RTX 6000D 上 vLLM 自适应并发饱和点搜索** |
### 旧结构scripts/ + bench_results/
@ -72,10 +85,72 @@ bash experiments/dsv4_h200_sglang_vs_vllm/run_bench.sh
bash experiments/dsv4_h200_vllm_dspark_vs_default/run_bench.sh
```
### H200 max context length
### H200 SGLang TP/DP Matrix
```bash
bash experiments/dsv4_h200_max_context_length/run_bench.sh
bash experiments/dsv4_h200_sglang_tp_dp_matrix/run_bench.sh
```
### H200 SGLang TP/DP 自适应并发搜索
```bash
bash experiments/dsv4_h200_sglang_tp_dp_matrix/run_adaptive_concurrency.sh
```
### H200 vLLM TP/DP Matrix
```bash
bash experiments/dsv4_h200_vllm_tp_dp_matrix/run_bench.sh
```
### H200 vLLM TP/DP 自适应并发搜索
```bash
bash experiments/dsv4_h200_vllm_tp_dp_matrix/run_adaptive_concurrency.sh
```
### H200 64k SGLang vs vLLM
```bash
bash experiments/dsv4_h200_64k_sglang_vs_vllm/run_bench.sh
```
### H200 256k 4k Probe
```bash
bash experiments/dsv4_h200_256k_4k_probe/run_bench.sh
```
### H200 vLLM TP2/TP4/TP8 Custom Bench
```bash
bash experiments/dsv4_h200_vllm_tp2_custom_bench/run_bench.sh
bash experiments/dsv4_h200_vllm_tp4_custom_bench/run_bench.sh
bash experiments/dsv4_h200_vllm_tp8_custom_bench/run_bench.sh
```
### H200 vLLM MTP vs Default
```bash
bash experiments/dsv4_h200_vllm_mtp_vs_default/run_bench.sh
```
### H200 Long Context Matrix
```bash
bash experiments/dsv4_h200_long_context_matrix/run_bench.sh
```
### RTX 6000D SGLang TP/DP 自适应并发搜索
```bash
bash experiments/dsv4_pro6000_sglang_tp_dp_matrix/run_adaptive_concurrency.sh
```
### RTX 6000D vLLM TP/DP 自适应并发搜索
```bash
bash experiments/dsv4_pro6000_vllm_tp_dp_matrix/run_adaptive_concurrency.sh
```
### DSpark grid / spec-tokens旧结构
@ -109,6 +184,7 @@ python3 experiments/dsv4_h200_dspark/parse_results.py \
## 环境要求
- **NVIDIA H200**Python env `/data/user1/yy/envs/vllm-dspark`(服务端)、`/data/user1/yy/envs/sglang`(压测客户端);模型 `/data/models/DeepSeek-V4-Flash``/data/models/DeepSeek-V4-Flash-DSpark`
- **NVIDIA RTX 6000D**Python env `/root/.miniconda3/envs/sglang`(压测客户端);模型 `/data/hf_models/DeepSeek-V4-Flash`Docker 镜像 `lmsysorg/sglang:latest``vllm/vllm-openai:latest`
- **Kunlun P800**Docker 镜像 `iregistry.baidu-int.com/xpu/sglang-p800-pd-disagg-0510:20260511_4202`;模型 `/data1/models/DeepSeek-V4-Flash-INT8`;压测客户端在容器内运行。
平台相关常量见 `platforms/*.env`