Update README.md with new experiments and RTX 6000D platform
- Add all H200 experiments: TP/DP matrix, adaptive concurrency, custom bench, MTP vs default, long context matrix, 64k/256k probes - Add RTX 6000D platform and experiments (sglang/vllm TP/DP adaptive) - Update environment requirements section with RTX 6000D details - Update platforms directory description to include RTX 6000D
This commit is contained in:
parent
d904d663a4
commit
819850c4a1
82
README.md
82
README.md
@ -7,7 +7,7 @@
|
|||||||
|
|
||||||
| 目录/文件 | 说明 |
|
| 目录/文件 | 说明 |
|
||||||
|---|---|
|
|---|---|
|
||||||
| `platforms/` | 芯片/加速器平台配置(`*.env`),如 P800、H200 |
|
| `platforms/` | 芯片/加速器平台配置(`*.env`),如 P800、H200、RTX 6000D |
|
||||||
| `scripts/common/` | 跨实验复用的 orchestration 组件(server 启停、health check、元数据生成、结果解析) |
|
| `scripts/common/` | 跨实验复用的 orchestration 组件(server 启停、health check、元数据生成、结果解析) |
|
||||||
| `scripts/` | 仅保留仍在使用的 legacy DSpark 脚本与 SLO 标准 |
|
| `scripts/` | 仅保留仍在使用的 legacy DSpark 脚本与 SLO 标准 |
|
||||||
| `experiments/` | 以实验为单位的自包含目录(脚本 + 配置 + 结果) |
|
| `experiments/` | 以实验为单位的自包含目录(脚本 + 配置 + 结果) |
|
||||||
@ -30,6 +30,19 @@
|
|||||||
| DSV4 H200 SGLang vs vLLM | `experiments/dsv4_h200_sglang_vs_vllm/run_bench.sh` | NVIDIA H200 上 SGLang 与 vLLM 控制变量对比(TP=8,最长 200k 上下文) |
|
| DSV4 H200 SGLang vs vLLM | `experiments/dsv4_h200_sglang_vs_vllm/run_bench.sh` | NVIDIA H200 上 SGLang 与 vLLM 控制变量对比(TP=8,最长 200k 上下文) |
|
||||||
| DSV4 H200 vLLM DSpark vs default | `experiments/dsv4_h200_vllm_dspark_vs_default/run_bench.sh` | vLLM 开启 DSpark 投机解码 vs 默认配置,验证 TTFT 差异 |
|
| DSV4 H200 vLLM DSpark vs default | `experiments/dsv4_h200_vllm_dspark_vs_default/run_bench.sh` | vLLM 开启 DSpark 投机解码 vs 默认配置,验证 TTFT 差异 |
|
||||||
| DSV4 H200 max context length | `experiments/dsv4_h200_max_context_length/run_bench.sh` | 探索 SGLang / vLLM 在 H200 上能支持的最大输入长度 |
|
| DSV4 H200 max context length | `experiments/dsv4_h200_max_context_length/run_bench.sh` | 探索 SGLang / vLLM 在 H200 上能支持的最大输入长度 |
|
||||||
|
| DSV4 H200 SGLang TP/DP Matrix | `experiments/dsv4_h200_sglang_tp_dp_matrix/run_bench.sh` | H200 上 SGLang 不同 TP×DP 配置的固定并发矩阵测试 |
|
||||||
|
| DSV4 H200 SGLang TP/DP Adaptive | `experiments/dsv4_h200_sglang_tp_dp_matrix/run_adaptive_concurrency.sh` | H200 上 SGLang 不同 TP×DP 配置的自适应并发饱和点搜索 |
|
||||||
|
| DSV4 H200 vLLM TP/DP Matrix | `experiments/dsv4_h200_vllm_tp_dp_matrix/run_bench.sh` | H200 上 vLLM 不同 TP×DP 配置的固定并发矩阵测试 |
|
||||||
|
| DSV4 H200 vLLM TP/DP Adaptive | `experiments/dsv4_h200_vllm_tp_dp_matrix/run_adaptive_concurrency.sh` | H200 上 vLLM 不同 TP×DP 配置的自适应并发饱和点搜索 |
|
||||||
|
| DSV4 H200 64k SGLang vs vLLM | `experiments/dsv4_h200_64k_sglang_vs_vllm/run_bench.sh` | H200 上 64k 上下文 SGLang 与 vLLM 对比 |
|
||||||
|
| DSV4 H200 256k 4k Probe | `experiments/dsv4_h200_256k_4k_probe/run_bench.sh` | H200 上 256k 输入/4k 输出长上下文探测 |
|
||||||
|
| DSV4 H200 vLLM TP2 Custom Bench | `experiments/dsv4_h200_vllm_tp2_custom_bench/run_bench.sh` | H200 上 vLLM TP=2 自定义压测客户端(多服务负载均衡) |
|
||||||
|
| DSV4 H200 vLLM TP4 Custom Bench | `experiments/dsv4_h200_vllm_tp4_custom_bench/run_bench.sh` | H200 上 vLLM TP=4 自定义压测客户端 |
|
||||||
|
| DSV4 H200 vLLM TP8 Custom Bench | `experiments/dsv4_h200_vllm_tp8_custom_bench/run_bench.sh` | H200 上 vLLM TP=8 自定义压测客户端 |
|
||||||
|
| DSV4 H200 vLLM MTP vs Default | `experiments/dsv4_h200_vllm_mtp_vs_default/run_bench.sh` | H200 上 vLLM MTP(Multi-Token Prediction)vs 默认配置对比 |
|
||||||
|
| DSV4 H200 Long Context Matrix | `experiments/dsv4_h200_long_context_matrix/run_bench.sh` | H200 上长上下文矩阵测试(多后端对比) |
|
||||||
|
| **DSV4 RTX 6000D SGLang TP/DP Adaptive** | `experiments/dsv4_pro6000_sglang_tp_dp_matrix/run_adaptive_concurrency.sh` | **RTX 6000D 上 SGLang 自适应并发饱和点搜索** |
|
||||||
|
| **DSV4 RTX 6000D vLLM TP/DP Adaptive** | `experiments/dsv4_pro6000_vllm_tp_dp_matrix/run_adaptive_concurrency.sh` | **RTX 6000D 上 vLLM 自适应并发饱和点搜索** |
|
||||||
|
|
||||||
### 旧结构(scripts/ + bench_results/)
|
### 旧结构(scripts/ + bench_results/)
|
||||||
|
|
||||||
@ -72,10 +85,72 @@ bash experiments/dsv4_h200_sglang_vs_vllm/run_bench.sh
|
|||||||
bash experiments/dsv4_h200_vllm_dspark_vs_default/run_bench.sh
|
bash experiments/dsv4_h200_vllm_dspark_vs_default/run_bench.sh
|
||||||
```
|
```
|
||||||
|
|
||||||
### H200 max context length
|
### H200 SGLang TP/DP Matrix
|
||||||
|
|
||||||
```bash
|
```bash
|
||||||
bash experiments/dsv4_h200_max_context_length/run_bench.sh
|
bash experiments/dsv4_h200_sglang_tp_dp_matrix/run_bench.sh
|
||||||
|
```
|
||||||
|
|
||||||
|
### H200 SGLang TP/DP 自适应并发搜索
|
||||||
|
|
||||||
|
```bash
|
||||||
|
bash experiments/dsv4_h200_sglang_tp_dp_matrix/run_adaptive_concurrency.sh
|
||||||
|
```
|
||||||
|
|
||||||
|
### H200 vLLM TP/DP Matrix
|
||||||
|
|
||||||
|
```bash
|
||||||
|
bash experiments/dsv4_h200_vllm_tp_dp_matrix/run_bench.sh
|
||||||
|
```
|
||||||
|
|
||||||
|
### H200 vLLM TP/DP 自适应并发搜索
|
||||||
|
|
||||||
|
```bash
|
||||||
|
bash experiments/dsv4_h200_vllm_tp_dp_matrix/run_adaptive_concurrency.sh
|
||||||
|
```
|
||||||
|
|
||||||
|
### H200 64k SGLang vs vLLM
|
||||||
|
|
||||||
|
```bash
|
||||||
|
bash experiments/dsv4_h200_64k_sglang_vs_vllm/run_bench.sh
|
||||||
|
```
|
||||||
|
|
||||||
|
### H200 256k 4k Probe
|
||||||
|
|
||||||
|
```bash
|
||||||
|
bash experiments/dsv4_h200_256k_4k_probe/run_bench.sh
|
||||||
|
```
|
||||||
|
|
||||||
|
### H200 vLLM TP2/TP4/TP8 Custom Bench
|
||||||
|
|
||||||
|
```bash
|
||||||
|
bash experiments/dsv4_h200_vllm_tp2_custom_bench/run_bench.sh
|
||||||
|
bash experiments/dsv4_h200_vllm_tp4_custom_bench/run_bench.sh
|
||||||
|
bash experiments/dsv4_h200_vllm_tp8_custom_bench/run_bench.sh
|
||||||
|
```
|
||||||
|
|
||||||
|
### H200 vLLM MTP vs Default
|
||||||
|
|
||||||
|
```bash
|
||||||
|
bash experiments/dsv4_h200_vllm_mtp_vs_default/run_bench.sh
|
||||||
|
```
|
||||||
|
|
||||||
|
### H200 Long Context Matrix
|
||||||
|
|
||||||
|
```bash
|
||||||
|
bash experiments/dsv4_h200_long_context_matrix/run_bench.sh
|
||||||
|
```
|
||||||
|
|
||||||
|
### RTX 6000D SGLang TP/DP 自适应并发搜索
|
||||||
|
|
||||||
|
```bash
|
||||||
|
bash experiments/dsv4_pro6000_sglang_tp_dp_matrix/run_adaptive_concurrency.sh
|
||||||
|
```
|
||||||
|
|
||||||
|
### RTX 6000D vLLM TP/DP 自适应并发搜索
|
||||||
|
|
||||||
|
```bash
|
||||||
|
bash experiments/dsv4_pro6000_vllm_tp_dp_matrix/run_adaptive_concurrency.sh
|
||||||
```
|
```
|
||||||
|
|
||||||
### DSpark grid / spec-tokens(旧结构)
|
### DSpark grid / spec-tokens(旧结构)
|
||||||
@ -109,6 +184,7 @@ python3 experiments/dsv4_h200_dspark/parse_results.py \
|
|||||||
## 环境要求
|
## 环境要求
|
||||||
|
|
||||||
- **NVIDIA H200**:Python env `/data/user1/yy/envs/vllm-dspark`(服务端)、`/data/user1/yy/envs/sglang`(压测客户端);模型 `/data/models/DeepSeek-V4-Flash`、`/data/models/DeepSeek-V4-Flash-DSpark`。
|
- **NVIDIA H200**:Python env `/data/user1/yy/envs/vllm-dspark`(服务端)、`/data/user1/yy/envs/sglang`(压测客户端);模型 `/data/models/DeepSeek-V4-Flash`、`/data/models/DeepSeek-V4-Flash-DSpark`。
|
||||||
|
- **NVIDIA RTX 6000D**:Python env `/root/.miniconda3/envs/sglang`(压测客户端);模型 `/data/hf_models/DeepSeek-V4-Flash`;Docker 镜像 `lmsysorg/sglang:latest`、`vllm/vllm-openai:latest`。
|
||||||
- **Kunlun P800**:Docker 镜像 `iregistry.baidu-int.com/xpu/sglang-p800-pd-disagg-0510:20260511_4202`;模型 `/data1/models/DeepSeek-V4-Flash-INT8`;压测客户端在容器内运行。
|
- **Kunlun P800**:Docker 镜像 `iregistry.baidu-int.com/xpu/sglang-p800-pd-disagg-0510:20260511_4202`;模型 `/data1/models/DeepSeek-V4-Flash-INT8`;压测客户端在容器内运行。
|
||||||
|
|
||||||
平台相关常量见 `platforms/*.env`。
|
平台相关常量见 `platforms/*.env`。
|
||||||
|
|||||||
Loading…
x
Reference in New Issue
Block a user