diff --git a/README.md b/README.md index 80832b5..132b23b 100644 --- a/README.md +++ b/README.md @@ -7,7 +7,7 @@ | 目录/文件 | 说明 | |---|---| -| `platforms/` | 芯片/加速器平台配置(`*.env`),如 P800、H200 | +| `platforms/` | 芯片/加速器平台配置(`*.env`),如 P800、H200、RTX 6000D | | `scripts/common/` | 跨实验复用的 orchestration 组件(server 启停、health check、元数据生成、结果解析) | | `scripts/` | 仅保留仍在使用的 legacy DSpark 脚本与 SLO 标准 | | `experiments/` | 以实验为单位的自包含目录(脚本 + 配置 + 结果) | @@ -30,6 +30,19 @@ | DSV4 H200 SGLang vs vLLM | `experiments/dsv4_h200_sglang_vs_vllm/run_bench.sh` | NVIDIA H200 上 SGLang 与 vLLM 控制变量对比(TP=8,最长 200k 上下文) | | DSV4 H200 vLLM DSpark vs default | `experiments/dsv4_h200_vllm_dspark_vs_default/run_bench.sh` | vLLM 开启 DSpark 投机解码 vs 默认配置,验证 TTFT 差异 | | DSV4 H200 max context length | `experiments/dsv4_h200_max_context_length/run_bench.sh` | 探索 SGLang / vLLM 在 H200 上能支持的最大输入长度 | +| DSV4 H200 SGLang TP/DP Matrix | `experiments/dsv4_h200_sglang_tp_dp_matrix/run_bench.sh` | H200 上 SGLang 不同 TP×DP 配置的固定并发矩阵测试 | +| DSV4 H200 SGLang TP/DP Adaptive | `experiments/dsv4_h200_sglang_tp_dp_matrix/run_adaptive_concurrency.sh` | H200 上 SGLang 不同 TP×DP 配置的自适应并发饱和点搜索 | +| DSV4 H200 vLLM TP/DP Matrix | `experiments/dsv4_h200_vllm_tp_dp_matrix/run_bench.sh` | H200 上 vLLM 不同 TP×DP 配置的固定并发矩阵测试 | +| DSV4 H200 vLLM TP/DP Adaptive | `experiments/dsv4_h200_vllm_tp_dp_matrix/run_adaptive_concurrency.sh` | H200 上 vLLM 不同 TP×DP 配置的自适应并发饱和点搜索 | +| DSV4 H200 64k SGLang vs vLLM | `experiments/dsv4_h200_64k_sglang_vs_vllm/run_bench.sh` | H200 上 64k 上下文 SGLang 与 vLLM 对比 | +| DSV4 H200 256k 4k Probe | `experiments/dsv4_h200_256k_4k_probe/run_bench.sh` | H200 上 256k 输入/4k 输出长上下文探测 | +| DSV4 H200 vLLM TP2 Custom Bench | `experiments/dsv4_h200_vllm_tp2_custom_bench/run_bench.sh` | H200 上 vLLM TP=2 自定义压测客户端(多服务负载均衡) | +| DSV4 H200 vLLM TP4 Custom Bench | `experiments/dsv4_h200_vllm_tp4_custom_bench/run_bench.sh` | H200 上 vLLM TP=4 自定义压测客户端 | +| DSV4 H200 vLLM TP8 Custom Bench | `experiments/dsv4_h200_vllm_tp8_custom_bench/run_bench.sh` | H200 上 vLLM TP=8 自定义压测客户端 | +| DSV4 H200 vLLM MTP vs Default | `experiments/dsv4_h200_vllm_mtp_vs_default/run_bench.sh` | H200 上 vLLM MTP(Multi-Token Prediction)vs 默认配置对比 | +| DSV4 H200 Long Context Matrix | `experiments/dsv4_h200_long_context_matrix/run_bench.sh` | H200 上长上下文矩阵测试(多后端对比) | +| **DSV4 RTX 6000D SGLang TP/DP Adaptive** | `experiments/dsv4_pro6000_sglang_tp_dp_matrix/run_adaptive_concurrency.sh` | **RTX 6000D 上 SGLang 自适应并发饱和点搜索** | +| **DSV4 RTX 6000D vLLM TP/DP Adaptive** | `experiments/dsv4_pro6000_vllm_tp_dp_matrix/run_adaptive_concurrency.sh` | **RTX 6000D 上 vLLM 自适应并发饱和点搜索** | ### 旧结构(scripts/ + bench_results/) @@ -72,10 +85,72 @@ bash experiments/dsv4_h200_sglang_vs_vllm/run_bench.sh bash experiments/dsv4_h200_vllm_dspark_vs_default/run_bench.sh ``` -### H200 max context length +### H200 SGLang TP/DP Matrix ```bash -bash experiments/dsv4_h200_max_context_length/run_bench.sh +bash experiments/dsv4_h200_sglang_tp_dp_matrix/run_bench.sh +``` + +### H200 SGLang TP/DP 自适应并发搜索 + +```bash +bash experiments/dsv4_h200_sglang_tp_dp_matrix/run_adaptive_concurrency.sh +``` + +### H200 vLLM TP/DP Matrix + +```bash +bash experiments/dsv4_h200_vllm_tp_dp_matrix/run_bench.sh +``` + +### H200 vLLM TP/DP 自适应并发搜索 + +```bash +bash experiments/dsv4_h200_vllm_tp_dp_matrix/run_adaptive_concurrency.sh +``` + +### H200 64k SGLang vs vLLM + +```bash +bash experiments/dsv4_h200_64k_sglang_vs_vllm/run_bench.sh +``` + +### H200 256k 4k Probe + +```bash +bash experiments/dsv4_h200_256k_4k_probe/run_bench.sh +``` + +### H200 vLLM TP2/TP4/TP8 Custom Bench + +```bash +bash experiments/dsv4_h200_vllm_tp2_custom_bench/run_bench.sh +bash experiments/dsv4_h200_vllm_tp4_custom_bench/run_bench.sh +bash experiments/dsv4_h200_vllm_tp8_custom_bench/run_bench.sh +``` + +### H200 vLLM MTP vs Default + +```bash +bash experiments/dsv4_h200_vllm_mtp_vs_default/run_bench.sh +``` + +### H200 Long Context Matrix + +```bash +bash experiments/dsv4_h200_long_context_matrix/run_bench.sh +``` + +### RTX 6000D SGLang TP/DP 自适应并发搜索 + +```bash +bash experiments/dsv4_pro6000_sglang_tp_dp_matrix/run_adaptive_concurrency.sh +``` + +### RTX 6000D vLLM TP/DP 自适应并发搜索 + +```bash +bash experiments/dsv4_pro6000_vllm_tp_dp_matrix/run_adaptive_concurrency.sh ``` ### DSpark grid / spec-tokens(旧结构) @@ -109,6 +184,7 @@ python3 experiments/dsv4_h200_dspark/parse_results.py \ ## 环境要求 - **NVIDIA H200**:Python env `/data/user1/yy/envs/vllm-dspark`(服务端)、`/data/user1/yy/envs/sglang`(压测客户端);模型 `/data/models/DeepSeek-V4-Flash`、`/data/models/DeepSeek-V4-Flash-DSpark`。 +- **NVIDIA RTX 6000D**:Python env `/root/.miniconda3/envs/sglang`(压测客户端);模型 `/data/hf_models/DeepSeek-V4-Flash`;Docker 镜像 `lmsysorg/sglang:latest`、`vllm/vllm-openai:latest`。 - **Kunlun P800**:Docker 镜像 `iregistry.baidu-int.com/xpu/sglang-p800-pd-disagg-0510:20260511_4202`;模型 `/data1/models/DeepSeek-V4-Flash-INT8`;压测客户端在容器内运行。 平台相关常量见 `platforms/*.env`。