sskj/experiments/pro6000/dsv4pro_pro6000d_2node_sglang_rdma_demand_modeling

DeepSeek-V4-Pro 双机 SGLang RDMA 需求建模

Phase 2.5 在不改变 TP16/EP2 服务参数的前提下回答三个问题:

  1. 64K 输入下,哪个并发是 Token TPS 与 RDMA 带宽的拐点;
  2. 64K -> 1K 真实请求最多产生多少双 Rail 流量;
  3. 当前部署会先达到 GPU/模型吞吐平台,还是先打满 400G rail。

唯一入口:

cd /data/hzy/sskj/experiments/pro6000/dsv4pro_pro6000d_2node_sglang_rdma_demand_modeling

# 只展开命令,不启动服务
DRY_RUN=1 RUN_ID=dsv4pro-phase2_5-dryrun-$(date +%Y%m%d-%H%M%S) \
  bash run_rdma_demand_modeling.sh all

# 正式运行
RUN_ID=dsv4pro-phase2_5-$(date +%Y%m%d-%H%M%S)
tmux new-session -d -s dsv4pro-phase2_5 \
  "RUN_ID=${RUN_ID} bash run_rdma_demand_modeling.sh all \
   2>&1 | tee /data/hzy/${RUN_ID}.log"
tmux attach -t dsv4pro-phase2_5

脚本先跑 64K -> 1 的 C=1/4/16/32/64 探路点,再自动选择三个代表并发, 对 64K -> 1K 重复两次。服务、benchmark 和 HCA 采集复用已经验证的 Phase 1/2 实现;本目录只负责工作负载编排与带宽模型拟合。

最终高价值结果:

  • rdma_case_metrics.csv:每个 Case 的 TPS、每 Rail/双 Rail 带宽和 bytes/token
  • rdma_demand_model.json:拟合参数、并发拐点和理论需求;
  • rdma_demand_report.md:可直接用于阶段汇报的结论;
  • recommendation.envScout 自动选择的 Confirm 并发。