DeepSeek-V4-Pro 双机 SGLang RDMA 需求建模
Phase 2.5 在不改变 TP16/EP2 服务参数的前提下回答三个问题:
- 64K 输入下,哪个并发是 Token TPS 与 RDMA 带宽的拐点;
64K -> 1K真实请求最多产生多少双 Rail 流量;- 当前部署会先达到 GPU/模型吞吐平台,还是先打满 400G rail。
唯一入口:
cd /data/hzy/sskj/experiments/pro6000/dsv4pro_pro6000d_2node_sglang_rdma_demand_modeling
# 只展开命令,不启动服务
DRY_RUN=1 RUN_ID=dsv4pro-phase2_5-dryrun-$(date +%Y%m%d-%H%M%S) \
bash run_rdma_demand_modeling.sh all
# 正式运行
RUN_ID=dsv4pro-phase2_5-$(date +%Y%m%d-%H%M%S)
tmux new-session -d -s dsv4pro-phase2_5 \
"RUN_ID=${RUN_ID} bash run_rdma_demand_modeling.sh all \
2>&1 | tee /data/hzy/${RUN_ID}.log"
tmux attach -t dsv4pro-phase2_5
脚本先跑 64K -> 1 的 C=1/4/16/32/64 探路点,再自动选择三个代表并发,
对 64K -> 1K 重复两次。服务、benchmark 和 HCA 采集复用已经验证的
Phase 1/2 实现;本目录只负责工作负载编排与带宽模型拟合。
最终高价值结果:
rdma_case_metrics.csv:每个 Case 的 TPS、每 Rail/双 Rail 带宽和 bytes/token;rdma_demand_model.json:拟合参数、并发拐点和理论需求;rdma_demand_report.md:可直接用于阶段汇报的结论;recommendation.env:Scout 自动选择的 Confirm 并发。