From 72bae0657600ad347e657953dd22a2de189dc5b4 Mon Sep 17 00:00:00 2001 From: Zhiyi Hong <2497491955@qq.com> Date: Fri, 31 Jul 2026 14:00:58 +0800 Subject: [PATCH] [Docs] clarify Phase 2 worker preparation --- README.md | 4 ++++ ...glang_hardware_contention_attribution.html | 21 ++++++++++++++++--- 2 files changed, 22 insertions(+), 3 deletions(-) diff --git a/README.md b/README.md index f416104..24be854 100644 --- a/README.md +++ b/README.md @@ -1,5 +1,9 @@ # sskj — 多平台大模型推理性能基准测试项目 +> **更新(2026-07-31 13:59:12 CST)** +> +> 补充 Phase 2 双节点执行边界:正式实验前仅需在 Worker `174.1.51.7` 启动并验证 `nvidia-dcgm` Host Engine;完整 `run_hardware_contention_attribution.sh all` 入口仍然只在 Head `174.1.51.5` 执行,由其通过 SSH 管理 Worker 服务与采集器。文档明确列出两台节点分别需要运行的命令,避免在 Worker 重复启动整套实验。 +> > **更新(2026-07-31 13:40:03 CST)** > > 完成 DeepSeek-V4-Pro 双机 Pro6000D SGLang TP16 的 Phase 2 首轮硬件归因。正式 Run `dsv4pro-phase2-20260731-130125` 在 26 分 26 秒内完成 8/8 个 benchmark,无 OOM;混合负载下 Decode Output TPS 下降 24.03%,TPOT P95 增加 66.79%。两端双 Rail `NET/IB + GDRDMA` 流量均衡、错误增量为 0,最高每 Rail 平均约 70 Gbit/s,原始 RoCE 带宽未饱和;整机 CPU 与 GPU 频率也未见全局瓶颈。档案补充了 6000D 无 NVLink、机内 PCIe P2P/IPC、跨机 GDRDMA 的真实通信路径,并记录 Worker DCGM Host Engine 未启动、Case 时间窗过宽和 `pidstat` 日志过大的采集限制。 diff --git a/docs/dsv4pro_pro6000d_2node_sglang/phase2_dsv4pro_pro6000d_2node_sglang_hardware_contention_attribution.html b/docs/dsv4pro_pro6000d_2node_sglang/phase2_dsv4pro_pro6000d_2node_sglang_hardware_contention_attribution.html index 47043dc..2ac076f 100644 --- a/docs/dsv4pro_pro6000d_2node_sglang/phase2_dsv4pro_pro6000d_2node_sglang_hardware_contention_attribution.html +++ b/docs/dsv4pro_pro6000d_2node_sglang/phase2_dsv4pro_pro6000d_2node_sglang_hardware_contention_attribution.html @@ -135,7 +135,7 @@
@@ -221,11 +221,20 @@ Head 与 Worker 的所有采集器覆盖完整诊断窗口。
- 操作规则:只执行 Phase 2 的 all。
+ 操作规则:先在 Worker .7 做一次 DCGM 准备,再只在
+ Head .5 执行 Phase 2 的 all。
不要手工执行 Phase 1 的 start 或 stop。
Phase 2 会在内部复用它们,并负责异常退出时的采集器、Head、Worker 清理。
# [仅在 174.1.51.5 执行]
+ # [仅在 Worker 174.1.51.7 执行一次]
+# 不需要 source、conda activate,也不要在 .7 运行 Phase 2 的 all
+systemctl start nvidia-dcgm
+systemctl is-active nvidia-dcgm
+dcgmi discovery -l
+
+# 预期:第二条输出 active,第三条列出本机 8 张 GPU
+
+# [以下仅在 Head 174.1.51.5 执行]
cd /data/hzy/sskj/experiments/pro6000/dsv4pro_pro6000d_2node_sglang_hardware_contention_attribution
# 第一次先展开全部命令,不启动服务、不占用 GPU、不发送请求
@@ -239,6 +248,12 @@ tmux new-session -d -s dsv4pro-phase2 \
2>&1 | tee /data/hzy/${RUN_ID}.log"
tmux attach -t dsv4pro-phase2
+
+ .7 的三条命令只负责让 Worker DCGM Host Engine 可用;
+ SGLang Worker、其余采集器和结果回收仍由 .5 的唯一入口通过 SSH 管理。
+ 若需要机器重启后自动启动 DCGM,应由运维另行决定是否执行
+ systemctl enable nvidia-dcgm。
+
all 内部执行顺序:
配置与工具门禁
→ Phase 1 start:启动同配置 TP16 服务