[Docs] clarify Phase 2 worker preparation
This commit is contained in:
parent
337195254a
commit
72bae06576
@ -1,5 +1,9 @@
|
||||
# sskj — 多平台大模型推理性能基准测试项目
|
||||
|
||||
> **更新(2026-07-31 13:59:12 CST)**
|
||||
>
|
||||
> 补充 Phase 2 双节点执行边界:正式实验前仅需在 Worker `174.1.51.7` 启动并验证 `nvidia-dcgm` Host Engine;完整 `run_hardware_contention_attribution.sh all` 入口仍然只在 Head `174.1.51.5` 执行,由其通过 SSH 管理 Worker 服务与采集器。文档明确列出两台节点分别需要运行的命令,避免在 Worker 重复启动整套实验。
|
||||
>
|
||||
> **更新(2026-07-31 13:40:03 CST)**
|
||||
>
|
||||
> 完成 DeepSeek-V4-Pro 双机 Pro6000D SGLang TP16 的 Phase 2 首轮硬件归因。正式 Run `dsv4pro-phase2-20260731-130125` 在 26 分 26 秒内完成 8/8 个 benchmark,无 OOM;混合负载下 Decode Output TPS 下降 24.03%,TPOT P95 增加 66.79%。两端双 Rail `NET/IB + GDRDMA` 流量均衡、错误增量为 0,最高每 Rail 平均约 70 Gbit/s,原始 RoCE 带宽未饱和;整机 CPU 与 GPU 频率也未见全局瓶颈。档案补充了 6000D 无 NVLink、机内 PCIe P2P/IPC、跨机 GDRDMA 的真实通信路径,并记录 Worker DCGM Host Engine 未启动、Case 时间窗过宽和 `pidstat` 日志过大的采集限制。
|
||||
|
||||
@ -135,7 +135,7 @@
|
||||
<div class="meta">
|
||||
<span>节点:174.1.51.5 + 174.1.51.7</span>
|
||||
<span>拓扑:SGLang TP16 / EP2</span>
|
||||
<span>更新:2026-07-31 13:40:03 CST</span>
|
||||
<span>更新:2026-07-31 13:59:12 CST</span>
|
||||
</div>
|
||||
</div>
|
||||
</header>
|
||||
@ -221,11 +221,20 @@ Head 与 Worker 的所有采集器覆盖完整诊断窗口。</code></pre>
|
||||
|
||||
<h3>4.1 你只需要运行的入口</h3>
|
||||
<p class="decision">
|
||||
<strong>操作规则:只执行 Phase 2 的 <code>all</code>。</strong>
|
||||
<strong>操作规则:先在 Worker <code>.7</code> 做一次 DCGM 准备,再只在
|
||||
Head <code>.5</code> 执行 Phase 2 的 <code>all</code>。</strong>
|
||||
不要手工执行 Phase 1 的 <code>start</code> 或 <code>stop</code>。
|
||||
Phase 2 会在内部复用它们,并负责异常退出时的采集器、Head、Worker 清理。
|
||||
</p>
|
||||
<pre><code class="language-bash"># [仅在 174.1.51.5 执行]
|
||||
<pre><code class="language-bash"># [仅在 Worker 174.1.51.7 执行一次]
|
||||
# 不需要 source、conda activate,也不要在 .7 运行 Phase 2 的 all
|
||||
systemctl start nvidia-dcgm
|
||||
systemctl is-active nvidia-dcgm
|
||||
dcgmi discovery -l
|
||||
|
||||
# 预期:第二条输出 active,第三条列出本机 8 张 GPU
|
||||
|
||||
# [以下仅在 Head 174.1.51.5 执行]
|
||||
cd /data/hzy/sskj/experiments/pro6000/dsv4pro_pro6000d_2node_sglang_hardware_contention_attribution
|
||||
|
||||
# 第一次先展开全部命令,不启动服务、不占用 GPU、不发送请求
|
||||
@ -239,6 +248,12 @@ tmux new-session -d -s dsv4pro-phase2 \
|
||||
2>&1 | tee /data/hzy/${RUN_ID}.log"
|
||||
|
||||
tmux attach -t dsv4pro-phase2</code></pre>
|
||||
<p>
|
||||
<code>.7</code> 的三条命令只负责让 Worker DCGM Host Engine 可用;
|
||||
SGLang Worker、其余采集器和结果回收仍由 <code>.5</code> 的唯一入口通过 SSH 管理。
|
||||
若需要机器重启后自动启动 DCGM,应由运维另行决定是否执行
|
||||
<code>systemctl enable nvidia-dcgm</code>。
|
||||
</p>
|
||||
<p><strong><code>all</code> 内部执行顺序:</strong></p>
|
||||
<pre><code>配置与工具门禁
|
||||
→ Phase 1 start:启动同配置 TP16 服务
|
||||
|
||||
Loading…
x
Reference in New Issue
Block a user