- sskj.deploy runtime 支持 NODE_HOSTS 多节点编排(ssh 分发/本地 rank/LOCAL_NODE_RANK)
与 ENGINE=vllm 启动(SERVER_CMD),容器名按 rank 自动唯一
- scripts/common/deploy_cli.sh 新增 deploy_stop/status/multinode helper 与 node-rank 透传
- src/sskj/common/env.py 修复嵌套 ${VAR:-${OTHER}/path} 展开(平衡花括号扫描)
- deploy/profiles/pro6000/ 新增 6 个 profile: tp16/tp16_eagle/glm52(多节点)、
sglang/vllm tp_dp_matrix、qwen3(单节点)
- 6 个实验 start/stop 脚本改为 deploy 薄包装,run_bench/adaptive 的 server 启停走
deploy_render_args/deploy_start/deploy_stop,tp16 新增 matrix.json
- 首次入库 glm52_pro6000_sglang_multinode_tp16 实验目录;ops/README.md 补 pro6000 章节
- 实测通过: 单节点 dsv4 sglang/vllm 链路 + tp16 双节点启动/bench/清理
37 lines
1.2 KiB
Bash
Executable File
37 lines
1.2 KiB
Bash
Executable File
#!/usr/bin/env bash
|
|
# Stop SGLang multi-node server (both nodes) through the shared deployment layer.
|
|
# Usage: stop_sglang_multinode.sh [--dry-run]
|
|
set -Eeuo pipefail
|
|
|
|
SCRIPT_DIR="$(cd "$(dirname "${BASH_SOURCE[0]}")" && pwd)"
|
|
# shellcheck source=/dev/null
|
|
source "${SCRIPT_DIR}/config.env"
|
|
# shellcheck source=/dev/null
|
|
source "${SCRIPT_DIR}/../../../scripts/common/lib.sh"
|
|
# shellcheck source=/dev/null
|
|
source "${SCRIPT_DIR}/../../../scripts/common/platform.sh"
|
|
# shellcheck source=/dev/null
|
|
source "${SCRIPT_DIR}/../../../scripts/common/deploy_cli.sh"
|
|
|
|
DRY_RUN="${DRY_RUN:-0}"
|
|
DEPLOY_PROFILE="${DEPLOY_PROFILE:-pro6000/dsv4_pro6000_sglang_tp16}"
|
|
|
|
log "=== Stopping SGLang multi-node via deploy profile ${DEPLOY_PROFILE} ==="
|
|
|
|
if [[ "$DRY_RUN" == "1" ]]; then
|
|
PYTHONPATH="${ROOT_DIR}/src" "${DEPLOY_PYTHON:-python3}" -m sskj.deploy stop \
|
|
--profile "$(deploy_profile_abs "$DEPLOY_PROFILE")" \
|
|
--tp "$TP_SIZE" --dp "1" \
|
|
--port "${SGLANG_PORT:-30000}" \
|
|
--model-path "$MODEL_PATH" \
|
|
--container-name "$EXPERIMENT" \
|
|
--dry-run
|
|
else
|
|
deploy_stop \
|
|
"$DEPLOY_PROFILE" "$TP_SIZE" "1" \
|
|
"${SGLANG_PORT:-30000}" \
|
|
"$MODEL_PATH" \
|
|
"$EXPERIMENT"
|
|
fi
|
|
log "Done."
|