- sskj.deploy runtime 支持 NODE_HOSTS 多节点编排(ssh 分发/本地 rank/LOCAL_NODE_RANK)
与 ENGINE=vllm 启动(SERVER_CMD),容器名按 rank 自动唯一
- scripts/common/deploy_cli.sh 新增 deploy_stop/status/multinode helper 与 node-rank 透传
- src/sskj/common/env.py 修复嵌套 ${VAR:-${OTHER}/path} 展开(平衡花括号扫描)
- deploy/profiles/pro6000/ 新增 6 个 profile: tp16/tp16_eagle/glm52(多节点)、
sglang/vllm tp_dp_matrix、qwen3(单节点)
- 6 个实验 start/stop 脚本改为 deploy 薄包装,run_bench/adaptive 的 server 启停走
deploy_render_args/deploy_start/deploy_stop,tp16 新增 matrix.json
- 首次入库 glm52_pro6000_sglang_multinode_tp16 实验目录;ops/README.md 补 pro6000 章节
- 实测通过: 单节点 dsv4 sglang/vllm 链路 + tp16 双节点启动/bench/清理
25 lines
1.1 KiB
Bash
25 lines
1.1 KiB
Bash
# DeepSeek-V4-Flash SGLang TPxDP matrix profile on a single RTX 6000D node (8 GPUs).
|
|
# TP=2/DP=4 is excluded because Marlin weight loading OOMs on this machine.
|
|
|
|
PLATFORM=pro6000
|
|
EXPERIMENT=dsv4_pro6000_sglang_tp_dp_matrix
|
|
MODEL_NAME=DeepSeek-V4-Flash
|
|
ENGINE=sglang
|
|
RUNTIME=docker
|
|
DOCKER_IMAGE=lmsysorg/sglang:nightly-dev-cu13-20260720-b3570a45
|
|
CONTAINER_NAME=${EXPERIMENT}_sglang_tp${TP}_dp${DP}
|
|
MODEL_PATH=/data/6000D/DeepSeek-V4-Flash
|
|
SERVED_MODEL_NAME=deepseek-v4-flash
|
|
PORT=30031
|
|
HEALTH_PATH=/health
|
|
HEALTH_WAIT_S=2400
|
|
CONTAINER_PYTHON=python3
|
|
|
|
DEVICE_VARS="CUDA_VISIBLE_DEVICES=0,1,2,3,4,5,6,7"
|
|
ENGINE_ENV="PYTHONUNBUFFERED=1 HF_HUB_OFFLINE=1 TRANSFORMERS_OFFLINE=1 PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True"
|
|
|
|
DOCKER_FLAGS="--gpus all --privileged --ipc=host --network host --ulimit memlock=-1 --ulimit stack=67108864"
|
|
VOLUMES="${MODEL_PATH}:${MODEL_PATH}:ro"
|
|
|
|
LAUNCH_ARGS="--model-path ${MODEL_PATH} --trust-remote-code --tp-size ${TP} --moe-runner-backend auto --mem-fraction-static 0.9 --context-length 131072 --max-running-requests 64 --host 0.0.0.0 --port ${PORT}"
|