- sskj.deploy runtime 支持 NODE_HOSTS 多节点编排(ssh 分发/本地 rank/LOCAL_NODE_RANK)
与 ENGINE=vllm 启动(SERVER_CMD),容器名按 rank 自动唯一
- scripts/common/deploy_cli.sh 新增 deploy_stop/status/multinode helper 与 node-rank 透传
- src/sskj/common/env.py 修复嵌套 ${VAR:-${OTHER}/path} 展开(平衡花括号扫描)
- deploy/profiles/pro6000/ 新增 6 个 profile: tp16/tp16_eagle/glm52(多节点)、
sglang/vllm tp_dp_matrix、qwen3(单节点)
- 6 个实验 start/stop 脚本改为 deploy 薄包装,run_bench/adaptive 的 server 启停走
deploy_render_args/deploy_start/deploy_stop,tp16 新增 matrix.json
- 首次入库 glm52_pro6000_sglang_multinode_tp16 实验目录;ops/README.md 补 pro6000 章节
- 实测通过: 单节点 dsv4 sglang/vllm 链路 + tp16 双节点启动/bench/清理
25 lines
980 B
Bash
25 lines
980 B
Bash
# DeepSeek-V4-Flash vLLM TPxDP matrix profile on a single RTX 6000D node (8 GPUs).
|
|
|
|
PLATFORM=pro6000
|
|
EXPERIMENT=dsv4_pro6000_vllm_tp_dp_matrix
|
|
MODEL_NAME=DeepSeek-V4-Flash
|
|
ENGINE=vllm
|
|
SERVER_CMD=vllm serve
|
|
RUNTIME=docker
|
|
DOCKER_IMAGE=vllm-sm120-dsv4:0.25.1-fi0.6.14
|
|
CONTAINER_NAME=${EXPERIMENT}_vllm_tp${TP}_dp${DP}
|
|
MODEL_PATH=/data/6000D/DeepSeek-V4-Flash
|
|
SERVED_MODEL_NAME=deepseek-v4-flash
|
|
PORT=30030
|
|
HEALTH_PATH=/health
|
|
HEALTH_WAIT_S=2400
|
|
|
|
DEVICE_VARS="CUDA_VISIBLE_DEVICES=0,1,2,3,4,5,6,7"
|
|
ENGINE_ENV="PYTHONUNBUFFERED=1 HF_HUB_OFFLINE=1 TRANSFORMERS_OFFLINE=1"
|
|
|
|
DOCKER_FLAGS="--gpus all --privileged --ipc=host --network host --ulimit memlock=-1 --ulimit stack=67108864"
|
|
VOLUMES="${MODEL_PATH}:${MODEL_PATH}:ro"
|
|
|
|
LAUNCH_ARGS="--model ${MODEL_PATH} --trust-remote-code --kv-cache-dtype fp8 --block-size 256 --tensor-parallel-size ${TP} --gpu-memory-utilization 0.9 --max-model-len 131072 --max-num-seqs 128 --host 0.0.0.0 --port ${PORT}"
|
|
DP_FLAG="--data-parallel-size ${DP}"
|