# DeepSeek-V4-Pro SGLang multi-node TP=16 EP=2 + EAGLE speculative decoding # (2x RTX 6000D). Same topology as dsv4_pro6000_sglang_tp16, plus EAGLE flags. PLATFORM=pro6000 EXPERIMENT=dsv4_pro6000_sglang_tp16_eagle MODEL_NAME=DeepSeek-V4-Pro ENGINE=sglang RUNTIME=docker DOCKER_IMAGE=lmsysorg/sglang:nightly-dev-cu13-20260720-b3570a45 CONTAINER_NAME=${EXPERIMENT}_node${NODE_RANK} MODEL_PATH=/data/hf_models/DeepSeek-V4-Pro SERVED_MODEL_NAME=default PORT=30000 HEALTH_PATH=/health HEALTH_HOST=10.101.0.11 HEALTH_WAIT_S=2400 CONTAINER_PYTHON=python3 # ---- Multi-node topology (rank order; rank 0 exposes the HTTP API) ---- NNODES=2 NODE_HOSTS="10.101.0.11 10.101.0.13" NODE_SSH_USER=root MASTER_IP=10.101.0.11 DIST_PORT=20000 DEVICE_VARS="CUDA_VISIBLE_DEVICES=0,1,2,3,4,5,6,7" ENGINE_ENV="NCCL_SOCKET_IFNAME=eth0 NCCL_DEBUG=WARN SGLANG_SHARED_EXPERT_TP1=1 PYTHONUNBUFFERED=1 HF_HUB_OFFLINE=1 TRANSFORMERS_OFFLINE=1" DOCKER_FLAGS="--gpus all --network host --ipc=host --ulimit memlock=-1 --shm-size=20g" VOLUMES="${MODEL_PATH}:${MODEL_PATH}:ro" LAUNCH_ARGS="--model-path ${MODEL_PATH} --tp-size ${TP} --ep-size 2 --nnodes ${NNODES} --node-rank ${NODE_RANK} --dist-init-addr ${MASTER_IP}:${DIST_PORT} --trust-remote-code --host 0.0.0.0 --port ${PORT} --mem-fraction-static 0.9 --cuda-graph-max-bs-decode 64 --max-running-requests 256 --speculative-algorithm EAGLE --speculative-num-steps 3 --speculative-eagle-topk 1 --speculative-num-draft-tokens 4"