# DeepSeek-V4-Flash SGLang TPxDP matrix profile on a single RTX 6000D node (8 GPUs). # TP=2/DP=4 is excluded because Marlin weight loading OOMs on this machine. PLATFORM=pro6000 EXPERIMENT=dsv4_pro6000_sglang_tp_dp_matrix MODEL_NAME=DeepSeek-V4-Flash ENGINE=sglang RUNTIME=docker DOCKER_IMAGE=lmsysorg/sglang:nightly-dev-cu13-20260720-b3570a45 CONTAINER_NAME=${EXPERIMENT}_sglang_tp${TP}_dp${DP} MODEL_PATH=/data/6000D/DeepSeek-V4-Flash SERVED_MODEL_NAME=deepseek-v4-flash PORT=30031 HEALTH_PATH=/health HEALTH_WAIT_S=2400 CONTAINER_PYTHON=python3 DEVICE_VARS="CUDA_VISIBLE_DEVICES=0,1,2,3,4,5,6,7" ENGINE_ENV="PYTHONUNBUFFERED=1 HF_HUB_OFFLINE=1 TRANSFORMERS_OFFLINE=1 PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True" DOCKER_FLAGS="--gpus all --privileged --ipc=host --network host --ulimit memlock=-1 --ulimit stack=67108864" VOLUMES="${MODEL_PATH}:${MODEL_PATH}:ro" LAUNCH_ARGS="--model-path ${MODEL_PATH} --trust-remote-code --tp-size ${TP} --moe-runner-backend auto --mem-fraction-static 0.9 --context-length 131072 --max-running-requests 64 --host 0.0.0.0 --port ${PORT}"