# DeepSeek-V4-Flash vLLM TPxDP matrix profile on a single RTX 6000D node (8 GPUs). PLATFORM=pro6000 EXPERIMENT=dsv4_pro6000_vllm_tp_dp_matrix MODEL_NAME=DeepSeek-V4-Flash ENGINE=vllm SERVER_CMD=vllm serve RUNTIME=docker DOCKER_IMAGE=vllm-sm120-dsv4:0.25.1-fi0.6.14 CONTAINER_NAME=${EXPERIMENT}_vllm_tp${TP}_dp${DP} MODEL_PATH=/data/6000D/DeepSeek-V4-Flash SERVED_MODEL_NAME=deepseek-v4-flash PORT=30030 HEALTH_PATH=/health HEALTH_WAIT_S=2400 DEVICE_VARS="CUDA_VISIBLE_DEVICES=0,1,2,3,4,5,6,7" ENGINE_ENV="PYTHONUNBUFFERED=1 HF_HUB_OFFLINE=1 TRANSFORMERS_OFFLINE=1" DOCKER_FLAGS="--gpus all --privileged --ipc=host --network host --ulimit memlock=-1 --ulimit stack=67108864" VOLUMES="${MODEL_PATH}:${MODEL_PATH}:ro" LAUNCH_ARGS="--model ${MODEL_PATH} --trust-remote-code --kv-cache-dtype fp8 --block-size 256 --tensor-parallel-size ${TP} --gpu-memory-utilization 0.9 --max-model-len 131072 --max-num-seqs 128 --host 0.0.0.0 --port ${PORT}" DP_FLAG="--data-parallel-size ${DP}"