# ============================================================ # DeepSeek-V4-Pro SGLang multi-node TP=16 EP=2 benchmark config # Nodes: 10.101.0.11 (rank 0) + 10.101.0.13 (rank 1) # GPUs: 16× RTX 6000D (85GB each) # # Key: SGLANG_SHARED_EXPERT_TP1=1 + --ep-size 2 → TP=16 works with FP8 block=128 # ============================================================ EXPERIMENT="dsv4_pro6000_sglang_tp16" MODEL_NAME="DeepSeek-V4-Pro" MODEL_PATH="/data/hf_models/DeepSeek-V4-Pro" SERVED_MODEL_NAME="default" # ---- Nodes (IPs for reliable SSH) ---- HEAD_NODE="10.101.0.11" WORKER_NODE="10.101.0.13" HEAD_IP="10.101.0.11" DIST_INIT_PORT="${DIST_INIT_PORT:-20000}" SGLANG_PORT="${SGLANG_PORT:-30000}" # ---- Parallelism ---- TP_SIZE="${TP_SIZE:-16}" EP_SIZE="${EP_SIZE:-2}" NNODES="${NNODES:-2}" # ---- Docker ---- DOCKER_IMAGE="${DOCKER_IMAGE:-lmsysorg/sglang:nightly-dev-cu13-20260720-b3570a45}" DOCKER_CLIENT_IMAGE="${DOCKER_CLIENT_IMAGE:-lmsysorg/sglang:nightly-dev-cu13-20260720-b3570a45}" # ---- NCCL ---- NCCL_SOCKET_IFNAME="${NCCL_SOCKET_IFNAME:-eth0}" NCCL_DEBUG="${NCCL_DEBUG:-WARN}" # ---- SGLang memory / perf ---- MEM_FRACTION_STATIC="${MEM_FRACTION_STATIC:-0.9}" CUDA_GRAPH_MAX_BS_DECODE="${CUDA_GRAPH_MAX_BS_DECODE:-8}" MAX_RUNNING_REQUESTS="${MAX_RUNNING_REQUESTS:-32}" # ---- Benchmark ---- BENCH_DATASET_NAME="${BENCH_DATASET_NAME:-random}" DATASET_PATH="${DATASET_PATH:-/data/yy/sskj/dataset/ShareGPT_V3_unfiltered_cleaned_split.json}" SGLANG_BENCH_MODULE="${SGLANG_BENCH_MODULE:-sglang.benchmark.serving}" RANDOM_RANGE_RATIO="${RANDOM_RANGE_RATIO:-1.0}" WARMUP_REQUESTS="${WARMUP_REQUESTS:-16}" NUM_REPETITIONS="${NUM_REPETITIONS:-3}" # ---- SLO ---- TTFT_SLO_MS="${TTFT_SLO_MS:-4000}" ENABLE_TTFT_SLO_STOP="${ENABLE_TTFT_SLO_STOP:-1}" # ---- Timeouts ---- SCENARIO_TIMEOUT_S="${SCENARIO_TIMEOUT_S:-1800}" HEALTH_CHECK_RETRIES="${HEALTH_CHECK_RETRIES:-600}" HEALTH_CHECK_INTERVAL_S="${HEALTH_CHECK_INTERVAL_S:-5}" # ---- Directories ---- SCRIPT_DIR="$(cd "$(dirname "${BASH_SOURCE[0]}")" && pwd)" RESULT_BASE="${RESULT_BASE:-${SCRIPT_DIR}/results}" # ---- Dry-run ---- DRY_RUN="${DRY_RUN:-0}"