# Long-context matrix for SGLang vs vLLM on DeepSeek-V4-Flash (H200, TP=8). # Input lengths: 64k, 128k, 256k # Output lengths: 256, 1k, 4k # Concurrency: 25 for 64k; 10, 5, 2 for 128k and 256k EXPERIMENT="dsv4_h200_long_context_matrix" MODEL_NAME="DeepSeek-V4-Flash" MODEL_PATH="/data/models/DeepSeek-V4-Flash" SERVED_MODEL_NAME="deepseek-v4-flash" SGLANG_PORT="${SGLANG_PORT:-30006}" VLLM_PORT="${VLLM_PORT:-30005}" VENV_SGLANG="${VENV_SGLANG:-/data/user1/yy/envs/sglang}" VENV_VLLM="${VENV_VLLM:-/data/user1/yy/envs/vllm}" export CUDA_VISIBLE_DEVICES="0,1,2,3,4,5,6,7" TP=8 # Per-context server settings. Each group is run with its own server start. # Format: "input_label max_model_len max_concurrency" declare -a CONTEXT_GROUPS=( "64k 80000 25" "128k 140000 10" "256k 270000 10" ) # Scenarios per group: "concurrency input_len output_len num_prompts" declare -a SCENARIOS_64K=( "25 65536 256 50" "25 65536 1024 50" "25 65536 4096 50" ) declare -a SCENARIOS_128K=( "10 131072 256 20" "5 131072 256 10" "2 131072 256 4" "10 131072 1024 20" "5 131072 1024 10" "2 131072 1024 4" "10 131072 4096 20" "5 131072 4096 10" "2 131072 4096 4" ) declare -a SCENARIOS_256K=( "10 262144 256 20" "5 262144 256 10" "2 262144 256 4" "10 262144 1024 20" "5 262144 1024 10" "2 262144 1024 4" "10 262144 4096 20" "5 262144 4096 10" "2 262144 4096 4" ) VENV_CLIENT="${VENV_CLIENT:-$VENV_SGLANG}" SGLANG_START_SCRIPT="${SCRIPT_DIR:-.}/start_sglang.sh" VLLM_START_SCRIPT="${SCRIPT_DIR:-.}/start_vllm.sh"