63 lines
1.5 KiB
Bash
63 lines
1.5 KiB
Bash
# Long-context matrix for SGLang vs vLLM on DeepSeek-V4-Flash (H200, TP=8).
|
|
# Input lengths: 64k, 128k, 256k
|
|
# Output lengths: 256, 1k, 4k
|
|
# Concurrency: 25 for 64k; 10, 5, 2 for 128k and 256k
|
|
|
|
EXPERIMENT="dsv4_h200_long_context_matrix"
|
|
MODEL_NAME="DeepSeek-V4-Flash"
|
|
MODEL_PATH="/data/models/DeepSeek-V4-Flash"
|
|
SERVED_MODEL_NAME="deepseek-v4-flash"
|
|
|
|
SGLANG_PORT="${SGLANG_PORT:-30006}"
|
|
VLLM_PORT="${VLLM_PORT:-30005}"
|
|
|
|
VENV_SGLANG="${VENV_SGLANG:-/data/user1/yy/envs/sglang}"
|
|
VENV_VLLM="${VENV_VLLM:-/data/user1/yy/envs/vllm}"
|
|
|
|
export CUDA_VISIBLE_DEVICES="0,1,2,3,4,5,6,7"
|
|
TP=8
|
|
|
|
# Per-context server settings. Each group is run with its own server start.
|
|
# Format: "input_label max_model_len max_concurrency"
|
|
declare -a CONTEXT_GROUPS=(
|
|
"64k 80000 25"
|
|
"128k 140000 10"
|
|
"256k 270000 10"
|
|
)
|
|
|
|
# Scenarios per group: "concurrency input_len output_len num_prompts"
|
|
declare -a SCENARIOS_64K=(
|
|
"25 65536 256 50"
|
|
"25 65536 1024 50"
|
|
"25 65536 4096 50"
|
|
)
|
|
|
|
declare -a SCENARIOS_128K=(
|
|
"10 131072 256 20"
|
|
"5 131072 256 10"
|
|
"2 131072 256 4"
|
|
"10 131072 1024 20"
|
|
"5 131072 1024 10"
|
|
"2 131072 1024 4"
|
|
"10 131072 4096 20"
|
|
"5 131072 4096 10"
|
|
"2 131072 4096 4"
|
|
)
|
|
|
|
declare -a SCENARIOS_256K=(
|
|
"10 262144 256 20"
|
|
"5 262144 256 10"
|
|
"2 262144 256 4"
|
|
"10 262144 1024 20"
|
|
"5 262144 1024 10"
|
|
"2 262144 1024 4"
|
|
"10 262144 4096 20"
|
|
"5 262144 4096 10"
|
|
"2 262144 4096 4"
|
|
)
|
|
|
|
VENV_CLIENT="${VENV_CLIENT:-$VENV_SGLANG}"
|
|
|
|
SGLANG_START_SCRIPT="${SCRIPT_DIR:-.}/start_sglang.sh"
|
|
VLLM_START_SCRIPT="${SCRIPT_DIR:-.}/start_vllm.sh"
|