SSKJ Dev a4e38b9e33 Reorganize experiments into hardware-specific subdirectories
Move all experiments under hardware-specific folders:
- experiments/h200/     : H200 GPU experiments (15 dirs)
- experiments/h20/      : H20 GPU experiments (2 dirs)
- experiments/p800/     : Kunlun P800 experiments (3 dirs)
- experiments/pro6000/    : RTX 6000D experiments (2 dirs)

This improves discoverability and keeps hardware-specific configs
isolated from each other.
2026-07-16 04:11:07 +00:00

49 lines
1.4 KiB
Bash

# Common configuration for the max context length exploration on H200.
# All values can be overridden via environment variables.
EXPERIMENT="dsv4_h200_max_context_length"
MODEL_NAME="DeepSeek-V4-Flash"
MODEL_PATH="/data/models/DeepSeek-V4-Flash"
SERVED_MODEL_NAME="deepseek-v4-flash"
# Ports must differ from other running experiments.
SGLANG_PORT="${SGLANG_PORT:-30011}"
VLLM_PORT="${VLLM_PORT:-30012}"
# Virtual environments.
VENV_SGLANG="${VENV_SGLANG:-/data/user1/yy/envs/sglang}"
VENV_VLLM="${VENV_VLLM:-/data/user1/yy/envs/vllm}"
VENV_CLIENT="${VENV_CLIENT:-$VENV_SGLANG}"
# Hardware: use all 8 H200 cards for both backends.
export CUDA_VISIBLE_DEVICES="0,1,2,3,4,5,6,7"
TP=8
# We want exact input lengths, so fix the random range ratio to 1.0.
OUTPUT_LEN="${OUTPUT_LEN:-1}"
NUM_PROMPTS="${NUM_PROMPTS:-1}"
MAX_CONCURRENCY="${MAX_CONCURRENCY:-1}"
REQUEST_RATE="${REQUEST_RATE:-10000}"
# Padding added to target length when setting server max context/model length.
CONTEXT_PAD="${CONTEXT_PAD:-1024}"
# Candidate input lengths (tokens). Override via CANDIDATE_LENS env var.
if [[ -z "${CANDIDATE_LENS:-}" ]]; then
declare -a CANDIDATE_LENS=(
65536
131072
262144
393216
524288
655360
786432
917504
1048576
)
fi
# Server start scripts bundled with this experiment.
SGLANG_START_SCRIPT="${SCRIPT_DIR:-.}/start_sglang.sh"
VLLM_START_SCRIPT="${SCRIPT_DIR:-.}/start_vllm.sh"