diff --git a/README.md b/README.md index 1066e08..d382785 100644 --- a/README.md +++ b/README.md @@ -1,5 +1,8 @@ # sskj — 多平台大模型推理性能基准测试项目 +> **更新(2026-07-21 14:12:30 +0800)** +> - RTX 6000D / DeepSeek-V4-Flash 的 SGLang 全量与 tiny 脚本切换到 `lmsysorg/sglang:nightly-dev-cu13-20260720-b3570a45`,MoE backend 保持 `auto`,由 nightly 自动选择可用的 FlashInfer MoE 实现;同时使用独立 nightly CUDA 13 cache,避免复用旧 SM120 修补镜像的编译缓存。 + > **更新(2026-07-21 14:00:30 +0800)** > - adaptive 并发搜索新增可配置的 `C=1 OOM` 配置级短路:同一 TP/DP 在最小并发仍 OOM 时,直接跳过该组更长输入,避免把已经确定不可部署的长度继续压测;6000D DSV4-Flash SGLang tiny 已启用,并支持从已有结果恢复时识别此前的该边界。 diff --git a/experiments/pro6000/dsv4_pro6000_sglang_tiny_1k_output/config.env b/experiments/pro6000/dsv4_pro6000_sglang_tiny_1k_output/config.env index d87a55e..41ed6bb 100644 --- a/experiments/pro6000/dsv4_pro6000_sglang_tiny_1k_output/config.env +++ b/experiments/pro6000/dsv4_pro6000_sglang_tiny_1k_output/config.env @@ -34,7 +34,7 @@ declare -a PARALLEL_CONFIGS=( "8 1" ) -# SGLang server settings, verified for this model and machine. +# SGLang nightly server settings for this model and machine. MEM_FRACTION_STATIC="${MEM_FRACTION_STATIC:-0.90}" MOE_RUNNER_BACKEND="${MOE_RUNNER_BACKEND:-auto}" CONTEXT_LENGTH="${CONTEXT_LENGTH:-131072}" @@ -44,13 +44,13 @@ SKIP_CONFIG_ON_MIN_CONCURRENCY_OOM="${SKIP_CONFIG_ON_MIN_CONCURRENCY_OOM:-1}" # Deployment switch. 0 = native sglang venv, 1 = Docker. USE_DOCKER="${USE_DOCKER:-1}" -DOCKER_IMAGE="${DOCKER_IMAGE:-sglang-sm120-dsv4:0.5.15.post1-fi0.6.14-sm120fix1}" +DOCKER_IMAGE="${DOCKER_IMAGE:-lmsysorg/sglang:nightly-dev-cu13-20260720-b3570a45}" # To use ShareGPT, set BENCH_DATASET_NAME=random and DATASET_PATH explicitly. BENCH_DATASET_NAME="${BENCH_DATASET_NAME:-random}" DATASET_PATH="${DATASET_PATH:-${ROOT_DIR}/dataset/ShareGPT_V3_unfiltered_cleaned_split.json}" SGLANG_BENCH_MODULE="${SGLANG_BENCH_MODULE:-sglang.benchmark.serving}" -CACHE_DIR="${CACHE_DIR:-${ROOT_DIR}/sglang_sm120_cache}" +CACHE_DIR="${CACHE_DIR:-${ROOT_DIR}/sglang_nightly_cu13_cache}" # Matrix contains ISL=1K..128K with fixed OSL=1K. MATRIX_FILE="${MATRIX_FILE:-${SCRIPT_DIR:-.}/matrix.json}" diff --git a/experiments/pro6000/dsv4_pro6000_sglang_tiny_1k_output/run_adaptive_concurrency_add16.sh b/experiments/pro6000/dsv4_pro6000_sglang_tiny_1k_output/run_adaptive_concurrency_add16.sh index 2d993e1..a18951a 100755 --- a/experiments/pro6000/dsv4_pro6000_sglang_tiny_1k_output/run_adaptive_concurrency_add16.sh +++ b/experiments/pro6000/dsv4_pro6000_sglang_tiny_1k_output/run_adaptive_concurrency_add16.sh @@ -27,7 +27,7 @@ else PYTHON="$(command -v python3)" fi -DOCKER_IMAGE="${DOCKER_IMAGE:-sglang-sm120-dsv4:0.5.15.post1-fi0.6.14-sm120fix1}" +DOCKER_IMAGE="${DOCKER_IMAGE:-lmsysorg/sglang:nightly-dev-cu13-20260720-b3570a45}" engine_is_healthy() { curl --fail --silent --show-error --max-time 5 \ diff --git a/experiments/pro6000/dsv4_pro6000_sglang_tiny_1k_output/start_sglang_docker.sh b/experiments/pro6000/dsv4_pro6000_sglang_tiny_1k_output/start_sglang_docker.sh index e251dd5..6df6177 100755 --- a/experiments/pro6000/dsv4_pro6000_sglang_tiny_1k_output/start_sglang_docker.sh +++ b/experiments/pro6000/dsv4_pro6000_sglang_tiny_1k_output/start_sglang_docker.sh @@ -16,7 +16,7 @@ source "${SCRIPT_DIR}/config.env" RUNTIME_BASE="${RUNTIME_BASE:-${SCRIPT_DIR}/runtime}" mkdir -p "${RUNTIME_BASE}/logs" "${RUNTIME_BASE}/tmp" "$CACHE_DIR" -IMAGE="${DOCKER_IMAGE:-sglang-sm120-dsv4:0.5.15.post1-fi0.6.14-sm120fix1}" +IMAGE="${DOCKER_IMAGE:-lmsysorg/sglang:nightly-dev-cu13-20260720-b3570a45}" PORT="${SGLANG_PORT:-30031}" NAME="${EXPERIMENT}_sglang_tp${TP}_dp${DP}" PID_FILE="${RUNTIME_BASE}/${EXPERIMENT}_sglang_tp${TP}_dp${DP}.pid" diff --git a/experiments/pro6000/dsv4_pro6000_sglang_tp_dp_matrix/config.env b/experiments/pro6000/dsv4_pro6000_sglang_tp_dp_matrix/config.env index 825b3ea..f096ecf 100644 --- a/experiments/pro6000/dsv4_pro6000_sglang_tp_dp_matrix/config.env +++ b/experiments/pro6000/dsv4_pro6000_sglang_tp_dp_matrix/config.env @@ -33,7 +33,7 @@ declare -a PARALLEL_CONFIGS=( "8 1" ) -# SGLang server settings, verified for RTX 6000D / DeepSeek-V4-Flash. +# SGLang nightly server settings for RTX 6000D / DeepSeek-V4-Flash. MEM_FRACTION_STATIC="${MEM_FRACTION_STATIC:-0.90}" MOE_RUNNER_BACKEND="${MOE_RUNNER_BACKEND:-auto}" CONTEXT_LENGTH="${CONTEXT_LENGTH:-131072}" @@ -41,13 +41,13 @@ MAX_RUNNING_REQUESTS="${MAX_RUNNING_REQUESTS:-64}" # Deployment switch. 0 = native sglang venv, 1 = Docker. USE_DOCKER="${USE_DOCKER:-1}" -DOCKER_IMAGE="${DOCKER_IMAGE:-sglang-sm120-dsv4:0.5.15.post1-fi0.6.14-sm120fix1}" +DOCKER_IMAGE="${DOCKER_IMAGE:-lmsysorg/sglang:nightly-dev-cu13-20260720-b3570a45}" # To use ShareGPT, set BENCH_DATASET_NAME=random and DATASET_PATH explicitly. BENCH_DATASET_NAME="${BENCH_DATASET_NAME:-random}" DATASET_PATH="${DATASET_PATH:-${ROOT_DIR}/dataset/ShareGPT_V3_unfiltered_cleaned_split.json}" SGLANG_BENCH_MODULE="${SGLANG_BENCH_MODULE:-sglang.benchmark.serving}" -CACHE_DIR="${CACHE_DIR:-${ROOT_DIR}/sglang_sm120_cache}" +CACHE_DIR="${CACHE_DIR:-${ROOT_DIR}/sglang_nightly_cu13_cache}" # Matrix and concurrency rules are defined in matrix.json by default. MATRIX_FILE="${MATRIX_FILE:-${SCRIPT_DIR:-.}/matrix.json}" diff --git a/experiments/pro6000/dsv4_pro6000_sglang_tp_dp_matrix/run_adaptive_concurrency.sh b/experiments/pro6000/dsv4_pro6000_sglang_tp_dp_matrix/run_adaptive_concurrency.sh index 39ed951..bf9f543 100755 --- a/experiments/pro6000/dsv4_pro6000_sglang_tp_dp_matrix/run_adaptive_concurrency.sh +++ b/experiments/pro6000/dsv4_pro6000_sglang_tp_dp_matrix/run_adaptive_concurrency.sh @@ -27,7 +27,7 @@ else PYTHON="$(command -v python3)" fi -DOCKER_IMAGE="${DOCKER_IMAGE:-sglang-sm120-dsv4:0.5.15.post1-fi0.6.14-sm120fix1}" +DOCKER_IMAGE="${DOCKER_IMAGE:-lmsysorg/sglang:nightly-dev-cu13-20260720-b3570a45}" engine_is_healthy() { curl --fail --silent --show-error --max-time 5 \ diff --git a/experiments/pro6000/dsv4_pro6000_sglang_tp_dp_matrix/run_adaptive_concurrency_add16.sh b/experiments/pro6000/dsv4_pro6000_sglang_tp_dp_matrix/run_adaptive_concurrency_add16.sh index ab26fe1..bf1ea37 100755 --- a/experiments/pro6000/dsv4_pro6000_sglang_tp_dp_matrix/run_adaptive_concurrency_add16.sh +++ b/experiments/pro6000/dsv4_pro6000_sglang_tp_dp_matrix/run_adaptive_concurrency_add16.sh @@ -27,7 +27,7 @@ else PYTHON="$(command -v python3)" fi -DOCKER_IMAGE="${DOCKER_IMAGE:-sglang-sm120-dsv4:0.5.15.post1-fi0.6.14-sm120fix1}" +DOCKER_IMAGE="${DOCKER_IMAGE:-lmsysorg/sglang:nightly-dev-cu13-20260720-b3570a45}" engine_is_healthy() { curl --fail --silent --show-error --max-time 5 \ diff --git a/experiments/pro6000/dsv4_pro6000_sglang_tp_dp_matrix/run_bench.sh b/experiments/pro6000/dsv4_pro6000_sglang_tp_dp_matrix/run_bench.sh index 5b3a6d3..2b886e4 100755 --- a/experiments/pro6000/dsv4_pro6000_sglang_tp_dp_matrix/run_bench.sh +++ b/experiments/pro6000/dsv4_pro6000_sglang_tp_dp_matrix/run_bench.sh @@ -30,7 +30,7 @@ else PYTHON="$(command -v python3)" fi -DOCKER_IMAGE="${DOCKER_IMAGE:-sglang-sm120-dsv4:0.5.15.post1-fi0.6.14-sm120fix1}" +DOCKER_IMAGE="${DOCKER_IMAGE:-lmsysorg/sglang:nightly-dev-cu13-20260720-b3570a45}" log_dir_global="${RESULT_BASE}/${RUN_ID}/logs" mkdir -p "$log_dir_global" diff --git a/experiments/pro6000/dsv4_pro6000_sglang_tp_dp_matrix/start_sglang_container.sh b/experiments/pro6000/dsv4_pro6000_sglang_tp_dp_matrix/start_sglang_container.sh index c33bb0d..298565c 100755 --- a/experiments/pro6000/dsv4_pro6000_sglang_tp_dp_matrix/start_sglang_container.sh +++ b/experiments/pro6000/dsv4_pro6000_sglang_tp_dp_matrix/start_sglang_container.sh @@ -13,7 +13,7 @@ source "${SCRIPT_DIR}/config.env" RUNTIME_BASE="${RUNTIME_BASE:-${SCRIPT_DIR}/runtime}" mkdir -p "${RUNTIME_BASE}/logs" "${RUNTIME_BASE}/tmp" -IMAGE="${DOCKER_IMAGE:-sglang-sm120-dsv4:0.5.15.post1-fi0.6.14-sm120fix1}" +IMAGE="${DOCKER_IMAGE:-lmsysorg/sglang:nightly-dev-cu13-20260720-b3570a45}" PORT="${SGLANG_PORT:-30031}" NAME="${EXPERIMENT}_sglang_container" PID_FILE="${RUNTIME_BASE}/${EXPERIMENT}_container.pid" diff --git a/experiments/pro6000/dsv4_pro6000_sglang_tp_dp_matrix/start_sglang_docker.sh b/experiments/pro6000/dsv4_pro6000_sglang_tp_dp_matrix/start_sglang_docker.sh index e251dd5..6df6177 100755 --- a/experiments/pro6000/dsv4_pro6000_sglang_tp_dp_matrix/start_sglang_docker.sh +++ b/experiments/pro6000/dsv4_pro6000_sglang_tp_dp_matrix/start_sglang_docker.sh @@ -16,7 +16,7 @@ source "${SCRIPT_DIR}/config.env" RUNTIME_BASE="${RUNTIME_BASE:-${SCRIPT_DIR}/runtime}" mkdir -p "${RUNTIME_BASE}/logs" "${RUNTIME_BASE}/tmp" "$CACHE_DIR" -IMAGE="${DOCKER_IMAGE:-sglang-sm120-dsv4:0.5.15.post1-fi0.6.14-sm120fix1}" +IMAGE="${DOCKER_IMAGE:-lmsysorg/sglang:nightly-dev-cu13-20260720-b3570a45}" PORT="${SGLANG_PORT:-30031}" NAME="${EXPERIMENT}_sglang_tp${TP}_dp${DP}" PID_FILE="${RUNTIME_BASE}/${EXPERIMENT}_sglang_tp${TP}_dp${DP}.pid"