diff --git a/deploy/profiles/910c/glm52_910c_vllm_tp_dp_matrix.env b/deploy/profiles/910c/glm52_910c_vllm_tp_dp_matrix.env index 7582abf..99f2195 100644 --- a/deploy/profiles/910c/glm52_910c_vllm_tp_dp_matrix.env +++ b/deploy/profiles/910c/glm52_910c_vllm_tp_dp_matrix.env @@ -9,7 +9,7 @@ EXPERIMENT=glm52_910c_vllm_tp_dp_matrix MODEL_NAME=GLM-5.2 ENGINE=vllm RUNTIME=docker -DOCKER_IMAGE=quay.io/ascend/vllm-ascend:glm5.2-a3-openeuler +DOCKER_IMAGE=local/vllm-ascend:0.23-a3-20260718-sglang CONTAINER_NAME=vllm-ascend-glm52-910c_tp${TP}_dp${DP} MODEL_PATH=/mnt/models/GLM-5.2-w4a8c8 SERVED_MODEL_NAME=glm-5.2 diff --git a/experiments/910c/glm52_910c_vllm_tp_dp_matrix/config.env b/experiments/910c/glm52_910c_vllm_tp_dp_matrix/config.env index 87005c0..251a38b 100644 --- a/experiments/910c/glm52_910c_vllm_tp_dp_matrix/config.env +++ b/experiments/910c/glm52_910c_vllm_tp_dp_matrix/config.env @@ -33,7 +33,7 @@ DOCKER_IMAGE="${DOCKER_IMAGE:-local/vllm-ascend:0.23-a3-20260718-sglang}" # (local/vllm-ascend:0.23-a3-*-sglang, see envs/ASCEND_910C_ENV_SETUP.md ยง8.1) # carry sglang 0.5.2 bench_serving, so the client runs as a standalone container # (TORCH_DEVICE_BACKEND_AUTOLOAD=0 injected by the runner, no NPU needed). -DOCKER_CLIENT_IMAGE="${DOCKER_CLIENT_IMAGE:-local/vllm-ascend:0.23-a3-dsv4-sglang}" +DOCKER_CLIENT_IMAGE="${DOCKER_CLIENT_IMAGE:-local/vllm-ascend:0.23-a3-20260718-sglang}" USE_DOCKER_CLIENT="${USE_DOCKER_CLIENT:-1}" # Device selection. ASCEND_VISIBLE_DEVICES selects NPU cards 0..7; the Ascend