- deploy/profiles/910c/ 新增 dsv4/glm52 两个 vLLM-Ascend profile (JSON 参数经 BOOTSTRAP base64 注入避开镜像 entrypoint 转义;per-TP 参数 由 start 脚本导出后经 profile 模板展开) - dsv4/glm52 start_vllm_docker.sh 改为 deploy 薄包装(保留 sg docker 重入与 per-TP 覆盖),新增 stop_vllm_docker.sh - run_bench.sh / run_adaptive_concurrency*.sh 的 stop/build_server_args 改走 deploy_stop/deploy_render_args - runtime.py 修复单节点 dry-run 未跳过健康检查的 bug - ops/README.md 补 910c 章节;.gitignore 补 910c ops_ 输出规则 - 附带入库 910c adaptive 汇总结果
32 lines
3.3 KiB
Bash
32 lines
3.3 KiB
Bash
# DeepSeek-V4-Flash w8a8-mtp vLLM-Ascend TPxDP profile on a single 910C node
|
|
# (8x Ascend910 = 16 dies, 64GB HBM/die).
|
|
# Launch via BOOTSTRAP (base64) so the JSON-bearing args survive the image
|
|
# entrypoint; the container runs vllm serve in the foreground.
|
|
# Model-team only. Ops only run `python -m sskj.bench` against the served URL.
|
|
|
|
PLATFORM=910c
|
|
EXPERIMENT=dsv4_910c_vllm_tp_dp_matrix
|
|
MODEL_NAME=DeepSeek-V4-Flash
|
|
ENGINE=vllm
|
|
RUNTIME=docker
|
|
DOCKER_IMAGE=local/vllm-ascend:0.23-a3-dsv4-sglang
|
|
CONTAINER_NAME=vllm-ascend-dsv4-910c_tp${TP}_dp${DP}
|
|
MODEL_PATH=/mnt/models/DeepSeek-V4-Flash-w8a8-mtp
|
|
SERVED_MODEL_NAME=dsv4
|
|
PORT=30052
|
|
HEALTH_PATH=/health
|
|
HEALTH_WAIT_S=2400
|
|
CONTAINER_PYTHON=/usr/local/python3.12.13/bin/python3
|
|
|
|
DEVICE_VARS="ASCEND_VISIBLE_DEVICES=0,1,2,3,4,5,6,7"
|
|
ENGINE_ENV="PYTORCH_NPU_ALLOC_CONF=expandable_segments:True PYTHONUNBUFFERED=1 HF_HUB_OFFLINE=1 TRANSFORMERS_OFFLINE=1 OMP_PROC_BIND=false OMP_NUM_THREADS=10 HCCL_BUFFSIZE=1024 VLLM_ASCEND_ENABLE_FLASHCOMM1=1 TASK_QUEUE_ENABLE=1 HCCL_OP_EXPANSION_MODE=AIV LD_PRELOAD=/usr/lib64/libjemalloc.so.2"
|
|
|
|
DOCKER_FLAGS="--privileged --ipc host --shm-size 512g --network host --ulimit memlock=-1 --device /dev/davinci0 --device /dev/davinci1 --device /dev/davinci2 --device /dev/davinci3 --device /dev/davinci4 --device /dev/davinci5 --device /dev/davinci6 --device /dev/davinci7 --device /dev/davinci8 --device /dev/davinci9 --device /dev/davinci10 --device /dev/davinci11 --device /dev/davinci12 --device /dev/davinci13 --device /dev/davinci14 --device /dev/davinci15 --device /dev/davinci_manager --device /dev/devmm_svm --device /dev/hisi_hdc"
|
|
|
|
VOLUMES="/usr/local/dcmi:/usr/local/dcmi /usr/local/Ascend/driver/tools/hccn_tool:/usr/local/Ascend/driver/tools/hccn_tool /usr/local/bin/npu-smi:/usr/local/bin/npu-smi /usr/local/Ascend/driver/lib64:/usr/local/Ascend/driver/lib64 /usr/local/Ascend/driver/version.info:/usr/local/Ascend/driver/version.info /etc/ascend_install.info:/etc/ascend_install.info /etc/hccn.conf:/etc/hccn.conf ${MODEL_PATH}:${MODEL_PATH}:ro /mnt:/mnt"
|
|
|
|
LAUNCH_ARGS="${MODEL_PATH} --served-model-name ${SERVED_MODEL_NAME} --block-size 128 --tensor-parallel-size ${TP} --gpu-memory-utilization ${GPU_MEMORY_UTILIZATION:-0.9} --max-model-len ${MAX_MODEL_LEN:-1048576} --max-num-seqs ${MAX_NUM_SEQS:-64} --max-num-batched-tokens ${MAX_NUM_BATCHED_TOKENS:-10240} --api-server-count 1 --host 0.0.0.0 --port ${PORT} --tokenizer-mode deepseek_v4 --tool-call-parser deepseek_v4 --enable-auto-tool-choice --reasoning-parser deepseek_v4 --quantization ascend --safetensors-load-strategy prefetch --enable-expert-parallel --async-scheduling --model-loader-extra-config '{\"enable_multithread_load\": \"true\", \"num_threads\": 128}' --compilation-config '{\"cudagraph_mode\": \"FULL_DECODE_ONLY\"}' --additional-config '{\"ascend_compilation_config\":{\"enable_npugraph_ex\":true,\"enable_static_kernel\":false},\"enable_cpu_binding\": true,\"multistream_overlap_shared_expert\":true}'"
|
|
DP_FLAG="--data-parallel-size ${DP}"
|
|
|
|
BOOTSTRAP="for sh in /usr/local/Ascend/ascend-toolkit/set_env.sh /usr/local/Ascend/cann-9.0.1/share/info/ascendnpu-ir/bin/set_env.sh /usr/local/Ascend/cann-9.0.0/share/info/ascendnpu-ir/bin/set_env.sh /usr/local/Ascend/nnal/atb/set_env.sh; do [ -f \$sh ] && source \$sh && break; done; exec vllm serve ${LAUNCH_ARGS}"
|