67 lines
1.7 KiB
Bash
Executable File
67 lines
1.7 KiB
Bash
Executable File
#!/bin/bash
|
|
set -e
|
|
|
|
cd /data/user1/yy
|
|
mkdir -p logs
|
|
|
|
VENV="/data/user1/yy/envs/vllm-dspark"
|
|
VLLM="$VENV/bin/vllm"
|
|
export PATH="$VENV/bin:$PATH"
|
|
|
|
MODEL="/data/models/DeepSeek-V4-Flash-DSpark"
|
|
PORT=30004
|
|
TP=8
|
|
LOG="/data/user1/yy/logs/dsv4_flash_dspark_tp${TP}_flashinfer_$(date +%Y%m%d_%H%M%S).log"
|
|
PID_FILE="/data/user1/yy/dsv4_flash_dspark.pid"
|
|
|
|
export TMPDIR=/data/user1/yy/tmp
|
|
export CUDA_VISIBLE_DEVICES=0,1,2,3,4,5,6,7
|
|
|
|
echo "=== Starting DeepSeek-V4-Flash-DSpark (TP=$TP, FlashInfer) ==="
|
|
echo "Model: $MODEL"
|
|
echo "Port: $PORT"
|
|
echo "Log: $LOG"
|
|
|
|
rm -f "$PID_FILE"
|
|
nohup "$VLLM" serve "$MODEL" \
|
|
--trust-remote-code \
|
|
--tensor-parallel-size "$TP" \
|
|
--kv-cache-dtype fp8 \
|
|
--block-size 256 \
|
|
--max-model-len auto \
|
|
--max-num-seqs 256 \
|
|
--tokenizer-mode deepseek_v4 \
|
|
--reasoning-parser deepseek_v4 \
|
|
--attention-backend FLASHINFER_MLA_SPARSE_DSV4 \
|
|
--spec-method dspark \
|
|
--spec-model "$MODEL" \
|
|
--spec-tokens 5 \
|
|
--speculative-config '{"attention_backend": "FLASHINFER_MLA_SPARSE_DSV4"}' \
|
|
--no-disable-hybrid-kv-cache-manager \
|
|
--disable-uvicorn-access-log \
|
|
--port "$PORT" \
|
|
> "$LOG" 2>&1 &
|
|
PID=$!
|
|
echo $PID > "$PID_FILE"
|
|
echo "PID: $PID"
|
|
echo "Waiting for health..."
|
|
|
|
for i in $(seq 1 240); do
|
|
if curl -s "http://127.0.0.1:$PORT/health" > /dev/null 2>&1; then
|
|
echo "Server is ready at http://127.0.0.1:$PORT"
|
|
echo "Log: $LOG"
|
|
exit 0
|
|
fi
|
|
if ! kill -0 $PID 2>/dev/null; then
|
|
echo "ERROR: Server exited early"
|
|
tail -100 "$LOG"
|
|
exit 1
|
|
fi
|
|
echo "Waiting... ($i/240)"
|
|
sleep 5
|
|
done
|
|
|
|
echo "ERROR: Server not healthy after 240 retries"
|
|
tail -100 "$LOG"
|
|
exit 1
|