# DSV4 H200 vLLM Baseline Benchmark NVIDIA H200 + native `vllm` + `DeepSeek-V4-Flash` baseline benchmark experiment. This experiment uses: - `/data/user1/yy/envs/vllm` as the server environment - `/data/user1/yy/envs/sglang` as the benchmark client environment ## Quick Start ```bash # Run the full experiment (start server + benchmark + parse) bash experiments/dsv4_h200_vllm/run_bench.sh # Reuse an already-running server SKIP_MANAGE_SERVER=1 bash experiments/dsv4_h200_vllm/run_bench.sh ``` Results land in `experiments/dsv4_h200_vllm/results//`. ## Configuration Edit `config.env` or override via environment variables: ```bash MODEL_PATH=/data/models/DeepSeek-V4-Flash \ PORT=30005 \ SCENARIOS="32 512 256 128 512 256" \ bash experiments/dsv4_h200_vllm/run_bench.sh ``` ## Files | File | Purpose | |---|---| | `config.env` | Experiment-level configuration (model, port, venv paths, scenarios) | | `start_server.sh` | Start a plain vLLM baseline server for DeepSeek-V4-Flash | | `run_bench.sh` | Orchestrator: metadata → server → benchmark → parse | | `parse_results.py` | Parse raw JSONL outputs into `results.json` + `report.md` | ## Platform This experiment targets `platforms/nvidia_h200.env`.