diff --git a/experiments/dsv4_h200_sglang_vs_vllm/results/20260708-083346/sglang/results.json b/experiments/dsv4_h200_sglang_vs_vllm/results/20260708-083346/sglang/results.json deleted file mode 100644 index 92be18f..0000000 --- a/experiments/dsv4_h200_sglang_vs_vllm/results/20260708-083346/sglang/results.json +++ /dev/null @@ -1,29 +0,0 @@ -{ - "metadata": { - "experiment": "dsv4_h200_sglang_vs_vllm_sglang", - "run_id": "20260708-083346", - "timestamp": "2026-07-08T08:33:51+00:00", - "model": "/data/models/DeepSeek-V4-Flash", - "backend": "sglang", - "engine": "sglang", - "hardware": "8x NVIDIA H200 143GB", - "accelerator": "NVIDIA H200", - "chip": "nvidia_h200", - "script": "experiments/dsv4_h200_sglang_vs_vllm/run_bench.sh", - "env": "/data/user1/yy/envs/sglang", - "git_commit": "e9ed45c", - "git_dirty": "dirty", - "description": "H200 sglang TP=8 comparison benchmark for DeepSeek-V4-Flash" - }, - "config": { - "tp": 8, - "cuda_visible_devices": "0,1,2,3,4,5,6,7", - "phase1_max_model_len": 32768, - "phase2_max_model_len": 210000, - "backend": "sglang", - "server_start_script": "experiments/dsv4_h200_sglang_vs_vllm/start_sglang.sh", - "phase1_server_args": "sglang serve --trust-remote-code --model-path /data/models/DeepSeek-V4-Flash --tp 8 --moe-runner-backend marlin --context-length 32768 --max-running-requests 256 --mem-fraction-static 0.88 --host 0.0.0.0 --port 30006", - "phase2_server_args": "sglang serve --trust-remote-code --model-path /data/models/DeepSeek-V4-Flash --tp 8 --moe-runner-backend marlin --context-length 210000 --max-running-requests 2 --mem-fraction-static 0.88 --host 0.0.0.0 --port 30006" - }, - "scenarios": [] -} \ No newline at end of file diff --git a/experiments/dsv4_h200_sglang_vs_vllm/results/20260708-083346/vllm/results.json b/experiments/dsv4_h200_sglang_vs_vllm/results/20260708-083346/vllm/results.json deleted file mode 100644 index d1bc61d..0000000 --- a/experiments/dsv4_h200_sglang_vs_vllm/results/20260708-083346/vllm/results.json +++ /dev/null @@ -1,29 +0,0 @@ -{ - "metadata": { - "experiment": "dsv4_h200_sglang_vs_vllm_vllm", - "run_id": "20260708-083346", - "timestamp": "2026-07-08T08:33:51+00:00", - "model": "/data/models/DeepSeek-V4-Flash", - "backend": "vllm", - "engine": "vllm", - "hardware": "8x NVIDIA H200 143GB", - "accelerator": "NVIDIA H200", - "chip": "nvidia_h200", - "script": "experiments/dsv4_h200_sglang_vs_vllm/run_bench.sh", - "env": "/data/user1/yy/envs/vllm", - "git_commit": "e9ed45c", - "git_dirty": "dirty", - "description": "H200 vllm TP=8 comparison benchmark for DeepSeek-V4-Flash" - }, - "config": { - "tp": 8, - "cuda_visible_devices": "0,1,2,3,4,5,6,7", - "phase1_max_model_len": 32768, - "phase2_max_model_len": 210000, - "backend": "vllm", - "server_start_script": "experiments/dsv4_h200_sglang_vs_vllm/start_vllm.sh", - "phase1_server_args": "vllm serve /data/models/DeepSeek-V4-Flash --trust-remote-code --tensor-parallel-size 8 --kv-cache-dtype fp8 --max-model-len 32768 --max-num-seqs 256 --block-size 256 --gpu-memory-utilization 0.90 --tokenizer-mode deepseek_v4 --reasoning-parser deepseek_v4 --no-disable-hybrid-kv-cache-manager --disable-uvicorn-access-log --port 30005", - "phase2_server_args": "vllm serve /data/models/DeepSeek-V4-Flash --trust-remote-code --tensor-parallel-size 8 --kv-cache-dtype fp8 --max-model-len 210000 --max-num-seqs 2 --block-size 256 --gpu-memory-utilization 0.90 --tokenizer-mode deepseek_v4 --reasoning-parser deepseek_v4 --no-disable-hybrid-kv-cache-manager --disable-uvicorn-access-log --port 30005" - }, - "scenarios": [] -} \ No newline at end of file