chore: do not commit partial SGLang vs vLLM results while run is in progress

This commit is contained in:
yy-fighting 2026-07-08 08:36:13 +00:00
parent 19d336de08
commit fd0474099a
2 changed files with 0 additions and 58 deletions

View File

@ -1,29 +0,0 @@
{
"metadata": {
"experiment": "dsv4_h200_sglang_vs_vllm_sglang",
"run_id": "20260708-083346",
"timestamp": "2026-07-08T08:33:51+00:00",
"model": "/data/models/DeepSeek-V4-Flash",
"backend": "sglang",
"engine": "sglang",
"hardware": "8x NVIDIA H200 143GB",
"accelerator": "NVIDIA H200",
"chip": "nvidia_h200",
"script": "experiments/dsv4_h200_sglang_vs_vllm/run_bench.sh",
"env": "/data/user1/yy/envs/sglang",
"git_commit": "e9ed45c",
"git_dirty": "dirty",
"description": "H200 sglang TP=8 comparison benchmark for DeepSeek-V4-Flash"
},
"config": {
"tp": 8,
"cuda_visible_devices": "0,1,2,3,4,5,6,7",
"phase1_max_model_len": 32768,
"phase2_max_model_len": 210000,
"backend": "sglang",
"server_start_script": "experiments/dsv4_h200_sglang_vs_vllm/start_sglang.sh",
"phase1_server_args": "sglang serve --trust-remote-code --model-path /data/models/DeepSeek-V4-Flash --tp 8 --moe-runner-backend marlin --context-length 32768 --max-running-requests 256 --mem-fraction-static 0.88 --host 0.0.0.0 --port 30006",
"phase2_server_args": "sglang serve --trust-remote-code --model-path /data/models/DeepSeek-V4-Flash --tp 8 --moe-runner-backend marlin --context-length 210000 --max-running-requests 2 --mem-fraction-static 0.88 --host 0.0.0.0 --port 30006"
},
"scenarios": []
}

View File

@ -1,29 +0,0 @@
{
"metadata": {
"experiment": "dsv4_h200_sglang_vs_vllm_vllm",
"run_id": "20260708-083346",
"timestamp": "2026-07-08T08:33:51+00:00",
"model": "/data/models/DeepSeek-V4-Flash",
"backend": "vllm",
"engine": "vllm",
"hardware": "8x NVIDIA H200 143GB",
"accelerator": "NVIDIA H200",
"chip": "nvidia_h200",
"script": "experiments/dsv4_h200_sglang_vs_vllm/run_bench.sh",
"env": "/data/user1/yy/envs/vllm",
"git_commit": "e9ed45c",
"git_dirty": "dirty",
"description": "H200 vllm TP=8 comparison benchmark for DeepSeek-V4-Flash"
},
"config": {
"tp": 8,
"cuda_visible_devices": "0,1,2,3,4,5,6,7",
"phase1_max_model_len": 32768,
"phase2_max_model_len": 210000,
"backend": "vllm",
"server_start_script": "experiments/dsv4_h200_sglang_vs_vllm/start_vllm.sh",
"phase1_server_args": "vllm serve /data/models/DeepSeek-V4-Flash --trust-remote-code --tensor-parallel-size 8 --kv-cache-dtype fp8 --max-model-len 32768 --max-num-seqs 256 --block-size 256 --gpu-memory-utilization 0.90 --tokenizer-mode deepseek_v4 --reasoning-parser deepseek_v4 --no-disable-hybrid-kv-cache-manager --disable-uvicorn-access-log --port 30005",
"phase2_server_args": "vllm serve /data/models/DeepSeek-V4-Flash --trust-remote-code --tensor-parallel-size 8 --kv-cache-dtype fp8 --max-model-len 210000 --max-num-seqs 2 --block-size 256 --gpu-memory-utilization 0.90 --tokenizer-mode deepseek_v4 --reasoning-parser deepseek_v4 --no-disable-hybrid-kv-cache-manager --disable-uvicorn-access-log --port 30005"
},
"scenarios": []
}