chore: do not commit partial SGLang vs vLLM results while run is in progress
This commit is contained in:
parent
19d336de08
commit
fd0474099a
@ -1,29 +0,0 @@
|
|||||||
{
|
|
||||||
"metadata": {
|
|
||||||
"experiment": "dsv4_h200_sglang_vs_vllm_sglang",
|
|
||||||
"run_id": "20260708-083346",
|
|
||||||
"timestamp": "2026-07-08T08:33:51+00:00",
|
|
||||||
"model": "/data/models/DeepSeek-V4-Flash",
|
|
||||||
"backend": "sglang",
|
|
||||||
"engine": "sglang",
|
|
||||||
"hardware": "8x NVIDIA H200 143GB",
|
|
||||||
"accelerator": "NVIDIA H200",
|
|
||||||
"chip": "nvidia_h200",
|
|
||||||
"script": "experiments/dsv4_h200_sglang_vs_vllm/run_bench.sh",
|
|
||||||
"env": "/data/user1/yy/envs/sglang",
|
|
||||||
"git_commit": "e9ed45c",
|
|
||||||
"git_dirty": "dirty",
|
|
||||||
"description": "H200 sglang TP=8 comparison benchmark for DeepSeek-V4-Flash"
|
|
||||||
},
|
|
||||||
"config": {
|
|
||||||
"tp": 8,
|
|
||||||
"cuda_visible_devices": "0,1,2,3,4,5,6,7",
|
|
||||||
"phase1_max_model_len": 32768,
|
|
||||||
"phase2_max_model_len": 210000,
|
|
||||||
"backend": "sglang",
|
|
||||||
"server_start_script": "experiments/dsv4_h200_sglang_vs_vllm/start_sglang.sh",
|
|
||||||
"phase1_server_args": "sglang serve --trust-remote-code --model-path /data/models/DeepSeek-V4-Flash --tp 8 --moe-runner-backend marlin --context-length 32768 --max-running-requests 256 --mem-fraction-static 0.88 --host 0.0.0.0 --port 30006",
|
|
||||||
"phase2_server_args": "sglang serve --trust-remote-code --model-path /data/models/DeepSeek-V4-Flash --tp 8 --moe-runner-backend marlin --context-length 210000 --max-running-requests 2 --mem-fraction-static 0.88 --host 0.0.0.0 --port 30006"
|
|
||||||
},
|
|
||||||
"scenarios": []
|
|
||||||
}
|
|
||||||
@ -1,29 +0,0 @@
|
|||||||
{
|
|
||||||
"metadata": {
|
|
||||||
"experiment": "dsv4_h200_sglang_vs_vllm_vllm",
|
|
||||||
"run_id": "20260708-083346",
|
|
||||||
"timestamp": "2026-07-08T08:33:51+00:00",
|
|
||||||
"model": "/data/models/DeepSeek-V4-Flash",
|
|
||||||
"backend": "vllm",
|
|
||||||
"engine": "vllm",
|
|
||||||
"hardware": "8x NVIDIA H200 143GB",
|
|
||||||
"accelerator": "NVIDIA H200",
|
|
||||||
"chip": "nvidia_h200",
|
|
||||||
"script": "experiments/dsv4_h200_sglang_vs_vllm/run_bench.sh",
|
|
||||||
"env": "/data/user1/yy/envs/vllm",
|
|
||||||
"git_commit": "e9ed45c",
|
|
||||||
"git_dirty": "dirty",
|
|
||||||
"description": "H200 vllm TP=8 comparison benchmark for DeepSeek-V4-Flash"
|
|
||||||
},
|
|
||||||
"config": {
|
|
||||||
"tp": 8,
|
|
||||||
"cuda_visible_devices": "0,1,2,3,4,5,6,7",
|
|
||||||
"phase1_max_model_len": 32768,
|
|
||||||
"phase2_max_model_len": 210000,
|
|
||||||
"backend": "vllm",
|
|
||||||
"server_start_script": "experiments/dsv4_h200_sglang_vs_vllm/start_vllm.sh",
|
|
||||||
"phase1_server_args": "vllm serve /data/models/DeepSeek-V4-Flash --trust-remote-code --tensor-parallel-size 8 --kv-cache-dtype fp8 --max-model-len 32768 --max-num-seqs 256 --block-size 256 --gpu-memory-utilization 0.90 --tokenizer-mode deepseek_v4 --reasoning-parser deepseek_v4 --no-disable-hybrid-kv-cache-manager --disable-uvicorn-access-log --port 30005",
|
|
||||||
"phase2_server_args": "vllm serve /data/models/DeepSeek-V4-Flash --trust-remote-code --tensor-parallel-size 8 --kv-cache-dtype fp8 --max-model-len 210000 --max-num-seqs 2 --block-size 256 --gpu-memory-utilization 0.90 --tokenizer-mode deepseek_v4 --reasoning-parser deepseek_v4 --no-disable-hybrid-kv-cache-manager --disable-uvicorn-access-log --port 30005"
|
|
||||||
},
|
|
||||||
"scenarios": []
|
|
||||||
}
|
|
||||||
Loading…
x
Reference in New Issue
Block a user