47 lines
1.1 KiB
JSON

{
"backend": "vllm-omni",
"task": "ref2va",
"gpus_per_instance": 2,
"dit_tensor_parallel_size": 2,
"ulysses_degree": 1,
"replicas": 4,
"expected_requests": 32,
"requests_recorded": 32,
"completed": 32,
"failed": 0,
"machine_wall_s": 4204.426504850388,
"machine_qps": 0.007611026132359211,
"latency_mean_s": 525.1911418869277,
"latency_p50_s": 413.46523636602797,
"latency_p95_s": 1084.747085970419,
"by_short_edge": {
"480": {
"requests": 8,
"completed": 8,
"failed": 0,
"latency_mean_s": 190.50694103751448,
"latency_p95_s": 190.64961519601056
},
"720": {
"requests": 8,
"completed": 8,
"failed": 0,
"latency_mean_s": 391.9126197292353,
"latency_p95_s": 392.6838105404866
},
"768": {
"requests": 8,
"completed": 8,
"failed": 0,
"latency_mean_s": 434.50199320795946,
"latency_p95_s": 434.6102629141999
},
"1080": {
"requests": 8,
"completed": 8,
"failed": 0,
"latency_mean_s": 1083.8430135730014,
"latency_p95_s": 1084.9118782492121
}
}
}