47 lines
1.1 KiB
JSON

{
"backend": "vllm-omni",
"task": "ref2va",
"gpus_per_instance": 8,
"dit_tensor_parallel_size": 2,
"ulysses_degree": 4,
"replicas": 1,
"expected_requests": 32,
"requests_recorded": 32,
"completed": 32,
"failed": 0,
"machine_wall_s": 4734.41522359848,
"machine_qps": 0.006759018482472225,
"latency_mean_s": 147.9499400610075,
"latency_p50_s": 119.12891493900679,
"latency_p95_s": 295.50401763169793,
"by_short_edge": {
"480": {
"requests": 8,
"completed": 8,
"failed": 0,
"latency_mean_s": 58.23869467526674,
"latency_p95_s": 58.36102275213925
},
"720": {
"requests": 8,
"completed": 8,
"failed": 0,
"latency_mean_s": 113.5257983354968,
"latency_p95_s": 113.72436507834354
},
"768": {
"requests": 8,
"completed": 8,
"failed": 0,
"latency_mean_s": 124.60925887679332,
"latency_p95_s": 124.76920832397882
},
"1080": {
"requests": 8,
"completed": 8,
"failed": 0,
"latency_mean_s": 295.4260083564732,
"latency_p95_s": 296.4830407598987
}
}
}