47 lines
1.1 KiB
JSON

{
"backend": "vllm-omni",
"task": "ref2va",
"gpus_per_instance": 4,
"dit_tensor_parallel_size": 2,
"ulysses_degree": 2,
"replicas": 2,
"expected_requests": 32,
"requests_recorded": 32,
"completed": 32,
"failed": 0,
"machine_wall_s": 4499.805894613266,
"machine_qps": 0.0071114178587808234,
"latency_mean_s": 281.0816363893391,
"latency_p50_s": 222.61875976994634,
"latency_p95_s": 573.1763278442552,
"by_short_edge": {
"480": {
"requests": 8,
"completed": 8,
"failed": 0,
"latency_mean_s": 106.20279711237526,
"latency_p95_s": 106.431321673817
},
"720": {
"requests": 8,
"completed": 8,
"failed": 0,
"latency_mean_s": 212.077966982848,
"latency_p95_s": 212.1960737178917
},
"768": {
"requests": 8,
"completed": 8,
"failed": 0,
"latency_mean_s": 233.23018924598,
"latency_p95_s": 233.52808195799588
},
"1080": {
"requests": 8,
"completed": 8,
"failed": 0,
"latency_mean_s": 572.8155922161532,
"latency_p95_s": 574.0361641392926
}
}
}