Parallel Torch profile only; F3 runs on GPUs 0,1 and RVA on GPUs 2,3.
Absolute latency may include host/PCIe contention. Nsight phases remain serial.
