dsv4实验发现DP副本绑定到同一组die的问题(99a22f0),glm52存在相同问题: 缺--max-num-batched-tokens和--api-server-count导致DP worker设备分配异常 (不加api-server-count时vllm为N个DP rank启动N个API server)。 对齐docs.vllm.ai GLM5.2 A3官方教程: - 加 --max-num-batched-tokens 8192 (官方值,影响DP调度) - 加 --api-server-count 1 (官方值,避免多API server干扰设备分配) - 去掉 --kv-cache-dtype fp8 (官方不指定,用默认bfloat16;且此镜像fp8本就未生效) - 保留 --trust-remote-code / --enable-expert-parallel / enable_dsa_cp (官方有)