docker run -d --name kimi3_pro6000_pd_pp8_standard_prefill_node0 --gpus all --network host --ipc=host --ulimit memlock=-1 --device /dev/infiniband --shm-size 32g --entrypoint bash -v /data/hf_models/Kimi-K3:/data/hf_models/Kimi-K3:ro -e CUDA_VISIBLE_DEVICES=0\,1\,2\,3\,4\,5\,6\,7 -e SGLANG_HOST_IP=174.1.60.1 -e GLOO_SOCKET_IFNAME=bond0 -e NCCL_SOCKET_IFNAME=bond1 -e NCCL_IB_HCA=mlx5_0\,mlx5_1\,mlx5_2\,mlx5_3 -e NCCL_IB_GID_INDEX=3 -e NCCL_IB_TIMEOUT=22 -e NCCL_IB_RETRY_CNT=7 -e NCCL_CUMEM_ENABLE=1 -e MOONCAKE_MASTER=174.1.60.1:50051 -e MOONCAKE_PROTOCOL=rdma -e SGLANG_ENABLE_TP_MEMORY_INBALANCE_CHECK=0 -e SGLANG_MOE_FUSED_GATE_RADIX=1 -e FLASHINFER_DISABLE_JIT=1 -e FLASHINFER_DISABLE_VERSION_CHECK=1 local/sglang:kimi-k3-sm120-flashinfer-mxfp4-pd1 -lc exec\ python3\ -m\ sglang.launch_server\ --model-path\ /data/hf_models/Kimi-K3\ --served-model-name\ kimi-k3\ --tp-size\ 4\ --pp-size\ 8\ --ep-size\ 4\ --nnodes\ 4\ --node-rank\ 0\ --dist-init-addr\ 174.1.60.1:20000\ --trust-remote-code\ --moe-runner-backend\ flashinfer_mxfp4\ --chunked-prefill-size\ 8192\ --page-size\ 64\ --mem-fraction-static\ 0.88\ --cuda-graph-max-bs-decode\ 16\ --mamba-radix-cache-strategy\ extra_buffer_lazy\ --disable-radix-cache\ --dist-timeout\ 3600\ --mamba-full-memory-ratio\ 0.36\ --disaggregation-transfer-backend\ mooncake\ --disaggregation-bootstrap-port\ 28800\ --disaggregation-ib-device\ mlx5_0\\\,mlx5_1\\\,mlx5_2\\\,mlx5_3\ --disaggregation-mode\ prefill\ --host\ 0.0.0.0\ --port\ 30000\  
