diff --git a/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/run_pr_representative_point.sh b/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/run_pr_representative_point.sh index a723fc3..9b50299 100755 --- a/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/run_pr_representative_point.sh +++ b/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/run_pr_representative_point.sh @@ -160,6 +160,7 @@ prewarm_one_node() { sudo_host "$host" mkdir -p "${FLASHINFER_CACHE}" sudo_host "$host" docker run --rm --gpus device=0 \ -v "${FLASHINFER_CACHE}:/root/.cache/flashinfer" \ + -e FLASHINFER_WORKSPACE_BASE=/root \ -e FLASHINFER_DISABLE_VERSION_CHECK=1 \ --entrypoint python3 "${PR_IMAGE}" -m pytest -q -s \ /opt/pr-tests/test_mxfp4_sm120_cutlass.py \ @@ -238,6 +239,7 @@ start_node() { -e NCCL_IB_GID_INDEX=3 -e NCCL_IB_TIMEOUT=22 -e NCCL_IB_RETRY_CNT=7 -e NCCL_CUMEM_ENABLE=1 -e PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True -e SGLANG_ENABLE_TP_MEMORY_INBALANCE_CHECK=0 -e SGLANG_MOE_FUSED_GATE_RADIX=1 + -e FLASHINFER_WORKSPACE_BASE=/root -e FLASHINFER_DISABLE_VERSION_CHECK=1 "${PR_IMAGE}" -lc "$bootstrap" )