EXPERIMENT_BASE=kimi3_pro6000_dp2_nospec_ab IMAGE=local/sglang:kimi-k3-pp-dflash-33863-fi0618-situ4460-kvbounds1 MODEL_PATH=/data/hf_models/Kimi-K3 DRAFT_MODEL_PATH=/data/hf_models/Kimi-K3-DFlash DFLASH_FIX_SOURCE=/data/hzy/sskj/experiments/pro6000/cdflash_fix DFLASH_FIX_DIR=/data/hzy/kimi3_dp2_dflash_fix DFLASH_FIX_MAP=( arg_groups/speculative_hook.py arg_groups/validation_hook.py speculative/dflash_worker_v2.py ) REPLICA_A_NODES=(174.1.60.1 174.1.60.2 174.1.60.3 174.1.60.4) REPLICA_B_NODES=(174.1.60.5 174.1.60.6 174.1.60.7 174.1.60.8) SSH_USER=user SSH_OPTIONS=(-o BatchMode=yes -o ConnectTimeout=10) SERVER_PORT=30000 DIST_PORT=20000 ROUTER_PORT=32000 EP_SIZE=4 CHUNK_SIZE=8192 PAGE_SIZE=64 KV_DTYPE=bfloat16 MAX_RUNNING_REQUESTS=8 CUDA_GRAPH_MAX_BS=8 DRAFT_TOKENS=16 IB_DEVICES=mlx5_0,mlx5_1,mlx5_2,mlx5_3 NCCL_DEBUG_LEVEL=${NCCL_DEBUG_LEVEL:-WARN} JIT_CACHE=/data/hzy/cache/kimi-dflash-fi0618-situ4460 HEALTH_WAIT_S=2400 SPEED_BENCH_DATASET=/data/speedbench16k_complete.jsonl NUM_PROMPTS=40 OUTPUT_LEN=512 CONCURRENCY=8