65 Commits

Author SHA1 Message Date
Zhiyi Hong
d7381abe84 [Test] Add Kimi-K3 Prefill PP baseline search 2026-08-21 14:20:59 +08:00
Zhiyi Hong
60f77cd4ef [Profile] Attribute Kimi-K3 Prefill communication 2026-08-20 16:03:58 +08:00
Zhiyi Hong
6fac5ad567 [Docs] Attribute Kimi-K3 Prefill collectives 2026-08-20 13:54:18 +08:00
Zhiyi Hong
2a3b12fa78 [Docs] Reject Kimi-K3 Prefill TP Reduce Scatter path 2026-08-20 10:25:37 +08:00
Zhiyi Hong
08a35066d7 [Test] Complete Kimi-K3 Prefill MoE backend report 2026-08-19 16:54:45 +08:00
Zhiyi Hong
74ec19dd48 [Docs] Close Kimi SM120 delivery audit 2026-08-19 14:25:03 +08:00
Zhiyi Hong
0fdcab9927 [Docs] Rebase Kimi SM120 Draft onto synced main 2026-08-19 14:02:35 +08:00
Zhiyi Hong
a5248ed80e [Docs] Record exact Draft patch verification 2026-08-19 13:31:56 +08:00
Zhiyi Hong
fc336a3c7b [Test] Finalize Kimi SM120 PR representative benchmark 2026-08-19 13:11:21 +08:00
Zhiyi Hong
63f2327a90 [Fix] Validate per-request benchmark errors correctly 2026-08-19 11:54:34 +08:00
Zhiyi Hong
a90c898683 [Fix] Use official kernel version-check override for validation 2026-08-19 11:29:55 +08:00
Zhiyi Hong
ab9a5422f6 [Fix] Persist FlashInfer JIT cache across services 2026-08-19 11:16:07 +08:00
Zhiyi Hong
7f67dfe6b3 [Fix] Keep ABI-matched SGLang kernel in PR image 2026-08-19 11:00:50 +08:00
Zhiyi Hong
e8ff3ce1e8 [Test] Add exact Kimi SM120 PR validation point 2026-08-19 10:47:26 +08:00
Zhiyi Hong
d28db48e4b [Docs] Scope SGLang draft to compatibility 2026-08-19 00:12:38 +08:00
Zhiyi Hong
39f692caae [Docs] Keep draft checklist evidence-based 2026-08-19 00:10:20 +08:00
Zhiyi Hong
a9206ff105 [Docs] Add Kimi SM120 completion audit 2026-08-18 23:58:37 +08:00
Zhiyi Hong
a11c80b703 [Docs] Finalize Kimi SM120 SGLang draft PR 2026-08-18 23:47:34 +08:00
Zhiyi Hong
e01df16667 [Docs] Prepare Kimi SM120 SGLang draft PR 2026-08-18 23:16:53 +08:00
Zhiyi Hong
ec7b604a50 [Docs] Record Kimi EP4 MoE backend acceptance 2026-08-18 18:38:59 +08:00
Zhiyi Hong
27b8be09cb [Fix] Keep Kimi benchmark tokenizer offline 2026-08-18 15:12:24 +08:00
Zhiyi Hong
be9d6bfe3a [Fix] Materialize FlashInfer MXFP8 input layout 2026-08-18 14:50:13 +08:00
Zhiyi Hong
d0863501ca [Fix] Support legacy Kimi MoE runner config 2026-08-18 14:33:42 +08:00
Zhiyi Hong
13944079fa [Test] Add EP4 maximum-pressure capacity probe 2026-08-18 13:57:31 +08:00
Zhiyi Hong
e3974e2352 [Fix] Patch Kimi image for SM120 FlashInfer MXFP4 2026-08-18 13:06:32 +08:00
Zhiyi Hong
b50de8fe99 [Fix] Keep Kimi image dependency baseline for Phase 5 2026-08-18 12:46:08 +08:00
Zhiyi Hong
c14f8aa43a [Fix] Preserve FlashInfer wheel filename in image build 2026-08-18 12:40:02 +08:00
Zhiyi Hong
daeffd147b [Fix] Use built-in random IDs for Kimi Prefill matrix 2026-08-18 12:37:18 +08:00
Zhiyi Hong
5454fb984e [Test] Add Kimi SM120 real-serving MoE backend matrix 2026-08-18 12:32:06 +08:00
Zhiyi Hong
c8f30ab7dc [Perf] Profile Kimi SM120 FlashInfer MXFP4 MoE 2026-08-18 11:04:06 +08:00
Zhiyi Hong
6493798ad5 [Feature] Complete Kimi SM120 FlashInfer MXFP4 integration 2026-08-17 14:58:52 +08:00
Zhiyi Hong
a1c18d736b [Test] Add Kimi SM120 MXFP4 correctness matrix 2026-08-17 12:08:06 +08:00
Zhiyi Hong
dac1bb652d [Test] Reproduce Kimi SM120 SiTU contract gap 2026-08-14 17:09:13 +08:00
Zhiyi Hong
0684d269df [Docs] Audit Kimi-K3 SM120 FlashInfer MXFP4 gap 2026-08-14 15:52:14 +08:00
shishi
987f1db4b0 feat(pro6000): Kimi-K3 DP=2 部署(方案 B:两个独立 TP32×EP32 实例 + router 负载均衡)
- 实例 A profile 加 --disable-radix-cache(bench 测量纯净)
- 新增实例 B profile(kimi3_pro6000_sglang_tp32ep32_instB,.1-.4)
- 新增 deploy_dp2.sh 编排脚本(A + B + router --worker-urls)
- 新增 README
2026-08-11 17:56:14 +08:00
shishi
c69831f258 feat(pd): PD 长上下文 adaptive concurrency bench(SLO 方案 A,并发 +16)
- matrix.json: 3 个 shape(64k/128, 16k/1k, 1k/4k)
- run_adaptive_concurrency_pd.sh: PD 专用 adaptive 脚本
  - 复用 adaptive_bench_lib.sh(并发搜索/SLO 停止/OOM 检测/完整产物)
  - server 生命周期函数 no-op(PD 服务常驻,不启停)
  - 加 --flush-cache(配合 --disable-radix-cache 测纯净 TTFT/TPOT)
  - 离线环境变量 + 本地 tokenizer(避免 HF 在线下载)
- adaptive_config.env: SEARCH_ADDEND=16 +16 递增,上限 64,回退 8/1
- config.env: 新增 get_ttft_slo_ms 分层 SLO(1k->4s, 16k->15s, 64k->30s)
2026-08-11 14:45:36 +08:00
shishi
fe375e1307 docs(pd): 补充运维一键部署完整步骤(干净环境从零到跑通)
- experiments README 新增「运维一键部署」章节:6 步完整流程
  (免密/文件分发/仓库 clone/拉镜像/启动/验证)+ 停止重启 + 文件来源
- docs/KIMI_K3_DEPLOY.md 附录 B 新增 B.2 运维准备,编号顺延 B.3-B.6
- 修复 scp 分发命令(先建父目录)
2026-08-11 11:55:39 +08:00
shishi
da0e1b4372 fix(pd): config.env 加 DOCKER_CLIENT_IMAGE(bench 用 docker client 复用 kimi-k3 镜像) 2026-08-11 11:19:42 +08:00
shishi
04dfa31583 fix(pd): PATCH_MOUNTS 补充 flashkda wheel 挂载(BOOTSTRAP 需要 /flash_kda-*.whl) 2026-08-11 10:50:43 +08:00
shishi
d72dbff689 feat(pro6000): Kimi-K3 PD 分离部署(MoonCake RDMA)- 8 节点 P/D 双 profile + deploy_pd.sh 编排 + 文档
- 新增 P 组(prefill)/D 组(decode) deploy profiles(mooncake RDMA + 计算网 mlx5_0~3)
- 新增 experiments/pro6000/kimi3_pro6000_pd_rdma/ 编排脚本(mc-master+P+D+router)
- 关键修复: 必须关闭 PYTORCH_CUDA_ALLOC_CONF=expandable_segments
  (mooncake RDMA 注册 expandable GPU 段报 Bad address,GitHub #2511)
- 容器内升级 mooncake 0.3.12.post1(含 dmabuf 修复 #2035)
- docs/KIMI_K3_DEPLOY.md 新增附录 B,README 更新实验索引
2026-08-11 10:36:09 +08:00
shishi
3bd04698bb feat(pro6000): Kimi-K3 TP32×EP32 部署 profile、sm_120 补丁与运维手册 - 4 节点 RoCE 部署 + bench 实验 2026-08-10 11:04:24 +08:00
Zhiyi Hong
9acf9fdfdb feat(pro6000): 部署/测试解耦 - deploy 层支持多节点与 vLLM,新增 6 个 profile
- sskj.deploy runtime 支持 NODE_HOSTS 多节点编排(ssh 分发/本地 rank/LOCAL_NODE_RANK)
  与 ENGINE=vllm 启动(SERVER_CMD),容器名按 rank 自动唯一
- scripts/common/deploy_cli.sh 新增 deploy_stop/status/multinode helper 与 node-rank 透传
- src/sskj/common/env.py 修复嵌套 ${VAR:-${OTHER}/path} 展开(平衡花括号扫描)
- deploy/profiles/pro6000/ 新增 6 个 profile: tp16/tp16_eagle/glm52(多节点)、
  sglang/vllm tp_dp_matrix、qwen3(单节点)
- 6 个实验 start/stop 脚本改为 deploy 薄包装,run_bench/adaptive 的 server 启停走
  deploy_render_args/deploy_start/deploy_stop,tp16 新增 matrix.json
- 首次入库 glm52_pro6000_sglang_multinode_tp16 实验目录;ops/README.md 补 pro6000 章节
- 实测通过: 单节点 dsv4 sglang/vllm 链路 + tp16 双节点启动/bench/清理
2026-08-03 15:17:41 +08:00
Zhiyi Hong
e53b2c7e4c fix: JSONL parsing in run_batch, add results/ to gitignore 2026-07-29 17:51:47 +08:00
Zhiyi Hong
c839230c0b feat: add EAGLE speculative decoding experiment (dsv4_pro6000_sglang_tp16_eagle) 2026-07-29 17:51:40 +08:00
Zhiyi Hong
6d3338244b fix: cuda-graph-max-bs=64 (256 OOMs during capture) 2026-07-28 17:31:52 +08:00
Zhiyi Hong
cd362c5ca0 fix: max_running_requests=256, cuda_graph_max_bs=256 to match max concurrency 128 2026-07-28 17:20:25 +08:00
Zhiyi Hong
da1d4d3d78 add tp = 16 deepseek v4 pro sglang bench 2026-07-28 17:09:26 +08:00
yy-fighting
3b0297516e fix: replace 5 buggy parse_results.py (raw_requests bloat) with shared parse_backend.py wrapper 2026-07-22 03:47:22 +00:00
Quantong Qiu
aee25d4088 feat(pro6000): add qwen3_235b_pro6000_sglang_tp8 experiment (code + README + report.md) 2026-07-21 23:54:19 +08:00
Quantong Qiu
8c737b840b [Feat] use nightly SGLang FlashInfer MoE 2026-07-21 15:22:47 +08:00