yy-fighting
|
e3476aff86
|
glm53 dsv4-migration bench: autotune+latest-image winner (+1.2~3.2% all 5 pts, A/B/A confirmed), PCIe-IPC pack negative (-0.4~-3.5%), page-mark kernel N/A for GLM (60.1, 09-09)
|
2026-09-10 03:13:02 +08:00 |
|
yy-fighting
|
ad1853f49b
|
hit90 scenario bench: TP4PP2-nomtp@0.90 winner, DP-attention/DCP verdicts (60.8 serving, 60.5 v3 delivered, 09-09)
- 冠军 A6 TP4PP2-nomtp@0.90(池 647,040):hit90 out cc1-4=28.8/47.5/63.9/76.2、cc8/16=106.4/125.7(vs TP2PP4 基线 cc4+14%/cc8+15%),并发独立 128k 文档 4 条、512k 单条 ✓、质量门 7/7;60.8 在役(实测实例切 unless-stopped)
- 判决:DP attention 容量负收益判死(非 MoE 权重按 attn 组复制致 dp4 池 96,448/rank + EAGLE×DP 两层崩溃);DCP 对 DSA 静默算错禁用(dsa_backend 零引用无 guard);MTP@128k accept 2.07 判负(vs EAGLE 3.46 存活但池 276k 过不了容量门槛)
- 交付:60.5 v3 脚本(只交未执行)+ 补丁束(60.8:/root,md5 6922e534)+ profile tp4pp2_hicache.env + CURRENT.md 更新
- 归档:70 文件全量日志(含 DP 臂失败记录、A3 容器日志)+ 7 脚本 + README(双口径协议:hit90 主扫 + distinct-doc 容量探针)
|
2026-09-09 17:11:04 +08:00 |
|
yy-fighting
|
92517e87f0
|
128k low-cc capacity topology: TP2PP4-nomtp winner (60.8 serving, 60.5 v2 delivered, 09-09)
诊断 60.5 排队根因:KV 池 276,864 token 纯容量算术(MLA KV 按 PP 分层切分,
池≈PP 度数倍增;TP8 调参无解,fp8 断言封顶 314,944 < c3 需求 394,752)。
四臂对拍(i128k/o512 冷缓存 cc1-4,PG19 真实语料同窗口映射):
- A-mirror(60.5 现状):c3 起容量排队,cc4 TTFT p50 119.6s,痛点复现
- r37(TP4PP2+MTP):池 384,960,c3 起排队
- B'(TP4PP2 nomtp):池 589,696,c4 零排队
- TP2PP4 nomtp 池 909,632 优胜:cc4 in 5907 / out 23.1 tok/s,
TTFT p50 全场最优(cc1 15.5s),e2e 88.8s
优胜者验证全过:质量门 7/7;512k 单条 TTFT 88.4s;900k 单条可完成
(单条上限 ~909k 实证);并发上限 c6(cc7 第 7 条起排队);hit90 cc4
输入吞吐 17,625 tok/s、TTFT 7.3s。
60.8 末态:TP2PP4 容器在役(restart=unless-stopped)。
60.5 交付:deploy_glm53_605_v2.sh(一键部署+前置检查,原脚本=回滚路径)。
资产:arm_runner.sh / val_runner.sh / all_summaries.json(26 点全量) /
profile glm53_nvfp4_pro6000_sglang_tp2pp4_hicache.env / CURRENT.md 两行更新。
|
2026-09-09 12:43:11 +08:00 |
|
yy-fighting
|
5c749cda03
|
feat(pro6000/GLM-5.3): 方案 D/E/F 部署资产入库(TP2PP4 生产配方 / TP8+DFlash2 / PD 分离四角色链)
- scripts: 11 个服务器原样脚本入库(md5 对照表更新至 README);D=60.1 生产原样配方、
E=v5 DFlash 底稿、F=PD 链四角色部署+launch+双场景压测驱动
- profiles: 新增 6 个 .env(D/E 单机 + F 四角色,均带镜像 digest
sha256:28e0d260…,对齐 kimi3 PD 多角色先例)
- deploy/PD_CHAIN.md: 方案 F 编排手册(启动顺序 mc-master→prefill→decode→router、
基础设施依赖表、质量门口径、拆链恢复、÷2 单机等效判决)
- platforms/patches/pro6000/glm53_pd_chain/: sglang 补丁树 vs 镜像原版 11 文件
unified diff 快照——宿主树无 .git,此为唯一版本记录(DFlash+PP+PD 解锁全集)
- deploy/manifests/: GLM-5.3-NVFP4(47分片)/GLM-5.3-DFlash2(单分片) 权重 md5 清单
- deploy/CURRENT.md: 全集群现役状态页(2026-09-08 八机实测)
- deploy/verify_profile.sh: 防漂移核验工具(digest+参数 token 比对+端口/health,
已在 60.1 生产容器实测 PASS)
|
2026-09-08 16:36:15 +08:00 |
|
yy-fighting
|
b3165a1d3c
|
feat(pro6000/GLM-5.3): 部署方案入库(TP8+EAGLE 生产标准 / 场景二高并发变体 / TP4PP2+IndexCache / E7b CAR 实验补丁 + deploy profiles)
- deploy_glm53_605.sh:配置 A 生产标准(60.5 在役,全 8 台 md5 fcd9109b 一致),
支持 MEMFRAC/STEPS/TOPK/DRAFT/CHUNK/EXTRA/RESTART 调参;场景二高并发变体
仅改 mrr32 + decode 图 bs{4,8,12,16}(KV 池 16.4 驻留上限)
- deploy_glm53_optimal(_s1).sh:配置 B TP4PP2+IndexCache(场景二最优 +41~79%;
s1 形态唯一差异 radix-on)
- deploy_glm53_607_exp.sh + car_patch/:E7b custom-AR 1stage 补丁(cc1 decode
每步 -14~-16%,实验性仅 cc1-2 验证;补丁文件与 60.7:/root/patches md5 一致)
- deploy/profiles/pro6000/:两个标准 profile(sskj.deploy 可消费),关键踩坑
与场景二变体、parser 缺口均在注释中标注
|
2026-09-08 11:38:06 +08:00 |
|
shishi
|
987f1db4b0
|
feat(pro6000): Kimi-K3 DP=2 部署(方案 B:两个独立 TP32×EP32 实例 + router 负载均衡)
- 实例 A profile 加 --disable-radix-cache(bench 测量纯净)
- 新增实例 B profile(kimi3_pro6000_sglang_tp32ep32_instB,.1-.4)
- 新增 deploy_dp2.sh 编排脚本(A + B + router --worker-urls)
- 新增 README
|
2026-08-11 17:56:14 +08:00 |
|
shishi
|
ddf807d458
|
feat(bench/pd): 支持 --flush-cache 透传 + PD profile 加 --disable-radix-cache
- sskj.bench: 新增 --flush-cache 参数,透传给 sglang.bench_serving
(warmup 后、main run 前 flush 服务器 KV/prefix cache,保证 TTFT/TPOT 测量纯净)
- P/D PD profiles: LAUNCH_ARGS 加 --disable-radix-cache(关闭 RadixAttention 前缀缓存)
|
2026-08-11 11:42:43 +08:00 |
|
shishi
|
04dfa31583
|
fix(pd): PATCH_MOUNTS 补充 flashkda wheel 挂载(BOOTSTRAP 需要 /flash_kda-*.whl)
|
2026-08-11 10:50:43 +08:00 |
|
shishi
|
d72dbff689
|
feat(pro6000): Kimi-K3 PD 分离部署(MoonCake RDMA)- 8 节点 P/D 双 profile + deploy_pd.sh 编排 + 文档
- 新增 P 组(prefill)/D 组(decode) deploy profiles(mooncake RDMA + 计算网 mlx5_0~3)
- 新增 experiments/pro6000/kimi3_pro6000_pd_rdma/ 编排脚本(mc-master+P+D+router)
- 关键修复: 必须关闭 PYTORCH_CUDA_ALLOC_CONF=expandable_segments
(mooncake RDMA 注册 expandable GPU 段报 Bad address,GitHub #2511)
- 容器内升级 mooncake 0.3.12.post1(含 dmabuf 修复 #2035)
- docs/KIMI_K3_DEPLOY.md 新增附录 B,README 更新实验索引
|
2026-08-11 10:36:09 +08:00 |
|
shishi
|
3bd04698bb
|
feat(pro6000): Kimi-K3 TP32×EP32 部署 profile、sm_120 补丁与运维手册 - 4 节点 RoCE 部署 + bench 实验
|
2026-08-10 11:04:24 +08:00 |
|
Zhiyi Hong
|
9acf9fdfdb
|
feat(pro6000): 部署/测试解耦 - deploy 层支持多节点与 vLLM,新增 6 个 profile
- sskj.deploy runtime 支持 NODE_HOSTS 多节点编排(ssh 分发/本地 rank/LOCAL_NODE_RANK)
与 ENGINE=vllm 启动(SERVER_CMD),容器名按 rank 自动唯一
- scripts/common/deploy_cli.sh 新增 deploy_stop/status/multinode helper 与 node-rank 透传
- src/sskj/common/env.py 修复嵌套 ${VAR:-${OTHER}/path} 展开(平衡花括号扫描)
- deploy/profiles/pro6000/ 新增 6 个 profile: tp16/tp16_eagle/glm52(多节点)、
sglang/vllm tp_dp_matrix、qwen3(单节点)
- 6 个实验 start/stop 脚本改为 deploy 薄包装,run_bench/adaptive 的 server 启停走
deploy_render_args/deploy_start/deploy_stop,tp16 新增 matrix.json
- 首次入库 glm52_pro6000_sglang_multinode_tp16 实验目录;ops/README.md 补 pro6000 章节
- 实测通过: 单节点 dsv4 sglang/vllm 链路 + tp16 双节点启动/bench/清理
|
2026-08-03 15:17:41 +08:00 |
|