Zhiyi Hong
|
9acf9fdfdb
|
feat(pro6000): 部署/测试解耦 - deploy 层支持多节点与 vLLM,新增 6 个 profile
- sskj.deploy runtime 支持 NODE_HOSTS 多节点编排(ssh 分发/本地 rank/LOCAL_NODE_RANK)
与 ENGINE=vllm 启动(SERVER_CMD),容器名按 rank 自动唯一
- scripts/common/deploy_cli.sh 新增 deploy_stop/status/multinode helper 与 node-rank 透传
- src/sskj/common/env.py 修复嵌套 ${VAR:-${OTHER}/path} 展开(平衡花括号扫描)
- deploy/profiles/pro6000/ 新增 6 个 profile: tp16/tp16_eagle/glm52(多节点)、
sglang/vllm tp_dp_matrix、qwen3(单节点)
- 6 个实验 start/stop 脚本改为 deploy 薄包装,run_bench/adaptive 的 server 启停走
deploy_render_args/deploy_start/deploy_stop,tp16 新增 matrix.json
- 首次入库 glm52_pro6000_sglang_multinode_tp16 实验目录;ops/README.md 补 pro6000 章节
- 实测通过: 单节点 dsv4 sglang/vllm 链路 + tp16 双节点启动/bench/清理
|
2026-08-03 15:17:41 +08:00 |
|
Zhiyi Hong
|
e53b2c7e4c
|
fix: JSONL parsing in run_batch, add results/ to gitignore
|
2026-07-29 17:51:47 +08:00 |
|
Zhiyi Hong
|
6d3338244b
|
fix: cuda-graph-max-bs=64 (256 OOMs during capture)
|
2026-07-28 17:31:52 +08:00 |
|
Zhiyi Hong
|
cd362c5ca0
|
fix: max_running_requests=256, cuda_graph_max_bs=256 to match max concurrency 128
|
2026-07-28 17:20:25 +08:00 |
|
Zhiyi Hong
|
da1d4d3d78
|
add tp = 16 deepseek v4 pro sglang bench
|
2026-07-28 17:09:26 +08:00 |
|