- sskj.deploy runtime 支持 NODE_HOSTS 多节点编排(ssh 分发/本地 rank/LOCAL_NODE_RANK)
与 ENGINE=vllm 启动(SERVER_CMD),容器名按 rank 自动唯一
- scripts/common/deploy_cli.sh 新增 deploy_stop/status/multinode helper 与 node-rank 透传
- src/sskj/common/env.py 修复嵌套 ${VAR:-${OTHER}/path} 展开(平衡花括号扫描)
- deploy/profiles/pro6000/ 新增 6 个 profile: tp16/tp16_eagle/glm52(多节点)、
sglang/vllm tp_dp_matrix、qwen3(单节点)
- 6 个实验 start/stop 脚本改为 deploy 薄包装,run_bench/adaptive 的 server 启停走
deploy_render_args/deploy_start/deploy_stop,tp16 新增 matrix.json
- 首次入库 glm52_pro6000_sglang_multinode_tp16 实验目录;ops/README.md 补 pro6000 章节
- 实测通过: 单节点 dsv4 sglang/vllm 链路 + tp16 双节点启动/bench/清理
109 lines
2.7 KiB
Plaintext
109 lines
2.7 KiB
Plaintext
# 环境/依赖/临时文件
|
||
# envs/ 目录下的虚拟环境子目录(具体环境文件不提交,但文档保留)
|
||
envs/modelscope-hub/
|
||
envs/modelscope-upload/
|
||
envs/sglang/
|
||
envs/sglang-src/
|
||
envs/vllm/
|
||
envs/charts/
|
||
# 其他一次性工具环境/临时产物
|
||
.venv-charts/
|
||
.tmp_charts/
|
||
# 其他通用忽略
|
||
deps/
|
||
tmp/
|
||
*.pid
|
||
__pycache__/
|
||
*.pyc
|
||
*.pyo
|
||
*.egg-info/
|
||
|
||
# 大文件/压缩包
|
||
*.zip
|
||
*.tar.gz
|
||
*.tar.bz2
|
||
|
||
# 中间日志
|
||
logs/
|
||
*.log
|
||
*.csv
|
||
# 数据集(可重新下载,但保留下载说明文档入库)
|
||
# 用 datasets/* 而非 datasets/,否则 !datasets/README.md 例外无法生效
|
||
datasets/*
|
||
!datasets/README.md
|
||
|
||
# 原始请求级输出与中间产物不入库:只提交 adaptive_results 下的汇总级文件
|
||
# (adaptive_points.jsonl / adaptive_shapes.jsonl / adaptive_summary.* / run_manifest.json / shapes.tsv),
|
||
# tp*_dp*/ 子目录(raw_outputs、metrics、logs、gpu_logs、server_cmd.txt)一律忽略。
|
||
experiments/*/*/adaptive_results/*/tp*_dp*/
|
||
|
||
# 实验级原始结果目录:保留 report.md / results.json / raw_outputs,忽略日志
|
||
experiments/*/results/*/logs/
|
||
experiments/*/results/*/*/logs/
|
||
experiments/*/results/*/*.tsv
|
||
experiments/*/results/*/*/*.tsv
|
||
|
||
# 运行时目录(pid 文件、缓存、临时文件)
|
||
experiments/**/runtime/
|
||
|
||
# 无关项目
|
||
loomeval_yy/
|
||
|
||
# 部署层运行时产物
|
||
deploy/logs/
|
||
|
||
.gitignore
|
||
|
||
dsv4_dspark_h20_sglang_tp_dp_matrix
|
||
dsv4_h20_sglang_tp_dp_matrix
|
||
glm_old_h20_vllm_tp_dp_matrix
|
||
# === 仓库瘦身规范(2026-07)===
|
||
# 约定:实验目录只提交 代码(config.env/*.sh/*.py) + report.md + results.json(小体量汇总)。
|
||
# 不提交:逐请求原始日志(raw_outputs)、JIT/算子缓存、编译产物、一次性 bench 输出。
|
||
# 历史中 raw_outputs/*.jsonl 是仓库膨胀主因(~1.3GB);本规范从源头不再入库。
|
||
# results.json 须保持小体量,禁止嵌入 raw_requests(否则单独走 raw_outputs)。
|
||
|
||
# 编译产物(每次构建重新生成)
|
||
*.o
|
||
*.so
|
||
*.ninja
|
||
*.ninja_deps
|
||
*.ninja_log
|
||
*.cubin
|
||
build/
|
||
|
||
# JIT / 算子缓存(每次跑重新生成)
|
||
sglang_sm120_cache/
|
||
vllm_sm120_cache/
|
||
*_sm120_cache/
|
||
sglang_nightly_cu13_cache/
|
||
|
||
# 一次性 bench 输出
|
||
bench-output/
|
||
|
||
# 单数 dataset/(可重新下载,与 datasets/ 同源)
|
||
dataset/
|
||
|
||
# 逐请求原始日志(体积大;汇总见 results.json / report.md)
|
||
experiments/**/raw_outputs/
|
||
**/dummy_sharegpt.json
|
||
|
||
# pro6000 统一 bench CLI 的一次性测试输出(ops_ 前缀 run_id)
|
||
experiments/pro6000/*/results/ops_*/
|
||
|
||
# Virtual environments (keep only docs under envs/)
|
||
envs/*
|
||
!envs/README.md
|
||
!envs/SM120_DSV4_DEPLOYMENT_GUIDE.md
|
||
!envs/ASCEND_910C_ENV_SETUP.md
|
||
!envs/UV_ENV_SETUP.md
|
||
|
||
# Tooling artifacts
|
||
skills-lock.json
|
||
|
||
# 临时备份文件
|
||
*.bak.glm52orig
|
||
*.bak
|
||
*.bak.*
|
||
*.tmp
|