sskj/.gitignore
Zhiyi Hong 9acf9fdfdb feat(pro6000): 部署/测试解耦 - deploy 层支持多节点与 vLLM,新增 6 个 profile
- sskj.deploy runtime 支持 NODE_HOSTS 多节点编排(ssh 分发/本地 rank/LOCAL_NODE_RANK)
  与 ENGINE=vllm 启动(SERVER_CMD),容器名按 rank 自动唯一
- scripts/common/deploy_cli.sh 新增 deploy_stop/status/multinode helper 与 node-rank 透传
- src/sskj/common/env.py 修复嵌套 ${VAR:-${OTHER}/path} 展开(平衡花括号扫描)
- deploy/profiles/pro6000/ 新增 6 个 profile: tp16/tp16_eagle/glm52(多节点)、
  sglang/vllm tp_dp_matrix、qwen3(单节点)
- 6 个实验 start/stop 脚本改为 deploy 薄包装,run_bench/adaptive 的 server 启停走
  deploy_render_args/deploy_start/deploy_stop,tp16 新增 matrix.json
- 首次入库 glm52_pro6000_sglang_multinode_tp16 实验目录;ops/README.md 补 pro6000 章节
- 实测通过: 单节点 dsv4 sglang/vllm 链路 + tp16 双节点启动/bench/清理
2026-08-03 15:17:41 +08:00

109 lines
2.7 KiB
Plaintext
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# 环境/依赖/临时文件
# envs/ 目录下的虚拟环境子目录(具体环境文件不提交,但文档保留)
envs/modelscope-hub/
envs/modelscope-upload/
envs/sglang/
envs/sglang-src/
envs/vllm/
envs/charts/
# 其他一次性工具环境/临时产物
.venv-charts/
.tmp_charts/
# 其他通用忽略
deps/
tmp/
*.pid
__pycache__/
*.pyc
*.pyo
*.egg-info/
# 大文件/压缩包
*.zip
*.tar.gz
*.tar.bz2
# 中间日志
logs/
*.log
*.csv
# 数据集(可重新下载,但保留下载说明文档入库)
# 用 datasets/* 而非 datasets/,否则 !datasets/README.md 例外无法生效
datasets/*
!datasets/README.md
# 原始请求级输出与中间产物不入库:只提交 adaptive_results 下的汇总级文件
# adaptive_points.jsonl / adaptive_shapes.jsonl / adaptive_summary.* / run_manifest.json / shapes.tsv
# tp*_dp*/ 子目录raw_outputs、metrics、logs、gpu_logs、server_cmd.txt一律忽略。
experiments/*/*/adaptive_results/*/tp*_dp*/
# 实验级原始结果目录:保留 report.md / results.json / raw_outputs忽略日志
experiments/*/results/*/logs/
experiments/*/results/*/*/logs/
experiments/*/results/*/*.tsv
experiments/*/results/*/*/*.tsv
# 运行时目录pid 文件、缓存、临时文件)
experiments/**/runtime/
# 无关项目
loomeval_yy/
# 部署层运行时产物
deploy/logs/
.gitignore
dsv4_dspark_h20_sglang_tp_dp_matrix
dsv4_h20_sglang_tp_dp_matrix
glm_old_h20_vllm_tp_dp_matrix
# === 仓库瘦身规范2026-07===
# 约定:实验目录只提交 代码(config.env/*.sh/*.py) + report.md + results.json(小体量汇总)。
# 不提交:逐请求原始日志(raw_outputs)、JIT/算子缓存、编译产物、一次性 bench 输出。
# 历史中 raw_outputs/*.jsonl 是仓库膨胀主因(~1.3GB);本规范从源头不再入库。
# results.json 须保持小体量,禁止嵌入 raw_requests否则单独走 raw_outputs
# 编译产物(每次构建重新生成)
*.o
*.so
*.ninja
*.ninja_deps
*.ninja_log
*.cubin
build/
# JIT / 算子缓存(每次跑重新生成)
sglang_sm120_cache/
vllm_sm120_cache/
*_sm120_cache/
sglang_nightly_cu13_cache/
# 一次性 bench 输出
bench-output/
# 单数 dataset/(可重新下载,与 datasets/ 同源)
dataset/
# 逐请求原始日志(体积大;汇总见 results.json / report.md
experiments/**/raw_outputs/
**/dummy_sharegpt.json
# pro6000 统一 bench CLI 的一次性测试输出ops_ 前缀 run_id
experiments/pro6000/*/results/ops_*/
# Virtual environments (keep only docs under envs/)
envs/*
!envs/README.md
!envs/SM120_DSV4_DEPLOYMENT_GUIDE.md
!envs/ASCEND_910C_ENV_SETUP.md
!envs/UV_ENV_SETUP.md
# Tooling artifacts
skills-lock.json
# 临时备份文件
*.bak.glm52orig
*.bak
*.bak.*
*.tmp