# 运维一键测试手册 这份手册只说明怎么**跑测试**。模型部署由模型团队负责,运维不需要理解 SGLang/vLLM 的引擎参数,也不需要执行 `python -m sskj.deploy`。 ## 0. 准备 ```bash cd /data1/yy/sskj python3 -m pip install -e . --no-deps ``` 如果不想安装,也可以每次执行时加 `PYTHONPATH=src`: ```bash cd /data1/yy/sskj PYTHONPATH=src python3 -m sskj.bench --help ``` ## 1. 查看可测试的实验 ```bash PYTHONPATH=src python3 -m sskj.bench list --platform p800 PYTHONPATH=src python3 -m sskj.bench list ``` ## 2. 冒烟测试 ```bash PYTHONPATH=src python3 -m sskj.bench run \ --url http://10.100.11.2:30014 \ --platform p800 \ --experiment dsv4_p800_sglang_tp_dp_matrix \ --profile smoke ``` ## 3. 完整矩阵测试 ```bash PYTHONPATH=src python3 -m sskj.bench run \ --url http://10.100.11.2:30014 \ --platform p800 \ --experiment dsv4_p800_sglang_tp_dp_matrix \ --profile matrix ``` `--profile matrix` 使用实验目录里的 `matrix.json`,只测试 `Y` 标记的场景, 每个 ISL 取低/高两个并发档位。 ## 4. 先看计划再执行 任何 `run` 命令都可以加 `--dry-run`,只打印 URL、client 模式、场景清单和 结果路径,不发送请求。 ## 5. 结果在哪里 结果默认写回实验目录: ```text experiments///results// ├── results.json ├── report.md ├── run_manifest.json ├── raw_outputs/ └── logs/ ``` 把 `` 或 `report.md` 路径发给模型团队即可。 ## 6. client 模式 默认自动选择: | 平台 | 默认 client | |---|---| | P800 | `server-container`(进入已部署容器执行,保留厂商 bench_serving) | | H20/H200/6000D | `docker`(独立 sglang client 容器) | | 910C | `server-container` 或 `native`(按实验配置自动选择) | 跨机测试时可用 `--client docker --client-image lmsysorg/sglang:latest` 指定外部 client。 ## 7. 常见问题 - 服务不健康:确认 `--url` 的端口可从测试机访问,服务已启动且 `/health` 可通。 - 数据集缺失:仓库 `datasets/` 下没有 ShareGPT 文件时,统一 CLI 会自动退回 `random-ids`,可用于连通性验证;正式矩阵前先放好数据集。 - P95 指标:P800 使用容器内 `bench_serving`,解析层会从逐请求数据补算 P95, 与旧实验口径一致。 - 不要执行部署命令:`python -m sskj.deploy` 仅模型团队使用。