# sskj-h3 MiniMax-H3 在 RTX 6000D-H3 上的吞吐、性能 Profile、成对 SSIM 与 VBench 评测归档。 ## 目录 - `throughput/`:吞吐测试、Profile 与成对 SSIM。 - `sglang-base/`:SGLang TP8×1、TP4×2、TP2×4,20 steps / 5s 基准。 - `sglang-base-b300/`:B300 相关 SGLang 基准。 - `sglang-lora/`:Larry LoRA 加速基准。 - `sglang-profile/`:Torch/Nsight/NCCL 与 SDPA kernel 分析。 - `vllm-omni-base/`:vLLM-Omni 多实例基准。 - `common/paired_video_ssim.py`:候选运行相对 base 的逐帧成对 SSIM。 - `vbench-score/`:VBench 视频与 16 维评分。 - `vbench-base/`:base 生成与评分归档。 - `vbench-lora/`:Larry LoRA 生成与评分归档。 - `SOURCE_MAP.tsv`:源路径、归档路径、文件数和字节数。 - `tools/`:非破坏性归档与验收脚本。 ## SSIM 与 VBench 的分工 成对 SSIM 用相同 prompt、seed、任务、分辨率、时长和宽高比的 base 视频作为参考,按 `request_id` 配对。视频由 FFmpeg 解码并统一为 `yuv420p`,然后逐帧计算 Y/U/V/All SSIM;主口径是 `All`。它适合测量 Cache-DiT、TeaCache、Larry 等加速方案对 base 输出的像素/结构偏移。 VBench 独立衡量主体一致性、运动、审美等生成质量维度。SSIM 高不等于 VBench 高,VBench 高也不保证逐样本复现,因此两者互补。 吞吐 runner 只有在设置 `SSIM_REFERENCE_ROOT` 时才会在每个 phase 结束、SGLang 服务完全停止后评分,不会把解码和评分时间计入吞吐: ```bash SSIM_REFERENCE_ROOT=/data/wxy/sskj-h3/throughput/sglang-base/results/balanced-tp4-tp2-20steps-5s-20260822-175030 \ SSIM_THRESHOLD=0.90 \ bash /data/wxy/sskj-h3/throughput/sglang-lora/scripts/run_sglang_h3_lora_mixed_matrix_6000d.sh ``` 参考目录和候选目录都应包含 `tpN_replicasM//client_*/results.jsonl`。每个候选 phase 会新增: - `quality/paired_ssim.json`:总体、分辨率分组和逐视频结果。 - `quality/paired_ssim.tsv`:逐视频表。 - `quality/paired_ssim_frames.tsv`:逐帧表。 - `quality/paired_ssim.log`:评分日志。 默认阈值为 0.90,只记录是否通过,不中止完整矩阵;需要将低于阈值视作失败时设置 `SSIM_FAIL_BELOW_THRESHOLD=true`。 ## Git 镜像边界 服务器保留全部实体文件;同步到 Git 时排除 `vbench-score/*/results/`、全部 `*.mp4`、全部 `*.sqlite`、Nsight `*.nsys-rep` 和 Torch `*.trace.json.gz` 原始采集。代码、日志、JSON/JSONL、TSV、结构化汇总和分析文档正常纳入版本库。 ## 验证 ```bash /root/.miniconda3/bin/python /data/wxy/sskj-h3/tools/validate_sskj_h3_archive.py ```