2026-08-31 15:57:13 +08:00
2026-08-31 15:57:13 +08:00
2026-08-31 15:57:13 +08:00
2026-08-31 15:57:13 +08:00
2026-08-31 15:57:13 +08:00
2026-08-31 15:57:13 +08:00
2026-08-31 15:57:13 +08:00

sskj-h3

MiniMax-H3 在 RTX 6000D-H3 上的吞吐、性能 Profile、成对 SSIM 与 VBench 评测归档。

目录

  • throughput/吞吐测试、Profile 与成对 SSIM。
    • sglang-base/SGLang TP8×1、TP4×2、TP2×420 steps / 5s 基准。
    • sglang-base-b300/B300 相关 SGLang 基准。
    • sglang-lora/Larry LoRA 加速基准。
    • sglang-profile/Torch/Nsight/NCCL 与 SDPA kernel 分析。
    • vllm-omni-base/vLLM-Omni 多实例基准。
    • common/paired_video_ssim.py:候选运行相对 base 的逐帧成对 SSIM。
  • vbench-score/VBench 视频与 16 维评分。
    • vbench-base/base 生成与评分归档。
    • vbench-lora/Larry LoRA 生成与评分归档。
  • SOURCE_MAP.tsv:源路径、归档路径、文件数和字节数。
  • tools/:非破坏性归档与验收脚本。

SSIM 与 VBench 的分工

成对 SSIM 用相同 prompt、seed、任务、分辨率、时长和宽高比的 base 视频作为参考,按 request_id 配对。视频由 FFmpeg 解码并统一为 yuv420p,然后逐帧计算 Y/U/V/All SSIM主口径是 All。它适合测量 Cache-DiT、TeaCache、Larry 等加速方案对 base 输出的像素/结构偏移。

VBench 独立衡量主体一致性、运动、审美等生成质量维度。SSIM 高不等于 VBench 高VBench 高也不保证逐样本复现,因此两者互补。

吞吐 runner 只有在设置 SSIM_REFERENCE_ROOT 时才会在每个 phase 结束、SGLang 服务完全停止后评分,不会把解码和评分时间计入吞吐:

SSIM_REFERENCE_ROOT=/data/wxy/sskj-h3/throughput/sglang-base/results/balanced-tp4-tp2-20steps-5s-20260822-175030 \
SSIM_THRESHOLD=0.90 \
bash /data/wxy/sskj-h3/throughput/sglang-lora/scripts/run_sglang_h3_lora_mixed_matrix_6000d.sh

参考目录和候选目录都应包含 tpN_replicasM/<task>/client_*/results.jsonl。每个候选 phase 会新增:

  • quality/paired_ssim.json:总体、分辨率分组和逐视频结果。
  • quality/paired_ssim.tsv:逐视频表。
  • quality/paired_ssim_frames.tsv:逐帧表。
  • quality/paired_ssim.log:评分日志。

默认阈值为 0.90,只记录是否通过,不中止完整矩阵;需要将低于阈值视作失败时设置 SSIM_FAIL_BELOW_THRESHOLD=true

Git 镜像边界

服务器保留全部实体文件;同步到 Git 时排除 vbench-score/*/results/、全部 *.mp4、全部 *.sqlite、Nsight *.nsys-rep 和 Torch *.trace.json.gz 原始采集。代码、日志、JSON/JSONL、TSV、结构化汇总和分析文档正常纳入版本库。

验证

/root/.miniconda3/bin/python /data/wxy/sskj-h3/tools/validate_sskj_h3_archive.py
Description
No description provided
Readme 1.6 GiB
Languages
Python 54.8%
Shell 45.2%