sskj-h3/vbench-score/vbench-base/ORIGINAL_RUNBOOK.md
2026-08-31 15:57:13 +08:00

2.3 KiB
Raw Permalink Blame History

MiniMax-H3 VBench baseTP2×4

默认口径是 768p、5 秒、20 steps、FL2VA 服务上的纯文本 t2va4 个 TP=2 实例分别使用 GPU 0-1/2-3/4-5/6-7 和端口 30010/30020/30030/30040

默认读取 VBench v1 的完整标准 prompt suite16 个维度,每个 prompt 生成一个固定 seed。这与 LoSA 论文的“full standard prompt suite + single fixed random seed”接近适合 后续 dense、SparsePR、LoSA、TeaCache 使用相同 prompt 和 seed 做差分。官方严格的五样本 协议可设置 SAMPLES_PER_PROMPT=5,生成成本约为默认的五倍。

/data/datasets/vbench 当前是 VBench-2.0 的模型样例视频集,不含 VBench v1 的 evaluate.pyVBench_full_info.json 和评分依赖。运行前需要准备官方 VBench v1 代码与 独立评测环境,并通过 VBENCH_REPOVBENCH_PYTHON 指定。

只做检查,不启动:

ACTION=preflight \
VBENCH_REPO=/data/wxy/VBench \
VBENCH_PYTHON=/root/.miniconda3/envs/vbench/bin/python \
bash /data/wxy/run_h3_vbench_base_tp2x4.sh

完整生成并评分:

RUN_ID=h3-dense-vbench-base-v1 \
ACTION=all \
bash /data/wxy/run_h3_vbench_base_tp2x4.sh

中断后续跑时必须复用同一个 RUN_ID。生成日志是 append-only JSONL已有且有效的 MP4 会跳过。调试用小集合可设置 MAX_PROMPTS=16 ACTION=generate;脚本拒绝对小集合 输出“标准 VBench 分数”,避免把不完整结果误当论文可比分数。

主要产物:

  • generation/manifest.jsonlprompt、维度、seed、实例和端口的固定映射
  • generation/results.jsonl:逐请求耗时、服务输出、错误与恢复记录
  • generation/summary.json:四实例及每维度的负载均衡检查
  • videos/{prompt}-{index}.mp4VBench 标准命名视频
  • evaluation/vbench_16_dimensions.json16 个原始维度分数
  • evaluation/final_score.txt:官方 Quality / Semantic / Total Score

temporal_flickering 默认先运行官方 static_filter.py,然后单独评分并合并回 16 维 结果。只有明确需要诊断非标准口径时才设置 RUN_STATIC_FILTER=0

脚本不会清理或停止未知进程。如果 GPU 显存超过阈值或端口被占用,会直接退出;退出时 只停止本次脚本记录的四个服务进程组。