2.3 KiB
MiniMax-H3 VBench base(TP2×4)
默认口径是 768p、5 秒、20 steps、FL2VA 服务上的纯文本 t2va,4 个 TP=2
实例分别使用 GPU 0-1/2-3/4-5/6-7 和端口 30010/30020/30030/30040。
默认读取 VBench v1 的完整标准 prompt suite,16 个维度,每个 prompt 生成一个固定
seed。这与 LoSA 论文的“full standard prompt suite + single fixed random seed”接近,适合
后续 dense、SparsePR、LoSA、TeaCache 使用相同 prompt 和 seed 做差分。官方严格的五样本
协议可设置 SAMPLES_PER_PROMPT=5,生成成本约为默认的五倍。
/data/datasets/vbench 当前是 VBench-2.0 的模型样例视频集,不含 VBench v1 的
evaluate.py、VBench_full_info.json 和评分依赖。运行前需要准备官方 VBench v1 代码与
独立评测环境,并通过 VBENCH_REPO、VBENCH_PYTHON 指定。
只做检查,不启动:
ACTION=preflight \
VBENCH_REPO=/data/wxy/VBench \
VBENCH_PYTHON=/root/.miniconda3/envs/vbench/bin/python \
bash /data/wxy/run_h3_vbench_base_tp2x4.sh
完整生成并评分:
RUN_ID=h3-dense-vbench-base-v1 \
ACTION=all \
bash /data/wxy/run_h3_vbench_base_tp2x4.sh
中断后续跑时必须复用同一个 RUN_ID。生成日志是 append-only JSONL,已有且有效的
MP4 会跳过。调试用小集合可设置 MAX_PROMPTS=16 ACTION=generate;脚本拒绝对小集合
输出“标准 VBench 分数”,避免把不完整结果误当论文可比分数。
主要产物:
generation/manifest.jsonl:prompt、维度、seed、实例和端口的固定映射generation/results.jsonl:逐请求耗时、服务输出、错误与恢复记录generation/summary.json:四实例及每维度的负载均衡检查videos/{prompt}-{index}.mp4:VBench 标准命名视频evaluation/vbench_16_dimensions.json:16 个原始维度分数evaluation/final_score.txt:官方 Quality / Semantic / Total Score
temporal_flickering 默认先运行官方 static_filter.py,然后单独评分并合并回 16 维
结果。只有明确需要诊断非标准口径时才设置 RUN_STATIC_FILTER=0。
脚本不会清理或停止未知进程。如果 GPU 显存超过阈值或端口被占用,会直接退出;退出时 只停止本次脚本记录的四个服务进程组。