# MiniMax-H3 VBench base(TP2×4) 默认口径是 768p、5 秒、20 steps、FL2VA 服务上的纯文本 `t2va`,4 个 TP=2 实例分别使用 GPU `0-1/2-3/4-5/6-7` 和端口 `30010/30020/30030/30040`。 默认读取 VBench v1 的完整标准 prompt suite,16 个维度,每个 prompt 生成一个固定 seed。这与 LoSA 论文的“full standard prompt suite + single fixed random seed”接近,适合 后续 dense、SparsePR、LoSA、TeaCache 使用相同 prompt 和 seed 做差分。官方严格的五样本 协议可设置 `SAMPLES_PER_PROMPT=5`,生成成本约为默认的五倍。 `/data/datasets/vbench` 当前是 VBench-2.0 的模型样例视频集,不含 VBench v1 的 `evaluate.py`、`VBench_full_info.json` 和评分依赖。运行前需要准备官方 VBench v1 代码与 独立评测环境,并通过 `VBENCH_REPO`、`VBENCH_PYTHON` 指定。 只做检查,不启动: ```bash ACTION=preflight \ VBENCH_REPO=/data/wxy/VBench \ VBENCH_PYTHON=/root/.miniconda3/envs/vbench/bin/python \ bash /data/wxy/run_h3_vbench_base_tp2x4.sh ``` 完整生成并评分: ```bash RUN_ID=h3-dense-vbench-base-v1 \ ACTION=all \ bash /data/wxy/run_h3_vbench_base_tp2x4.sh ``` 中断后续跑时必须复用同一个 `RUN_ID`。生成日志是 append-only JSONL,已有且有效的 MP4 会跳过。调试用小集合可设置 `MAX_PROMPTS=16 ACTION=generate`;脚本拒绝对小集合 输出“标准 VBench 分数”,避免把不完整结果误当论文可比分数。 主要产物: - `generation/manifest.jsonl`:prompt、维度、seed、实例和端口的固定映射 - `generation/results.jsonl`:逐请求耗时、服务输出、错误与恢复记录 - `generation/summary.json`:四实例及每维度的负载均衡检查 - `videos/{prompt}-{index}.mp4`:VBench 标准命名视频 - `evaluation/vbench_16_dimensions.json`:16 个原始维度分数 - `evaluation/final_score.txt`:官方 Quality / Semantic / Total Score `temporal_flickering` 默认先运行官方 `static_filter.py`,然后单独评分并合并回 16 维 结果。只有明确需要诊断非标准口径时才设置 `RUN_STATIC_FILTER=0`。 脚本不会清理或停止未知进程。如果 GPU 显存超过阈值或端口被占用,会直接退出;退出时 只停止本次脚本记录的四个服务进程组。