50 lines
2.3 KiB
Markdown
50 lines
2.3 KiB
Markdown
# MiniMax-H3 VBench base(TP2×4)
|
||
|
||
默认口径是 768p、5 秒、20 steps、FL2VA 服务上的纯文本 `t2va`,4 个 TP=2
|
||
实例分别使用 GPU `0-1/2-3/4-5/6-7` 和端口 `30010/30020/30030/30040`。
|
||
|
||
默认读取 VBench v1 的完整标准 prompt suite,16 个维度,每个 prompt 生成一个固定
|
||
seed。这与 LoSA 论文的“full standard prompt suite + single fixed random seed”接近,适合
|
||
后续 dense、SparsePR、LoSA、TeaCache 使用相同 prompt 和 seed 做差分。官方严格的五样本
|
||
协议可设置 `SAMPLES_PER_PROMPT=5`,生成成本约为默认的五倍。
|
||
|
||
`/data/datasets/vbench` 当前是 VBench-2.0 的模型样例视频集,不含 VBench v1 的
|
||
`evaluate.py`、`VBench_full_info.json` 和评分依赖。运行前需要准备官方 VBench v1 代码与
|
||
独立评测环境,并通过 `VBENCH_REPO`、`VBENCH_PYTHON` 指定。
|
||
|
||
只做检查,不启动:
|
||
|
||
```bash
|
||
ACTION=preflight \
|
||
VBENCH_REPO=/data/wxy/VBench \
|
||
VBENCH_PYTHON=/root/.miniconda3/envs/vbench/bin/python \
|
||
bash /data/wxy/run_h3_vbench_base_tp2x4.sh
|
||
```
|
||
|
||
完整生成并评分:
|
||
|
||
```bash
|
||
RUN_ID=h3-dense-vbench-base-v1 \
|
||
ACTION=all \
|
||
bash /data/wxy/run_h3_vbench_base_tp2x4.sh
|
||
```
|
||
|
||
中断后续跑时必须复用同一个 `RUN_ID`。生成日志是 append-only JSONL,已有且有效的
|
||
MP4 会跳过。调试用小集合可设置 `MAX_PROMPTS=16 ACTION=generate`;脚本拒绝对小集合
|
||
输出“标准 VBench 分数”,避免把不完整结果误当论文可比分数。
|
||
|
||
主要产物:
|
||
|
||
- `generation/manifest.jsonl`:prompt、维度、seed、实例和端口的固定映射
|
||
- `generation/results.jsonl`:逐请求耗时、服务输出、错误与恢复记录
|
||
- `generation/summary.json`:四实例及每维度的负载均衡检查
|
||
- `videos/{prompt}-{index}.mp4`:VBench 标准命名视频
|
||
- `evaluation/vbench_16_dimensions.json`:16 个原始维度分数
|
||
- `evaluation/final_score.txt`:官方 Quality / Semantic / Total Score
|
||
|
||
`temporal_flickering` 默认先运行官方 `static_filter.py`,然后单独评分并合并回 16 维
|
||
结果。只有明确需要诊断非标准口径时才设置 `RUN_STATIC_FILTER=0`。
|
||
|
||
脚本不会清理或停止未知进程。如果 GPU 显存超过阈值或端口被占用,会直接退出;退出时
|
||
只停止本次脚本记录的四个服务进程组。
|