sskj-h3/vbench-score/vbench-base/ORIGINAL_RUNBOOK.md
2026-08-31 15:57:13 +08:00

50 lines
2.3 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# MiniMax-H3 VBench baseTP2×4
默认口径是 768p、5 秒、20 steps、FL2VA 服务上的纯文本 `t2va`4 个 TP=2
实例分别使用 GPU `0-1/2-3/4-5/6-7` 和端口 `30010/30020/30030/30040`
默认读取 VBench v1 的完整标准 prompt suite16 个维度,每个 prompt 生成一个固定
seed。这与 LoSA 论文的“full standard prompt suite + single fixed random seed”接近适合
后续 dense、SparsePR、LoSA、TeaCache 使用相同 prompt 和 seed 做差分。官方严格的五样本
协议可设置 `SAMPLES_PER_PROMPT=5`,生成成本约为默认的五倍。
`/data/datasets/vbench` 当前是 VBench-2.0 的模型样例视频集,不含 VBench v1 的
`evaluate.py``VBench_full_info.json` 和评分依赖。运行前需要准备官方 VBench v1 代码与
独立评测环境,并通过 `VBENCH_REPO``VBENCH_PYTHON` 指定。
只做检查,不启动:
```bash
ACTION=preflight \
VBENCH_REPO=/data/wxy/VBench \
VBENCH_PYTHON=/root/.miniconda3/envs/vbench/bin/python \
bash /data/wxy/run_h3_vbench_base_tp2x4.sh
```
完整生成并评分:
```bash
RUN_ID=h3-dense-vbench-base-v1 \
ACTION=all \
bash /data/wxy/run_h3_vbench_base_tp2x4.sh
```
中断后续跑时必须复用同一个 `RUN_ID`。生成日志是 append-only JSONL已有且有效的
MP4 会跳过。调试用小集合可设置 `MAX_PROMPTS=16 ACTION=generate`;脚本拒绝对小集合
输出“标准 VBench 分数”,避免把不完整结果误当论文可比分数。
主要产物:
- `generation/manifest.jsonl`prompt、维度、seed、实例和端口的固定映射
- `generation/results.jsonl`:逐请求耗时、服务输出、错误与恢复记录
- `generation/summary.json`:四实例及每维度的负载均衡检查
- `videos/{prompt}-{index}.mp4`VBench 标准命名视频
- `evaluation/vbench_16_dimensions.json`16 个原始维度分数
- `evaluation/final_score.txt`:官方 Quality / Semantic / Total Score
`temporal_flickering` 默认先运行官方 `static_filter.py`,然后单独评分并合并回 16 维
结果。只有明确需要诊断非标准口径时才设置 `RUN_STATIC_FILTER=0`
脚本不会清理或停止未知进程。如果 GPU 显存超过阈值或端口被占用,会直接退出;退出时
只停止本次脚本记录的四个服务进程组。