sora 13274243a0 Bump vendored EvalScope and add K3-ready DPV4 configs.
Keep K3 suite selection and report-schema scoring in bash, merge K3/vision dataset_args into dpv4 yamls, and pin EvalScope at 735d920ee911 with local patches.

Co-authored-by: Cursor <cursoragent@cursor.com>
2026-09-02 07:30:48 +00:00

86 lines
2.3 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# General-VQA
## 概述
General-VQA 是一个可自定义的视觉问答Visual Question Answering基准测试用于评估多模态模型。
它支持 OpenAI 兼容的消息格式,并允许灵活地输入图像/视频/音频本地路径、URL 或 base64 编码)。
## 任务描述
- **任务类型**视觉问答Visual Question Answering
- **输入**:图像/视频/音频 + 以 OpenAI 聊天格式组织的问题
- **输出**:自由格式的文本答案
- **灵活性**:通过 TSV/JSONL 文件支持自定义数据集
## 核心特性
- OpenAI 兼容的消息格式
- 支持多种图像/视频/音频输入方式本地路径、URL、base64
- **媒体占位符**:在纯文本用户消息中使用 ``<image N>`` / ``<video N>`` / ``<audio N>``,并配合带索引的媒体列(如 ``image_1``、``video_1``、``audio_1`` 等),以简化数据格式
- 支持 BLEU 和 Rouge 指标的灵活评估
- 通过本地文件加载支持自定义数据集
- 可扩展以适用于各种 VQA 应用场景
## 评估说明
- 默认配置使用 **0-shot** 评估
- 默认指标:**BLEU**、**Rouge**(主评分指标为 Rouge-L-R
-**test** 数据划分上进行评估
- 数据集格式详见 [用户指南](https://evalscope.readthedocs.io/zh-cn/latest/advanced_guides/custom_dataset/vlm.html)
## 属性
| 属性 | 值 |
|----------|-------|
| **基准测试名称** | `general_vqa` |
| **数据集ID** | `general_vqa` |
| **论文** | N/A |
| **标签** | `Custom`, `MultiModal`, `QA` |
| **指标** | `BLEU`, `Rouge` |
| **默认示例数** | 0-shot |
| **评估划分** | `test` |
## 数据统计
*统计数据不可用。*
## 样例示例
*样例示例不可用。*
## 提示模板
*未定义提示模板。*
## 使用方法
### 使用 CLI
```bash
evalscope eval \
--model YOUR_MODEL \
--api-url OPENAI_API_COMPAT_URL \
--api-key EMPTY_TOKEN \
--datasets general_vqa \
--limit 10 # 正式评估时请删除此行
```
### 使用 Python
```python
from evalscope import run_task
from evalscope.config import TaskConfig
task_cfg = TaskConfig(
model='YOUR_MODEL',
api_url='OPENAI_API_COMPAT_URL',
api_key='EMPTY_TOKEN',
datasets=['general_vqa'],
limit=10, # 正式评估时请删除此行
)
run_task(task_cfg=task_cfg)
```