为什么重要

该数据集和基准为视觉抽象链等多模态推理任务提供了大规模训练和评估资源,有望推动多模态模型推理能力的发展。

关键事实

事实 1

CoVA-SFT 包含 51,900 个样本和超过 222,000 个多模态推理步骤。

来源与依据

单一来源

CoVA-SFT, a highly structured corpus of 51.9K samples containing over 222K multimodal reasoning steps

Hugging Face Daily Papers · 第一方证据 · 支持

查看 Hugging Face Daily Papers 原文

事实 2

CoVA-Bench 包含 1,700 个留出测试样本,覆盖相同的任务。

来源与依据

单一来源

CoVA-Bench, a companion benchmark of 1,700 held-out test samples spanning the same tasks

Hugging Face Daily Papers · 第一方证据 · 支持

查看 Hugging Face Daily Papers 原文

事实 3

在 CoVA-SFT 上微调的模型在 CoVA-Bench 上的表现平均比所有交错 CoT 基线高出 2 倍以上。

来源与依据

单一来源

models fine-tuned on CoVA-SFT outperform all interleaved CoT baselines by more than 2x on average on CoVA-Bench

Hugging Face Daily Papers · 第一方证据 · 支持

查看 Hugging Face Daily Papers 原文