Research
CoVA-SFT 数据集:面向视觉抽象链的大规模多模态推理语料
CoVA-SFT 是一个包含 51,900 个样本和超过 222,000 个多模态推理步骤的结构化语料库,并配套 CoVA-Bench 基准。在该语料上微调的模型在 CoVA-Bench 上平均比交错 CoT 基线高出 2 倍以上。
阅读 Hugging Face Daily Papers 原文为什么重要
该数据集和基准为视觉抽象链等多模态推理任务提供了大规模训练和评估资源,有望推动多模态模型推理能力的发展。
关键事实
事实 1
CoVA-SFT 包含 51,900 个样本和超过 222,000 个多模态推理步骤。
来源与依据
CoVA-SFT, a highly structured corpus of 51.9K samples containing over 222K multimodal reasoning steps
事实 2
CoVA-Bench 包含 1,700 个留出测试样本,覆盖相同的任务。
来源与依据
CoVA-Bench, a companion benchmark of 1,700 held-out test samples spanning the same tasks
事实 3
在 CoVA-SFT 上微调的模型在 CoVA-Bench 上的表现平均比所有交错 CoT 基线高出 2 倍以上。
来源与依据
models fine-tuned on CoVA-SFT outperform all interleaved CoT baselines by more than 2x on average on CoVA-Bench