关于 CoVA-SFT 的报道
共 1 篇相关报道
CoVA-SFT:视觉抽象链的大规模数据集
CoVA-SFT: A Large-Scale Dataset for Chain of Visual Abstractions
AI 洞察CoVA-SFT包含51.9K样本、超过222K多模态推理步骤,覆盖5种布局族和17个任务,旨在教模型在纯文本推理中构建内部视觉工作空间。相比文本CoT将视觉问题序列化为散文,该数据集提供大规模多步自校正训练语料,填补了该方向空白。核心结论从文本序列化视觉推理转向大规模视觉抽象链自校正训练数据。为什么重要首个大规模视觉抽象链数据集可能提升模型在视觉推理任务上的效率与准确性,推动多模态推理训练范式的转变。影响谁- AI 研究者获得可训练的视觉抽象链数据资源,可探索内部视觉工作空间的建模方法。
- 开发者可用于微调模型以增强文本输入下的视觉推理能力,提升应用表现。
后续看点关注CoVA-Bench的评测结果,以及基于该数据集微调的模型在视觉数学、图表推理等任务上的实际增益。重要度 65/100