Stories about CoVA-Bench
1 related stories
CoVA-SFT: A Large-Scale Dataset for Chain of Visual Abstractions
AI InsightCoVA-SFT contains 51.9K samples with over 222K multimodal reasoning steps across 5 layout families and 17 tasks, aiming to teach models to build internal visual workspaces during purely textual reasoning. Compared to text-only CoT that serializes visual problems into prose, this dataset provides a large-scale multi-step self-corrected training corpus, filling a gap in this direction.Key TakeawayShift from text-serialized visual reasoning to large-scale self-corrected training data for chain of visual abstractions.Why It MattersAs a first large-scale dataset for chain of visual abstractions, it may improve model efficiency and accuracy on visual reasoning tasks, driving a paradigm shift in multimodal reasoning training.Who's Affected- AI ResearchersGain a trainable visual abstraction chain dataset to explore methods for modeling internal visual workspaces.
- DevelopersCan fine-tune models to strengthen visual reasoning from text input, improving application performance.
What's NextWatch for CoVA-Bench evaluation results and the actual gains of fine-tuned models on visual math, diagram reasoning, and other tasks.Importance 65/100