Articles sur Document Vision-Language Models
1 articles liés
Récupération de preuves visuelles conditionnées par l'état pour une perception fine dans les modèles de vision et de langage de documents
State-Conditioned Visual Evidence Retrieval for Fine-Grained Perception in Document Vision-Language Models
AI InsightCet article propose la méthode SCVER, qui modélise la perception visuelle dans l'analyse de documents sous forme de récupération conditionnelle à l'état, remplaçant l'accès répété aux jetons visuels compressés globaux pendant le décodage pour réaliser une acquisition de preuves à la demande. Par rapport au calcul inefficace des représentations compressées globales précédentes, cela signifie que la perception fine devrait améliorer l’efficacité et la précision du raisonnement, mais elle en est encore au stade de la pré-impression et les résultats expérimentaux doivent être vérifiés.Importance 70/100