Articles sur MLLMs
2 articles liés
HalluPrism : quand l'incertitude multimodale doit diagnostiquer, pas décider
HalluPrism: When Multimodal Uncertainty Should Diagnose, Not Decide
AI InsightHalluPrism transforme l'incertitude multimodale de « décider s'il faut répondre » à « diagnostiquer la cause de l'échec », en générant des signatures (V, L, A) par le biais d'une dégradation visuelle, d'images vierges et de sondes d'ancrage/relation. Parmi les plus de 58 000 échantillons, la rétention de confiance dans la suppression d’image est la plus courante, mais l’instabilité de la sonde de mise à la terre/de relation est plus efficace pour distinguer les familles défaillantes, et les coordonnées doivent être interprétées conjointement plutôt qu’utilisées indépendamment.Importance 68/100Inter-3D VQA : une référence multimodale en bordure de route pour la réponse visuelle à des questions 3D spatio-temporelles
Inter-3D VQA: A Roadside Multimodal Benchmark for 3D Spatiotemporally Grounded Visual Question Answering
AI InsightInter-3D VQA propose le premier test de réponse visuelle spatio-temporelle 3D aux questions pour les scènes d'intersection, créant 407 000 paires d'assurance qualité basées sur des nuages de points synchronisés et des images multi-vues, couvrant le positionnement au niveau de la voie, les relations entre objets, les modèles de mouvement et le raisonnement de quasi-collision. Par rapport aux benchmarks précédents, qui sont principalement basés sur la perspective d'un véhicule autonome ou sur une vidéo routière 2D, ce travail évaluera l'avancement de la perception 2D au raisonnement fondé sur la 3D de la distance et de la topologie réelles.Importance 65/100