Noticias sobre MLLMs
2 artículos relacionados
HalluPrism: cuando la incertidumbre multimodal debería diagnosticar, no decidir
HalluPrism: When Multimodal Uncertainty Should Diagnose, Not Decide
AI InsightHalluPrism convierte la incertidumbre multimodal de "decidir si responder" a "diagnosticar la causa del error", generando firmas (V,L,A) a través de degradación visual, imágenes en blanco y sondas de relación/conexión a tierra. Entre las muestras de más de 58.000, la retención de la confianza en la eliminación de imágenes es la más común, pero la inestabilidad de la sonda de conexión a tierra/relación es mejor para distinguir familias fallidas, y las coordenadas deben interpretarse de forma conjunta en lugar de usarse de forma independiente.Importancia 68/100Inter-3D VQA: un punto de referencia multimodal en la carretera para la respuesta visual de preguntas en 3D con base espaciotemporal
Inter-3D VQA: A Roadside Multimodal Benchmark for 3D Spatiotemporally Grounded Visual Question Answering
AI InsightInter-3D VQA propone el primer punto de referencia de respuesta visual espacio-temporal en 3D para escenas de intersecciones, construyendo pares de control de calidad de 407K basados en nubes de puntos sincronizadas e imágenes de múltiples vistas, que cubren posicionamiento a nivel de carril, relaciones de objetos, patrones de movimiento y razonamiento de casi colisión. En comparación con puntos de referencia anteriores, que se basan principalmente en la perspectiva del vehículo o en videos en 2D en la carretera, este trabajo evaluará el avance de la percepción en 2D al razonamiento basado en 3D de la distancia y la topología reales.Importancia 65/100