Noticias sobre Qwen2.5-VL-72B
1 artículos relacionados
¿Los grandes modelos lingüísticos examinan lo que revisan? Una auditoría multimodal de calibración de puntuación, detección de errores y efectos de identidad del autor
Do large language models scrutinise what they review? A multimodal audit of scoring calibration, error detection, and author-identity effects
AI InsightEste estudio probó sistemáticamente el desempeño de dos LLM multimodales en la revisión de presentaciones de ICLR 2026 y encontró que son sensibles a la autoría y la información de las figuras y tienen capacidades limitadas de detección de errores. En comparación con el pasado, que solo evaluaba el contenido de revisión generado por LLM, esta vez se revelaron por primera vez las limitaciones específicas de la revisión de LLM en términos de sesgo de identidad e identificación errónea.Importancia 82/100