Articles sur Qwen2.5-VL-72B
1 articles liés
Les grands modèles linguistiques examinent-ils ce qu’ils examinent ? Un audit multimodal de l'étalonnage des scores, de la détection des erreurs et des effets sur l'identité de l'auteur
Do large language models scrutinise what they review? A multimodal audit of scoring calibration, error detection, and author-identity effects
AI InsightCette étude a systématiquement testé les performances de deux LLM multimodaux lors de l'examen des soumissions à l'ICLR 2026 et a révélé qu'ils sont sensibles à la paternité et aux informations sur les figures et ont des capacités de détection d'erreurs limitées. Par rapport au passé, qui évaluait uniquement le contenu des révisions générées par LLM, cette fois, il a été révélé pour la première fois les limites spécifiques de la révision LLM en termes de biais d'identité et d'erreur d'identification.Importance 82/100