Articles sur Large Vision-Language Models
1 articles liés
Sous-titrage d'image contrôlable avec récompenses de scène conditionnées par des invites
Controllable Image Captioning with Prompt-Conditioned Scene Rewards
AI InsightFoCUS fait progresser le « contrôle de l'orientation des sous-titres » de l'ingénierie rapide à l'optimisation explicite basée sur les récompenses des graphiques de scène, ce qui signifie que la granularité du contrôle des sous-titres d'images passe de sujets grossiers à une sémantique au niveau des objets, des attributs et des relations. Si la généralisation réussit, l’interprétabilité et la contrôlabilité des systèmes multimodaux ne reposeront plus sur un alignement accidentel des modèles.Importance 58/100