Articles sur Multi-Agent Self-Improving RL
1 articles liés
Apprentissage par renforcement auto-améliorant multi-agents pour le raisonnement vidéo
Multi-Agent Self-Improving Reinforcement Learning for Video Reasoning
AI InsightIl est proposé d'utiliser le Grounder entraînable et le vérificateur gelé pour former un cadre multi-agents de raisonnement vidéo, et d'utiliser le gradient de politique relatif de groupe pour introduire le score du vérificateur gelé dans la formation. Par rapport au validateur précédent, qui n'était utilisé que pour le réarrangement lors de l'inférence, cette méthode permet au modèle gelé de guider également la formation, améliorant ainsi la capacité de sélection des preuves temporelles sans qu'il soit nécessaire d'affiner le validateur.Importance 68/100