Noticias sobre Multi-Agent Self-Improving RL
1 artículos relacionados
Aprendizaje por refuerzo de mejora personal con múltiples agentes para razonamiento en vídeo
Multi-Agent Self-Improving Reinforcement Learning for Video Reasoning
AI InsightSe propone utilizar Grounder entrenable y Verifier congelado para formar un marco de múltiples agentes en el razonamiento de video, y usar el gradiente de política relativa del grupo para introducir la puntuación del verificador congelado en el entrenamiento. En comparación con el validador anterior, que solo se usaba para la reorganización durante la inferencia, este método permite que el modelo congelado también guíe el entrenamiento, mejorando la capacidad de selección de evidencia temporal sin la necesidad de ajustar el validador.Importancia 68/100