Noticias sobre GRPO
3 artículos relacionados
Asignación de créditos de rúbrica a código para el aprendizaje por refuerzo
Rubric-to-Code Credit Assignment for Reinforcement Learning
AI InsightEl marco RCCA apunta al problema de asignación de crédito débil causado por la distribución uniforme de recompensas a nivel de secuencia en GRPO en la generación de páginas web interactivas, y transforma la retroalimentación funcional a nivel de rúbrica en señales de optimización local para áreas de código. Esto significa que la señal de aprendizaje por refuerzo se refina desde el nivel de secuencia de grano grueso hasta el nivel localizado, lo que mejora directamente la eficiencia del entrenamiento en escenarios de múltiples demandas. En comparación con la asignación unificada de ventajas del GRPO anterior, este es el primer mecanismo explícito para asignar rúbricas funcionales a fragmentos de código específicos.Importancia 75/100Aprender de indicaciones difíciles: amplificación de ventajas consciente de la dificultad en muestreo dinámico
Learning from Hard Prompts: Difficulty-aware Advantage Amplification in Dynamic Sampling
AI InsightUn nuevo artículo de arXiv realiza un análisis teórico del muestreo dinámico en DAPO y descubre que, aunque su filtrado de respuestas correctas/incorrectas elimina los gradientes cero, no puede utilizar de manera efectiva muestras correctas en indicaciones difíciles. La ventaja de la amplificación asimétrica conduce a una disminución de la eficiencia del entrenamiento. Esto significa que la actual estrategia de muestreo convencional tiene un cuello de botella de eficiencia que se pasa por alto y requiere un diseño más detallado que tenga en cuenta las dificultades.Importancia 62/100Cerrado en la entrada, abierto por dentro: donde RLVR reduce el espacio de la solución
Locked at the Entrance, Open Inside: Where RLVR Narrows the Solution Space
AI InsightAunque RLVR aumenta pass@1, reduce el espacio de solución de políticas y la tasa de cobertura en la tarea Countdown cae hasta en un 67%. En comparación con el enfoque anterior sobre la ganancia de precisión de RLVR, esta es la primera vez que cuantifica su pérdida de diversidad en la entrada de la trayectoria, lo que indica que los rendimientos decrecientes de la expansión durante las pruebas se deben al acceso limitado al espacio de la solución en lugar de a una falla de ejecución.Importancia 75/100