Noticias sobre PPO
1 artículos relacionados
Cerrado en la entrada, abierto por dentro: donde RLVR reduce el espacio de la solución
Locked at the Entrance, Open Inside: Where RLVR Narrows the Solution Space
AI InsightAunque RLVR aumenta pass@1, reduce el espacio de solución de políticas y la tasa de cobertura en la tarea Countdown cae hasta en un 67%. En comparación con el enfoque anterior sobre la ganancia de precisión de RLVR, esta es la primera vez que cuantifica su pérdida de diversidad en la entrada de la trayectoria, lo que indica que los rendimientos decrecientes de la expansión durante las pruebas se deben al acceso limitado al espacio de la solución en lugar de a una falla de ejecución.Importancia 75/100