Noticias sobre DAPO
1 artículos relacionados
Aprender de indicaciones difíciles: amplificación de ventajas consciente de la dificultad en muestreo dinámico
Learning from Hard Prompts: Difficulty-aware Advantage Amplification in Dynamic Sampling
AI InsightUn nuevo artículo de arXiv realiza un análisis teórico del muestreo dinámico en DAPO y descubre que, aunque su filtrado de respuestas correctas/incorrectas elimina los gradientes cero, no puede utilizar de manera efectiva muestras correctas en indicaciones difíciles. La ventaja de la amplificación asimétrica conduce a una disminución de la eficiencia del entrenamiento. Esto significa que la actual estrategia de muestreo convencional tiene un cuello de botella de eficiencia que se pasa por alto y requiere un diseño más detallado que tenga en cuenta las dificultades.Importancia 62/100