Noticias sobre On-Policy Distillation
1 artículos relacionados
Cuando la orientación docente es engañosa: destilación de políticas alineadas con recompensas
When Teacher Guidance Misleads: Reward-Aligned On-Policy Distillation
AI InsightLas investigaciones han descubierto que la orientación del modelo docente sobre la generación de prefijos para los estudiantes en OPD puede desviarse de las recompensas de resultados, lo que induce a error en la optimización. En comparación con el modelo anterior en el que las señales de destilación de los docentes eran confiables, esta vez los riesgos están claramente alineados y se proponen objetivos alternativos con recompensas consistentes, cambiando la percepción de la estabilidad de la capacitación de destilación.Importancia 65/100