Articles sur GRPO
3 articles liés
Affectation de crédits rubrique à code pour l'apprentissage par renforcement
Rubric-to-Code Credit Assignment for Reinforcement Learning
AI InsightLe cadre RCCA vise le problème de faible allocation de crédits causé par la distribution uniforme des récompenses au niveau de la séquence dans GRPO lors de la génération de pages Web interactives, et transforme le retour fonctionnel au niveau de la rubrique en signaux d'optimisation locaux pour les zones de code. Cela signifie que le signal d'apprentissage par renforcement est affiné du niveau de séquence grossière au niveau localisé, ce qui améliore directement l'efficacité de la formation dans les scénarios à demandes multiples. Par rapport à l'attribution d'avantages unifiée du précédent GRPO, il s'agit du premier mécanisme explicite permettant de mapper des rubriques fonctionnelles à des extraits de code spécifiques.Importance 75/100Apprendre à partir des invites matérielles : amplification des avantages en fonction des difficultés dans l'échantillonnage dynamique
Learning from Hard Prompts: Difficulty-aware Advantage Amplification in Dynamic Sampling
AI InsightUn nouvel article d'arXiv effectue une analyse théorique de l'échantillonnage dynamique dans DAPO et constate que, bien que son filtrage des réponses tout à fait correctes/toutes fausses élimine les gradients nuls, il ne peut pas utiliser efficacement les échantillons corrects sur des invites difficiles. L'avantage de l'amplification asymétrique entraîne une diminution de l'efficacité de l'entraînement. Cela signifie que la stratégie d’échantillonnage traditionnelle actuelle présente un goulot d’étranglement en matière d’efficacité négligé et nécessite une conception plus fine et tenant compte des difficultés.Importance 62/100Verrouillé à l’entrée, ouvert à l’intérieur : là où RLVR réduit l’espace des solutions
Locked at the Entrance, Open Inside: Where RLVR Narrows the Solution Space
AI InsightBien que RLVR augmente le pass@1, il réduit l'espace de solution politique et le taux de couverture dans la tâche Compte à rebours diminue jusqu'à 67 %. Par rapport à l'accent précédent mis sur le gain de précision du RLVR, c'est la première fois que l'on quantifie sa perte de diversité à l'entrée de la trajectoire, indiquant que les rendements décroissants de l'expansion pendant les tests sont dus à un accès limité à l'espace de solution plutôt qu'à un échec d'exécution.Importance 75/100