GRPO に関する報道
関連記事 3 件
強化学習のためのルーブリックからコードへの単位の割り当て
Rubric-to-Code Credit Assignment for Reinforcement Learning
AI インサイトRCCA フレームワークは、インタラクティブな Web ページ生成における GRPO のシーケンス レベルの報酬の一様な分布によって引き起こされる弱いクレジット割り当ての問題を目的としており、ルーブリック レベルの関数フィードバックをコード領域のローカル最適化信号に変換します。これは、強化学習信号が粗粒シーケンス レベルから局所レベルに洗練されることを意味し、これにより、マルチデマンド シナリオでのトレーニング効率が直接的に向上します。以前の GRPO の統一された利点の割り当てと比較して、これは機能ルーブリックを特定のコード スニペットにマッピングする最初の明示的なメカニズムです。重要度 75/100ハードプロンプトから学ぶ: 動的サンプリングにおける困難を意識した利点の増幅
Learning from Hard Prompts: Difficulty-aware Advantage Amplification in Dynamic Sampling
AI インサイト新しい arXiv の論文では、DAPO の動的サンプリングの理論的分析を実施し、全正解/全不正解の応答のフィルタリングによってゼロ勾配が排除されるものの、難しいプロンプトでは正しいサンプルを効果的に利用できないことがわかりました。非対称増幅の利点はトレーニング効率の低下につながります。これは、現在の主流のサンプリング戦略には見落とされている効率のボトルネックがあり、よりきめ細かく難易度を意識した設計が必要であることを意味します。重要度 62/100入口はロック、中はオープン:RLVR がソリューション スペースを狭める場所
Locked at the Entrance, Open Inside: Where RLVR Narrows the Solution Space
AI インサイトRLVR は pass@1 を増加させますが、ポリシー ソリューション スペースは縮小し、カウントダウン タスクのカバレッジ率は最大 67% 低下します。以前に RLVR の精度向上に焦点を当てたのと比較して、軌道入口でのダイバーシティ損失を初めて定量化しました。これは、テスト中の拡張の利益逓減が、実行の失敗ではなく、解空間へのアクセスの制限によるものであることを示しています。重要度 75/100