Dynamic Sampling に関する報道
関連記事 1 件
ハードプロンプトから学ぶ: 動的サンプリングにおける困難を意識した利点の増幅
Learning from Hard Prompts: Difficulty-aware Advantage Amplification in Dynamic Sampling
AI インサイト新しい arXiv の論文では、DAPO の動的サンプリングの理論的分析を実施し、全正解/全不正解の応答のフィルタリングによってゼロ勾配が排除されるものの、難しいプロンプトでは正しいサンプルを効果的に利用できないことがわかりました。非対称増幅の利点はトレーニング効率の低下につながります。これは、現在の主流のサンプリング戦略には見落とされている効率のボトルネックがあり、よりきめ細かく難易度を意識した設計が必要であることを意味します。重要度 62/100