On-Policy Distillation に関する報道
関連記事 1 件
教師の指導が誤解を招く場合: 報酬に合わせたポリシーに沿った抽出
When Teacher Guidance Misleads: Reward-Aligned On-Policy Distillation
AI インサイト研究によると、OPD での生徒向けのプレフィックス生成に関する教師モデルのガイダンスが、結果の報酬から逸脱し、それによって最適化の誤解を招く可能性があることが判明しました。教師の蒸留信号が信頼できるという以前のデフォルトと比較して、今回はリスクが明確に調整され、一貫した報酬を伴う代替目標が提案され、蒸留トレーニングの安定性に対する認識が変わりました。重要度 65/100