Multi-Agent Self-Improving RL に関する報道
関連記事 1 件
ビデオ推論のためのマルチエージェントの自己改善型強化学習
Multi-Agent Self-Improving Reinforcement Learning for Video Reasoning
AI インサイトトレーニング可能な Grounder と Frozen Verifier を使用してビデオ推論におけるマルチエージェント フレームワークを形成し、グループ相対ポリシー勾配を使用して Frozen Verifier のスコアをトレーニングに導入することが提案されています。推論中の再配置のみに使用されていた以前のバリデーターと比較して、この方法では、凍結されたモデルがトレーニングをガイドすることもできるため、バリデーターを微調整する必要がなく、一時的な証拠の選択機能が向上します。重要度 68/100