VLA に関する報道
関連記事 3 件
SMILE: 長期的な VLA の実行を向上させるスムーズなモーション
SMILE: Smooth Motion for Improved Long-Horizon VLA Execution
AI インサイトSMILE は、B スプライン係数を予測し、それらをスムーズなアクション シーケンスにデコードすることで、VLA モデルの固定視野を拡張し、モデル アーキテクチャではなくアクション表現のみを変更します。長期視点の精度を向上させるために大規模なモデルやより多くの呼び出しに依存していた以前の方法と比較して、この方法では精度が向上し、SmolVLA や Evo1 を含む 4 つのベースラインでの償却推論効率が向上しました。中でもSMILE-Evo1はLIBEROで98.0%、加速1.1倍に達しました。これは、B スプラインの滑らかなモーション表現が、VLA のロングビュー実行に対する低コストで一般的な改善となる可能性があることを意味します。重要度 72/100DriftingVLA: 次元ごとの時間的ドリフトによるネイティブのワンステップのビジョン、言語、アクションの生成
DriftingVLA: Native One-Step Vision-Language-Action Generation via Per-Dimension Temporal Drifting
AI インサイトDriftingVLA は、分散ドリフト ターゲットを使用してフロー マッチング反復を置き換えるネイティブ ワンステップ ビジョン-言語-アクション モデルを提案しており、完全なアクション ブロックは単一のフォワード パスで生成できます。複数段階の調整が必要な従来のフローベースの VLA と比較して、この方法はオンライン制御の遅延を大幅に削減します。次元ごとの時間ドリフト (PDTD) は、さまざまな動作次元の制御セマンティクスを考慮に入れ、ロボットのリアルタイムの意思決定に新しいアイデアを提供します。重要度 65/100自動運転車の効率的な VLA における言語の役割を再考する: よりスマートで信頼できる運転に向けて
Rethinking Language's Role in Efficient VLA for Autonomous Vehicles: Toward Smarter, Trustworthy Driving