Articles sur VLA
3 articles liés
SMILE : mouvement fluide pour une exécution améliorée du VLA sur long horizon
SMILE: Smooth Motion for Improved Long-Horizon VLA Execution
AI InsightSMILE étend le champ de vision fixe du modèle VLA en prédisant les coefficients B-spline et en les décodant en séquences d'actions fluides, en modifiant uniquement la représentation des actions plutôt que l'architecture du modèle. Par rapport aux méthodes précédentes qui reposaient sur des modèles plus grands ou sur davantage d'appels pour améliorer la précision à long terme, cette méthode a amélioré la précision et amorti l'efficacité de l'inférence sur quatre lignes de base, dont SmolVLA et Evo1. Parmi eux, SMILE-Evo1 a atteint 98,0 % et une accélération de 1,1 fois dans LIBERO. Cela signifie que la représentation du mouvement fluide par spline B peut devenir une amélioration générale et peu coûteuse pour l’exécution à long terme de VLA.Importance 72/100DriftingVLA : génération native de vision, de langage et d'action en une étape via la dérive temporelle par dimension
DriftingVLA: Native One-Step Vision-Language-Action Generation via Per-Dimension Temporal Drifting
AI InsightDriftingVLA propose un modèle natif vision-langage-action en une étape, utilisant des cibles de dérive distribuées pour remplacer les itérations de correspondance de flux, et un bloc d'action complet peut être généré en une seule passe avant. Par rapport au VLA traditionnel basé sur le flux, qui nécessite un raffinement en plusieurs étapes, cette méthode réduit considérablement le délai de contrôle en ligne. La dérive temporelle perdimensionnelle (PDTD) prend en compte la sémantique de contrôle de différentes dimensions d'action et fournit de nouvelles idées pour la prise de décision en temps réel des robots.Importance 65/100Repenser le rôle du langage dans une VLA efficace pour les véhicules autonomes : vers une conduite plus intelligente et plus fiable
Rethinking Language's Role in Efficient VLA for Autonomous Vehicles: Toward Smarter, Trustworthy Driving
AI InsightCet article propose une méthode de classification résiduelle du langage, qui divise le rôle du langage dans VLA en quatre catégories : supervision de la formation, inférence potentielle, appel conditionnel et image par image complète. Le principal changement consiste à déplacer l'accent d'optimisation de « s'il faut utiliser le langage » vers « quand et où utiliser le langage pendant l'inférence ». Étant donné que le coût d'inférence s'accumule image par image, le coût de formation est unique. Cela signifie que l’optimisation de l’efficacité embarquée peut passer de l’architecture à la conception de stratégies d’inférence.Importance 65/100