Noticias sobre VLA
3 artículos relacionados
SMILE: Movimiento suave para una ejecución mejorada de VLA a largo plazo
SMILE: Smooth Motion for Improved Long-Horizon VLA Execution
AI InsightSMILE amplía el campo de visión fijo del modelo VLA al predecir coeficientes B-spline y decodificarlos en secuencias de acción suaves, cambiando solo la representación de la acción en lugar de la arquitectura del modelo. En comparación con los métodos anteriores que dependían de modelos más grandes o más llamadas para mejorar la precisión a largo plazo, este método ha mejorado la precisión y amortizado la eficiencia de la inferencia en cuatro líneas de base, incluidas SmolVLA y Evo1. Entre ellos, SMILE-Evo1 alcanzó el 98,0% y una aceleración de 1,1 veces en LIBERO. Esto significa que la representación de movimiento suave B-spline puede convertirse en una mejora general y de bajo costo para la ejecución a largo plazo de VLA.Importancia 72/100DriftingVLA: Generación nativa de visión, lenguaje y acción en un solo paso mediante deriva temporal por dimensión
DriftingVLA: Native One-Step Vision-Language-Action Generation via Per-Dimension Temporal Drifting
AI InsightDriftingVLA propone un modelo nativo de visión, lenguaje y acción de un solo paso, que utiliza objetivos de deriva distribuidos para reemplazar las iteraciones de coincidencia de flujo, y se puede generar un bloque de acción completo en un solo paso hacia adelante. En comparación con el VLA tradicional basado en flujo, que requiere un refinamiento de varios pasos, este método reduce significativamente el retraso del control en línea. La deriva del tiempo por dimensión (PDTD) tiene en cuenta la semántica de control de diferentes dimensiones de acción y proporciona nuevas ideas para la toma de decisiones de los robots en tiempo real.Importancia 65/100Repensar el papel del lenguaje en el VLA eficiente para vehículos autónomos: hacia una conducción más inteligente y confiable
Rethinking Language's Role in Efficient VLA for Autonomous Vehicles: Toward Smarter, Trustworthy Driving
AI InsightEste artículo propone un método de clasificación de residuos de lenguaje, que divide el papel del lenguaje en VLA en cuatro categorías: supervisión de entrenamiento, inferencia potencial, llamada condicional y cuadro por cuadro completo. El cambio principal es cambiar el enfoque de optimización de "si usar el lenguaje" a "cuándo y dónde usar el lenguaje durante la inferencia". Debido a que el costo de inferencia se acumula cuadro por cuadro, el costo de capacitación es único. Esto significa que la optimización de la eficiencia a bordo puede pasar de la arquitectura al diseño de estrategias de inferencia.Importancia 65/100