关于 VLA 的报道
共 3 篇相关报道
SMILE:平滑运动以改进长视野 VLA 执行
SMILE: Smooth Motion for Improved Long-Horizon VLA Execution
AI 洞察SMILE通过预测B样条系数并解码为平滑动作序列,仅改变动作表示而非模型架构,即可延长VLA模型的固定视野。相比此前依赖更大模型或更多调用次数提升长视野精度,该方法在SmolVLA、Evo1等四种基线上均提升准确率和摊销推理效率,其中SMILE-Evo1在LIBERO达到98.0%和1.1倍加速。这意味着B样条平滑动作表示可能成为VLA长视野执行的低成本通用改进手段。核心结论相比此前扩展模型或增加推理,SMILE仅用B样条替换动作表示即提升长视野精度与速度。为什么重要长视野VLA精度下滑常被归因于模型容量,SMILE证明动作表示本身是关键变量,以近零架构改动换取显著效率提升。影响谁- AI 研究者获得一种可插拔的动作表示方法,可在不重训骨干模型的前提下提升长视野VLA效果。
- 机器人研究者真实世界实验中验证了平滑动作序列对执行稳定性的价值,可借鉴到机器人控制流程。
- Vla模型开发者可直接替换动作解码层,以低成本提升LIBERO、CALVIN等基准表现和推理速度。
后续看点观察SMILE是否被后续VLA工作默认采用,以及B样条表示能否推广到更复杂动作空间和更长任务链。重要度 72/100DriftingVLA:通过每维时间漂移生成本机一步视觉-语言-动作
DriftingVLA: Native One-Step Vision-Language-Action Generation via Per-Dimension Temporal Drifting
AI 洞察DriftingVLA 提出原生一步式视觉-语言-动作模型,用分布漂移目标替代流匹配迭代,单次前向即可生成完整动作块。相比传统基于流的 VLA 需多步细化,本方法显著降低在线控制延迟。每维时间漂移(PDTD)兼顾不同动作维度的控制语义,为机器人实时决策提供新思路。核心结论相比流式VLA多步细化,本方法单次前向生成完整动作块。为什么重要降低在线机器人控制延迟,使VLA更适用于真实场景实时决策,有望推动具身智能落地。影响谁- AI 研究者提供一步生成动作块的新范式,可探索分布漂移目标在其他生成任务的应用。
- 机器人开发者单步推理降低计算开销,利于部署到资源受限的机器人平台。
- 具身智能行业加速VLA从离线仿真走向在线真实控制,提升响应速度。
后续看点后续关注真实机器人平台的延迟评测、长动作块生成质量,以及PDTD对高维连续动作的泛化能力。重要度 65/100重新思考语言在自动驾驶汽车高效 VLA 中的作用:迈向更智能、值得信赖的驾驶
Rethinking Language's Role in Efficient VLA for Autonomous Vehicles: Toward Smarter, Trustworthy Driving
AI 洞察本文提出语言残差分类法,将VLA中语言作用分为训练时监督、潜在推理、条件调用和全逐帧四类,核心变化是把优化焦点从'是否用语言'转向'推理时何时何地用语言',因推理成本逐帧累积而训练成本一次性。这意味着车载效率优化可从架构转向推理策略设计。核心结论从关注语言使用转向推理期语言调用的时机与位置。为什么重要自动驾驶车载算力受限,该分类法为降低VLA推理开销提供系统性设计框架,可能影响模型部署路径。影响谁- AI 研究者获得语言在VLA中推理角色分类新视角,可直接沿用此框架做后续实验。
- 自动驾驶开发者可按分类法评估不同推理策略的时延与内存权衡,优化车载方案。
- 汽车制造商了解到VLA部署效率提升的新方向,但实际收益需待工程验证。
后续看点观察后续是否有针对L3/L4类条件调用策略的实证模型或自动驾驶部署测试。重要度 65/100