关于 CALVIN 的报道
共 1 篇相关报道
SMILE:平滑运动以改进长视野 VLA 执行
SMILE: Smooth Motion for Improved Long-Horizon VLA Execution
AI 洞察SMILE通过预测B样条系数并解码为平滑动作序列,仅改变动作表示而非模型架构,即可延长VLA模型的固定视野。相比此前依赖更大模型或更多调用次数提升长视野精度,该方法在SmolVLA、Evo1等四种基线上均提升准确率和摊销推理效率,其中SMILE-Evo1在LIBERO达到98.0%和1.1倍加速。这意味着B样条平滑动作表示可能成为VLA长视野执行的低成本通用改进手段。核心结论相比此前扩展模型或增加推理,SMILE仅用B样条替换动作表示即提升长视野精度与速度。为什么重要长视野VLA精度下滑常被归因于模型容量,SMILE证明动作表示本身是关键变量,以近零架构改动换取显著效率提升。影响谁- AI 研究者获得一种可插拔的动作表示方法,可在不重训骨干模型的前提下提升长视野VLA效果。
- 机器人研究者真实世界实验中验证了平滑动作序列对执行稳定性的价值,可借鉴到机器人控制流程。
- Vla模型开发者可直接替换动作解码层,以低成本提升LIBERO、CALVIN等基准表现和推理速度。
后续看点观察SMILE是否被后续VLA工作默认采用,以及B样条表示能否推广到更复杂动作空间和更长任务链。重要度 72/100