自动驾驶🔥8.0

机器人真正难的,不是看见,是记住|SimpleMemVLA

Bili-科技·2026/10/7 05:46:16🔗 原文

📋总体概括

OpenBMB 发布具身智能模型 SimpleMemVLA,针对机器人任务中的记忆问题提出新解法:不外挂专门记忆模块,而是将带时间戳的历史视频帧直接交给视觉语言模型处理。在 Put Back Block 测试中,四个初始位置共进行 40 次测试,成功 28 次,成功率 70.0%。该方案验证了让 VLM 原生处理时序历史信息的可行性,指向具身智能竞争从实时感知转向记忆调用的下一步方向。

⚡关键信息

  • ▸OpenBMB 推出 SimpleMemVLA,未采用外挂记忆模块的技术路线
  • ▸核心方法是把带时间戳的历史视频直接输入视觉语言模型
  • ▸Put Back Block 测试中 40 次测试成功 28 次,成功率 70.0%
  • ▸测试场景:机器人按按钮后垫子清空,仍需将积木放回原位
  • ▸结论指向具身智能竞争焦点从眼前识别转向历史画面的正确调用

🔥犀利点评

70% 的成功率本身不算惊艳,但这条技术路线值得盯住:不堆记忆模块,而是让 VLM 直接吃时间戳视频,本质是在赌多模态模型的上下文能力会随着基座一起进化。如果赌对了,外挂记忆方案就是过渡产品;如果赌错了,长视频 token 消耗会先把它压垮。现在的具身智能都在卷『看得见』,SimpleMemVLA 至少把问题问对了——机器人缺的不是眼睛,是海马体。

本文由本站自动聚合,以下为原始来源:前往 Bili-科技 阅读全文 →