自动驾驶🔥8.0
机器人真正难的,不是看见,是记住|SimpleMemVLA
📋总体概括
OpenBMB 发布具身智能模型 SimpleMemVLA,针对机器人任务中的记忆问题提出新解法:不外挂专门记忆模块,而是将带时间戳的历史视频帧直接交给视觉语言模型处理。在 Put Back Block 测试中,四个初始位置共进行 40 次测试,成功 28 次,成功率 70.0%。该方案验证了让 VLM 原生处理时序历史信息的可行性,指向具身智能竞争从实时感知转向记忆调用的下一步方向。
⚡关键信息
- ▸OpenBMB 推出 SimpleMemVLA,未采用外挂记忆模块的技术路线
- ▸核心方法是把带时间戳的历史视频直接输入视觉语言模型
- ▸Put Back Block 测试中 40 次测试成功 28 次,成功率 70.0%
- ▸测试场景:机器人按按钮后垫子清空,仍需将积木放回原位
- ▸结论指向具身智能竞争焦点从眼前识别转向历史画面的正确调用
🔥犀利点评
70% 的成功率本身不算惊艳,但这条技术路线值得盯住:不堆记忆模块,而是让 VLM 直接吃时间戳视频,本质是在赌多模态模型的上下文能力会随着基座一起进化。如果赌对了,外挂记忆方案就是过渡产品;如果赌错了,长视频 token 消耗会先把它压垮。现在的具身智能都在卷『看得见』,SimpleMemVLA 至少把问题问对了——机器人缺的不是眼睛,是海马体。
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 Bili-科技 阅读全文 →