📊 深度报告· 9692 字· 约17分钟阅读· 难度⭐

自动驾驶与具身智能:从感知到记忆的能力跃迁

本报告由人工智能生成,仅供研究参考,不构成投资建议。

执行摘要:2026年,自动驾驶产业竞争焦点正从实时感知转向历史信息调用与记忆能力。特斯拉以OTA快节奏持续迭代FSD v14系列,巩固软件定义驾驶的领先姿态;OpenBMB发布SimpleMemVLA验证VLM原生处理时序历史信息的可行性,标志着具身智能与自动驾驶技术路径加速融合。本报告梳理产业格局、产业链结构、数据与竞争要素,并对能力跃迁下的趋势做出判断。

产业现状与竞争格局

一、特斯拉:以小步快跑的OTA节奏持续打磨FSD

特斯拉FSD(完全自动驾驶)自v14系列推送以来,持续以小版本OTA形式进行迭代。近期特斯拉更新了FSD v14.3.11的发布说明,对应软件版本2026.33.5,Not a Tesla App梳理了该版本的官方变更内容。这一版本主要面向已参与FSD推送的用户分批释放,属于v14系列持续迭代链条中的又一环节。

这种“小步快跑”的推送模式是特斯拉区别于传统车企开发范式的核心特征之一。其产业逻辑可归纳为三点:

  • 快节奏交付:不做大规模集中式版本升级,而是通过高频次、小颗粒度的更新持续打磨能力,使功能改进尽快触达用户;
  • 分批灰度释放:面向已参与推送计划的用户逐步开放,在真实道路场景中验证稳定性后再扩大覆盖范围;
  • 数据闭环驱动:每次OTA既是功能交付,也是数据回收与模型验证的节点,形成“推送—反馈—迭代”的循环。

这一模式使FSD的产品形态更接近互联网软件的持续交付逻辑,也对其车端软件工程能力与云端基础设施提出了较高要求。

二、国内赛道:布局分化,头部集中趋势显现

国内自动驾驶与具身智能厂商的布局呈现明显的分化态势:一部分企业聚焦于车端高阶智能驾驶的量产落地,另一部分则切入具身智能赛道,将感知、决策能力迁移至机器人载体。两条路线在技术栈上共享视觉感知、多模态理解等底层能力,但在产品定义、落地场景与商业化路径上差异显著。

从竞争格局看,头部集中趋势已经显现:

  • 资源集中:资金、数据、算力等核心要素向头部企业汇聚,中小玩家在长周期研发投入面前面临更大压力;
  • 场景分化:不同厂商依据自身禀赋选择差异化切入点——或深耕特定场景的Robotaxi与干线物流,或主攻工厂、仓储等结构化环境中的具身智能应用;
  • 技术路径差异:部分厂商延续模块化架构,部分则押注端到端与多模态大模型路线,路线之争仍在进行中。

三、能力竞争的下一步:从“看见”到“记住”

值得关注的是,具身智能的能力竞争正在出现新的方向性变化。OpenBMB近期发布具身智能模型SimpleMemVLA,针对机器人任务中的记忆问题提出新解法:不外挂专门记忆模块,而是将带时间戳的历史视频帧直接交给视觉语言模型(VLM)处理。在Put Back Block测试中,模型在四个初始位置共进行40次测试,成功28次,成功率达70.0%。

该方案验证了让VLM原生处理时序历史信息的可行性,其意义在于:具身智能的核心难点不只是“看见”当下的场景,更在于“记住”并调用历史信息以完成跨时间的任务。这一进展表明,产业竞争的焦点正从实时感知能力,逐步转向记忆调用与长时序推理能力。对于自动驾驶而言,类似的逻辑同样适用——对历史驾驶上下文的理解与调用,正在成为高阶智驾能力差异化的潜在分水岭。

四、格局演进路径

综合来看,特斯拉以持续OTA构建的产品迭代节奏,与国内厂商在具身智能方向的技术探索,共同勾勒出当前产业的两大主线。未来格局的演进可能沿以下路径展开:

本章小结:当前产业处于“快节奏软件迭代”与“能力边界拓展”并行阶段。特斯拉以高频OTA持续压缩迭代周期,国内厂商则面临路线分化与头部集中并存的局面;与此同时,SimpleMemVLA等探索预示着下一阶段竞争将从感知转向记忆,能力维度的跃迁或将成为重塑竞争格局的关键变量。

产业链上游:芯片与传感器

自动驾驶与具身智能的演进,表面上是算法与模型的竞争,底层则是算力芯片与传感器的供给竞争。上游环节构成整条产业链的基础:芯片决定算力上限,传感器决定数据采集质量,二者的供应格局与迭代节奏,直接传导至整机厂商的产品定义与交付节奏。

一、算力芯片:从“够用”到“高冗余”

车载算力芯片经历了从分布式ECU向域控制器、再到中央计算平台的演进。当前主流方案呈现出多路径并行的格局:

  • 高算力通用平台:以英伟达Orin、Thor为代表,凭借成熟的CUDA生态与高算力冗余,成为多数主机厂城市NOA方案的首选;
  • 专用定制芯片:特斯拉FSD芯片、华为昇腾系列等自研路线,通过软硬件协同优化,在特定算法架构下实现更高的算力利用率;
  • 国产中算力方案:地平线征程系列、黑芝麻智能等产品,在中端市场快速渗透,为供应链安全提供了第二选择。

大模型的引入正在重塑算力需求曲线。端到端架构下,感知、决策、规划不再由独立模块承担,而是由统一的神经网络完成,这意味着模型参数规模与训练数据量级大幅提升。参考素材中OpenBMB发布的SimpleMemVLA提示了一个重要趋势:具身智能的竞争正从实时感知转向记忆调用,模型需要原生处理带时间戳的历史视频帧。这类时序信息处理对车载芯片的内存带宽、缓存架构提出了比峰值算力更精细的要求——算力不再是唯一指标,数据搬运效率成为新的瓶颈。

二、传感器:数据采集的“第一公里”

传感器是感知系统的入口,当前呈现多方案并存的状态:

传感器类型主要作用技术趋势
摄像头语义理解、车道识别800万像素渗透,数量增加
毫米波雷达测距测速、恶劣天气补充4D成像雷达上量
激光雷达高精度三维建图成本下探,从高端车型下沉
超声波近距离泊车场景逐渐被视觉方案部分替代

行业内部存在明显的技术路线分歧。特斯拉坚持纯视觉路线,依赖摄像头数据与神经网络能力替代激光雷达;多数国内厂商则采取多传感器融合策略,以冗余换取安全边界。两条路线并无绝对优劣——纯视觉对算力与算法要求更高,多传感器方案则增加了硬件成本与融合复杂度。

值得注意的是,SimpleMemVLA“将历史视频帧直接交给VLM处理”的方案,实际上弱化了对外挂记忆模块的依赖,强化了对摄像头原始数据流的调用需求。这对上游的含义是:摄像头作为数据源的分辨率、帧率与稳定性权重上升,传感器数据链路的带宽设计需要与模型架构同步规划。

三、上游供应格局对整机节奏的影响

上游对整机的影响体现在三个层面:

产品定义层面,芯片算力与传感器配置在车型开发早期即被锁定,硬件预埋策略(先装硬件、后通过软件解锁功能)使主机厂承担了更强的供应链承诺与成本压力。

迭代节奏层面,特斯拉以快节奏OTA方式持续打磨FSD(如v14系列的持续小版本迭代与分批推送),其前提是自研芯片带来的软硬件深度耦合。对于依赖外部芯片供应商的主机厂,OTA节奏还受到芯片工具链、驱动适配周期的约束,上游的版本切换可能成为整机软件升级的隐性瓶颈。

供应安全层面,高端芯片与核心传感器的供应格局集中度较高,地缘因素与产能波动都会传导至下游排产。主机厂普遍采取多供应商策略对冲风险,这也在客观上加速了国产芯片的验证与上车进程。

小结

上游芯片与传感器环节正在经历需求逻辑的重构:从“堆砌峰值算力”转向“算力—带宽—数据的系统平衡”。随着端到端大模型与具身智能对时序记忆能力的要求提升,上游供应的技术规格与供给节奏,将持续成为观察整机厂竞争力的重要先行指标。

产业链中游:模型与算法

端到端成为主流路线

自动驾驶与具身智能的中游环节——模型与算法层,正处于技术范式的集中切换期。以视觉-语言-动作模型为代表的端到端架构,正在替代传统的“感知—规划—控制”分模块管线,成为产业主流路线。这一转变的产业逻辑在于:端到端架构将感知、决策与执行统一到单一可训练的模型中,减少了模块间信息传递的损耗,同时更适配数据驱动的规模化迭代方式。

特斯拉FSD是这一路线的代表性实践。根据Not a Tesla App梳理的官方发布说明,FSD v14.3.11(对应软件版本2026.33.5)是v14系列自推送以来持续迭代的又一版本,面向已参与推送的用户分批释放。特斯拉以快节奏OTA方式持续打磨完全自动驾驶能力,其更新频率本身就体现了端到端范式下“模型持续进化”的产品逻辑——算法能力不再依赖硬件换代,而是通过软件迭代不断逼近上限。

从感知到记忆:算法创新的新边界

端到端模型成熟之后,算法竞争的焦点正在发生迁移。一个值得关注的方向是:机器人真正困难的并非“看见”,而是“记住”。传统方案中,历史信息通常依赖外挂记忆模块处理,架构复杂度高且模块间耦合成本大。

OpenBMB发布的具身智能模型SimpleMemVLA针对这一问题提出了新解法:不外挂专门记忆模块,而是将带时间戳的历史视频帧直接交给视觉语言模型处理,让VLM原生处理时序历史信息。在Put Back Block测试中,四个初始位置共进行40次测试,成功28次,成功率达70.0%。这一结果的核心意义不在于绝对性能数字,而在于其验证了技术可行性——时序记忆可以以原生方式融入VLA架构,而非依赖额外的系统组件。

这指向一个清晰的产业判断:具身智能的竞争维度正从实时感知转向记忆调用。感知能力的边际提升空间逐渐收窄,而记忆能力(对历史场景、交互过程、任务状态的保留与调用)成为决定机器人能否胜任长时序、多阶段任务的关键变量。

中游的产业格局含义

模型与算法层的变化对产业链格局有三方面影响:

第一,竞争壁垒的性质改变。 在分模块时代,壁垒体现为单一模块的算法精度;端到端时代,壁垒转向数据规模、训练基础设施与模型迭代速度。特斯拉的OTA节奏正是这一逻辑的体现——中游能力的差距以软件版本的形式高频显性化。

第二,学术验证与工程落地加速衔接。 SimpleMemVLA从发布即附带标准化的成功率测试(40次测试、70.0%成功率),表明中游算法创新正在以可复现的量化方式接受产业检验,缩短了从论文到产品的路径。

第三,能力边界定义产品边界。 当感知趋于成熟,记忆能力将成为区分“能完成单步动作”与“能执行长程任务”的分水岭。对于机器人厂商而言,中游算法选型(是否原生处理时序信息、如何组织历史数据)将直接影响下游场景的可服务范围。

小结

中游模型与算法层呈现“端到端定架构、记忆能力定上限”的格局。VLA等端到端模型确立主流路线地位,特斯拉FSD的高频迭代展示了该范式下的工程化节奏;SimpleMemVLA则以70.0%的测试成功率验证了时序记忆原生处理的可行性,预示算法创新的重心正从感知向记忆调用延伸。中游的下一阶段竞争,将围绕如何让智能体“记住并调用”历史信息展开。

产业链下游:整车与运营

自动驾驶与具身智能技术的价值兑现,最终发生在产业链下游——整车与运营环节。本章从三个维度展开分析:整车企业以 OTA 为载体的功能交付模式、Robotaxi 与具身机器人的商业化进展,以及决定落地成败的商业模式与用户体验因素。

一、OTA:整车企业持续交付的核心通道

与传统汽车“交付即定型”的模式不同,智能汽车正在转变为“交付即起点”的软件产品。整车远程升级(OTA)已成为头部企业交付自动驾驶能力的标准方式,其产业意义体现在三个层面。

第一,迭代节奏决定竞争力。 以特斯拉 FSD 为例,其 v14 系列自推送以来持续进行小版本迭代,最新更新的 v14.3.11(对应软件版本 2026.33.5)即是一例。这类更新主要面向已参与推送的用户分批释放,反映企业以快节奏 OTA 方式持续打磨完全自动驾驶能力。小步快跑、灰度分发的策略,使企业能够在真实道路场景中不断收集数据、验证能力、修复问题,形成“推送—反馈—迭代”的闭环。

第二,功能交付从一次性购买转向持续订阅。 OTA 使高阶智能驾驶功能具备软件商品属性,车企得以探索订阅制、按需开通等新型收费模式。这改变了整车企业的收入结构,也使消费者与车企的关系从“一锤子买卖”演变为长期服务关系。

第三,OTA 承载着安全责任与监管要求。 涉及驾驶行为的软件升级受到各国监管机构的关注,OTA 推送通常需要履行备案或告知义务。对车企而言,如何在快速迭代与安全合规之间取得平衡,是下游运营的常态化课题。

二、从 Robotaxi 到具身机器人:场景商业化渐次展开

下游商业化的另一条主线是新场景的逐步落地。Robotaxi 是自动驾驶技术商业化最受关注的场景:限定区域运营、安全员逐步减员、车队规模扩张,是当前行业普遍遵循的推进路径。运营方需要在技术成熟度、单经济模型与监管准入之间寻找平衡点——Robotaxi 的规模化不仅取决于技术能力,还取决于城市级别的运营牌照获取、保险与责任界定框架的完善。

具身智能的商业化则呈现出与自动驾驶相似但更早期的发展轨迹。其技术演进的核心正在发生变化:真正困难的不是“看见”,而是“记住”。OpenBMB 发布的具身智能模型 SimpleMemVLA 提供了一个典型案例——该方案不外挂专门记忆模块,而是将带时间戳的历史视频帧直接交给视觉语言模型处理。在 Put Back Block 测试中,四个初始位置共进行 40 次测试,成功 28 次,成功率达 70.0%。这一结果验证了让 VLM 原生处理时序历史信息的可行性,也指示了具身智能竞争的下一步方向:从实时感知转向记忆调用。对下游而言,这意味着机器人要走出实验室、进入家庭与商业场景,记忆与任务理解能力的突破比单纯的感知升级更为关键。

三、商业模式与用户体验:落地的关键变量

技术能力最终要通过商业模式与用户体验转化为商业价值。当前下游呈现三种主要模式:

  • 前装付费 + 订阅升级:车企将高阶智驾作为整车卖点,通过 OTA 持续交付功能升级,以订阅或一次性买断收费;
  • 出行运营服务:以 Robotaxi 为代表,按里程或订单收费,核心竞争力在于车队运营效率与单车成本下降曲线;
  • 场景解决方案:具身机器人面向制造、物流、家庭服务等场景输出能力,收费模式仍在探索中。

用户体验成为这些模式能否成立的检验标准。自动驾驶的“体验分水岭”体现在接管频率、舒适性与可预期性上——用户对系统的信任建立缓慢而崩塌迅速,一次糟糕的体验可能抵消数十次平稳运行积累的口碑。对具身机器人而言,任务成功率(如上述 70% 的测试水平)与真实场景需求之间的差距,正是商业化节奏的直接约束。

四、小结

下游环节正在经历从“卖车”到“卖服务”的结构转变。OTA 使整车成为可持续运营的软件载体;Robotaxi 与具身机器人分别代表出行与物理作业两大商业化方向;而决定落地速度的,已不再单纯是感知与决策的算法能力,而是记忆、运营效率与用户体验的综合比拼。产业竞争的焦点,正从“能否开起来”转向“能否被用户长期信赖并持续付费”。

数据要素与竞争壁垒

自动驾驶与具身智能的竞争逻辑正在发生一次底层切换:当实时感知能力逐渐趋同,时序历史数据与记忆调用能力成为新的差异化变量。本章从技术要素、数据闭环与产业格局三个层面分析这一趋势。

一、从“看见”到“记住”:能力跃迁的数据基础

传统感知范式下,模型依赖单帧或短窗口的实时输入完成任务决策,数据竞争集中于标注图像的规模与多样性。而随着任务复杂度提升——无论是城市级自动驾驶的长时程决策,还是机器人操作中的多步骤任务——模型必须理解“此前发生过什么”。OpenBMB 发布的具身智能模型 SimpleMemVLA 提供了一个典型的技术信号:该方案不外挂专门的记忆模块,而是将带时间戳的历史视频帧直接交由视觉语言模型原生处理。在 Put Back Block 测试中,四个初始位置共进行 40 次测试,成功 28 次,成功率 70.0%。

这一结果有两层含义。其一,验证了 VLM 原生处理时序历史信息的技术可行性,记忆能力可以内生于基础模型而非依赖外部组件;其二,70% 的成功率距离产业化仍有明显差距,而提升空间恰恰取决于历史数据的规模、质量与时间戳的准确性——这直接将模型能力问题转化为数据工程问题。

二、数据闭环:记忆能力的供给体系

记忆与调用能力的上限,由数据闭环体系决定。与静态标注数据不同,时序历史数据具有三个特性:不可回溯性(历史场景错过即流失)、时间戳依赖性(数据的时序完整性决定可用性)、长尾分布性(高价值场景占比低但决定模型边界)。这要求企业构建“数据采集—回传—清洗—训练—验证—再采集”的持续循环。

特斯拉的 FSD 迭代路径是这一闭环的典型样本。以近期 FSD v14.3.11(对应软件版本 2026.33.5)为例,该小版本更新主要面向已参与 FSD 推送的用户分批释放,延续了 v14 系列以来快节奏 OTA 打磨的模式。其产业意义不在于单次更新的内容,而在于背后支撑机制:大规模存量车队持续产生真实场景数据,高频率的版本释放意味着数据回流、训练与验证管道处于稳定运转状态。每一次 OTA 都是一次数据资产的确认与兑现。

三、竞争壁垒的形成逻辑

时序数据要素重塑壁垒的方式体现在三个维度:

规模维度:数据规模不再仅指图像张数,而是“带时间戳的连续行为轨迹”的总量。具备大规模部署终端(车队、机器人)的厂商天然占据采集端优势,且这一优势随部署量增长呈复利式累积。

体系维度:回传体系的工程门槛正在成为隐性壁垒。时序数据的回传涉及带宽成本控制、隐私合规处理、边缘侧筛选等环节,需要硬件、云端与算法团队的深度协同。缺乏回传体系的企业即便拥有模型能力,也难以获得持续的数据供给。

迭代维度:数据闭环的本质是将研发周期压缩为“数据驱动”模式。快节奏小版本迭代(如 FSD v14 系列的持续推送)本质上是数据资产的高频变现——回传数据越快转化为模型更新,用户反馈与数据回流的速度越快,形成正向飞轮。

四、监管与合规约束下的数据格局

需要客观指出的是,数据壁垒的构建受到监管框架的现实约束。数据回传与跨境流动、采集行为合规性、隐私保护要求等,均在主要市场形成制度边界。这为数据要素竞争引入了博弈维度:一方面,合规成本抬高行业门槛,客观上有利于体系完善的企业;另一方面,不同市场对数据本地化与传输规则的要求,可能推动数据资产呈现区域化特征,全球统一数据池的假设面临调整。企业需要在合规框架内设计回传体系,这已成为与算法能力同等重要的工程命题。

小结

SimpleMemVLA 的技术验证与 FSD 的持续 OTA 迭代,从两端指向同一结论:竞争的焦点正从感知算法转向记忆与调用能力,而这一能力的供给体系是时序历史数据与数据闭环。数据规模决定能力的上限,回传体系决定能力的迭代速度,合规能力决定壁垒的可持续性。三者叠加,使数据要素成为本阶段自动驾驶与具身智能竞争中最核心、也最难被短期复制的护城河。

趋势判断与展望

自动驾驶与具身智能的技术演进,正在经历一次方向性的转变:竞争的重心从“看得见”转向“记得住”。感知能力的持续提升使实时环境理解逐渐成为行业标配,而真正拉开差距的,是系统对历史信息的组织、存储与调用能力——即记忆。与此同时,端到端架构与具身智能的融合正在加速,数据闭环与OTA迭代效率将成为决定厂商分化速度的核心变量。

一、从实时感知到记忆调用

实时感知解决的是“当下在哪里、有什么”的问题,但大量真实任务依赖对时间序列信息的理解:物体被移动过、指令发生在若干秒前、场景存在临时变化。OpenBMB 发布的具身智能模型 SimpleMEM VLA 提供了一个有代表性的观察样本:该方案不外挂专门记忆模块,而是将带时间戳的历史视频帧直接交给视觉语言模型原生处理。在 Put Back Block 测试中,四个初始位置共进行 40 次测试,成功 28 次,成功率 70.0%。这一结果验证了让 VLM 原生处理时序历史信息的技术可行性,也指向了一个清晰的产业信号:记忆调用能力正在成为具身智能的下一个竞争焦点。

对自动驾驶而言,这一趋势同样成立。路口的历史通行模式、常驻障碍物的位置变化、与特定交通参与者的长期交互经验,都属于超出单帧感知范畴的信息。谁能高效地将时序经验沉淀为可调用的记忆,谁就能在长尾场景中取得更高上限。

二、端到端与具身智能的融合加速

端到端架构的普及压缩了传统模块化流水线,使数据驱动的能力提升路径更加直接;而具身智能对“感知—决策—行动—记忆”闭环的需求,正在反过来推动端到端系统引入时序与记忆机制。两条技术路线的融合体现在三个层面:

  • 架构层面:VLA(视觉-语言-动作)模型成为共同的技术底座,SimpleMEM VLA 展示的“原生处理时序历史”即是融合方向的代表;
  • 数据层面:车辆与机器人产生的交互数据具有相似的结构化价值,闭环采集、清洗、回训的基础设施可以复用;
  • 场景层面:L2+量产车队的规模化部署为具身智能提供了低成本的数据来源与验证场。

三、OTA迭代频率与数据闭环效率决定分化速度

以特斯拉为例,FSD v14.3.11(对应软件版本 2026.33.5)是 v14 系列自推送以来持续迭代的又一小版本,主要面向已参与推送的用户分批释放。这种“快节奏、小步快跑”的OTA模式,本质上是数据闭环效率的外在表现:车队规模决定数据获取速度,回训管线决定数据转化为能力的周期,OTA基础设施决定能力触达用户的时间。三者共同构成一个飞轮——飞轮转速的差异,将在未来两年内显著放大头部与跟随者之间的能力差距。

四、趋势判断

基于当前的技术信号与产业实践,本章提出以下判断:

1. 记忆能力将成为2026年后的核心分水岭。实时感知的边际收益递减,具备时序记忆的模型将在长尾场景成功率上形成代差。

2. 端到端与VLA路线加速收敛。车载自动驾驶与机器人具身智能将共享模型底座与数据闭环,跨领域布局的厂商将获得结构性优势。

3. OTA频率是可观测的分化指标。更新节奏、推送覆盖速度与版本迭代质量,是外部观察厂商数据闭环健康度的最直接窗口。

4. 数据合规与安全监管将持续完善。随着车队数据规模扩大,数据采集、跨境流动与训练使用的监管框架将日趋严格,合规能力将成为数据闭环的隐性门槛,厂商需在效率与合规之间取得平衡。

总体而言,产业正在从“感知军备竞赛”过渡到“记忆与闭环效率的体系化竞争”。胜负手不再只是单点模型性能,而是数据、模型、迭代、合规四要素构成系统能力的整体水位。

📚 参考素材(撰写本文时引用的相关资讯,绿色徽标=相关度评分)

以下2条资讯与本报告主题高度相关,构成本报告的事实基础。

  • •

    OpenBMB 发布具身智能模型 SimpleMemVLA,针对机器人任务中的记忆问题提出新解法:不外挂专门记忆模块,而是将带时间戳的历史视频帧直接交给视觉语言模型处理。在 Put Back Block 测试中,四个初始位置共进行 40 次

    — 资讯
  • •

    特斯拉更新了FSD v14.3.11的发布说明,对应软件版本2026.33.5。Not a Tesla App梳理了该更新的官方变更内容,这是FSD自v14系列推送以来持续迭代的又一小版本,主要面向已参与FSD推送的用户分批释放,反映特斯拉

    — 资讯