产业观察

BAT 集体重做「AI 预训练」,补「脏数据」的坑

雷峰网·2026/9/24 01:43:00🔗 原文

📋总体概括

近半年国内多家头部AI模型厂商(BAT等)密集启动预训练返工,核心原因指向训练数据质量问题。有厂商此前花一年死磕万亿参数大模型,落地表现却被市面上仅1%规模的小模型倒挂,排查后发现是脏数据拖了后腿。这场集体重做预训练的浪潮,暴露出国内大模型行业从拼参数规模转向拼数据质量的拐点,数据清洗与治理能力正取代算力成为新的竞争壁垒。

关键信息

  • 近大半年国内一批AI模型厂商密集启动「预训练返工」,起因均指向训练数据质量不行
  • 有厂商花一年死磕万亿参数模型,落地表现却被市面上1%规模的小模型倒挂
  • 排查结果显示,大模型表现不及预期是被脏数据拖了后腿
  • 行业竞争焦点正从参数规模转向数据清洗与治理能力

🔥犀利点评

这个信号比任何发布会都诚实:万亿参数打不过1%规模的小模型,问题从来不在模型架构,而在喂进去的东西。国内大模型行业烧了一年算力,最后发现输在数据这层最脏的地基上。返工是好事,说明行业终于肯承认规模叙事破产。接下来真正的壁垒不是卡,是数据工程能力,这一课躲不掉。

本文由本站自动聚合,以下为原始来源:前往 雷峰网 阅读全文