资讯

DeepSeek V4.1重回国产一哥!全新架构非对称Transformer,Engram用上了

华尔街见闻·2026/9/10 10:49:16🔗 原文

📋总体概括

DeepSeek发布V4.1 Flash,跑分重回国产第一。该模型为552B参数MoE,首次采用全新Causal-Encoder-Decoder非对称架构,输入激活仅8B、输出激活16B,成本显著低于同尺寸模型。它是DeepSeek首个原生支持多模态视觉理解的正式版模型,重新预训练并加大强化学习规模。自9月14日起V4 Pro请求将被重路由至该模型,在V4.1 Pro上线前API仅提供此一个模型,Flash跑分甚至超越自家Pro。

关键信息

  • DeepSeek V4.1 Flash上线,跑分重回国产一哥,Flash在多数指标上打败自家Pro
  • 552B参数MoE模型,采用全新Causal-Encoder-Decoder非对称架构,输入激活8B、输出激活16B
  • 非对称架构使推理成本显著低于已知的同尺寸模型,速度明显更快
  • 首个原生支持多模态视觉理解的正式版模型,整合此前单独提供的V4 Flash Vision Exp实验版
  • 9月14日起所有V4 Pro请求重路由至V4.1 Flash,V4.1 Pro上线前API仅提供这一个模型

🔥犀利点评

这次值得点个赞:不是靠堆参数刷榜,而是用架构创新换成本和速度——输入激活8B、输出16B的非对称设计,等于把钱花在刀刃上。Flash打败Pro看似离谱,实则是新架构加更大强化学习的必然结果。但隐患也明显:全线压宝单一模型,V4.1 Pro迟迟不上线,若Flash口碑翻车,DeepSeek连退路都没有,这是自信还是冒险,看接下来一个月的用户反馈便知。

本文由本站自动聚合,以下为原始来源:前往 华尔街见闻 阅读全文