资讯
DeepSeek V4.1重回国产一哥!全新架构非对称Transformer,Engram用上了
📋总体概括
DeepSeek发布V4.1 Flash,跑分重回国产第一。该模型为552B参数MoE,首次采用全新Causal-Encoder-Decoder非对称架构,输入激活仅8B、输出激活16B,成本显著低于同尺寸模型。它是DeepSeek首个原生支持多模态视觉理解的正式版模型,重新预训练并加大强化学习规模。自9月14日起V4 Pro请求将被重路由至该模型,在V4.1 Pro上线前API仅提供此一个模型,Flash跑分甚至超越自家Pro。
⚡关键信息
- ▸DeepSeek V4.1 Flash上线,跑分重回国产一哥,Flash在多数指标上打败自家Pro
- ▸552B参数MoE模型,采用全新Causal-Encoder-Decoder非对称架构,输入激活8B、输出激活16B
- ▸非对称架构使推理成本显著低于已知的同尺寸模型,速度明显更快
- ▸首个原生支持多模态视觉理解的正式版模型,整合此前单独提供的V4 Flash Vision Exp实验版
- ▸9月14日起所有V4 Pro请求重路由至V4.1 Flash,V4.1 Pro上线前API仅提供这一个模型
🔥犀利点评
这次值得点个赞:不是靠堆参数刷榜,而是用架构创新换成本和速度——输入激活8B、输出16B的非对称设计,等于把钱花在刀刃上。Flash打败Pro看似离谱,实则是新架构加更大强化学习的必然结果。但隐患也明显:全线压宝单一模型,V4.1 Pro迟迟不上线,若Flash口碑翻车,DeepSeek连退路都没有,这是自信还是冒险,看接下来一个月的用户反馈便知。
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 华尔街见闻 阅读全文 →