资讯
DeepSeek V4.1 Flash正式发布:性能全面超越V4 Pro 成本更低
📋总体概括
深度求索于9月10日发布全新模型DeepSeek V4.1 Flash,属于其新一代模型结构系列中尺寸最小的一款,原生支持多模态视觉理解。该模型采用552B参数MoE架构,引入全新的Causal-Encoder-Decoder结构,输入侧仅激活8B参数、输出侧激活16B参数的不对称设计,使推理成本显著低于同尺寸模型。官方基准测试显示其多项成绩超越包括DeepSeek V4 Pro在内的旗舰模型。新架构还为后续扩展至更大参数规模模型奠定基础。
⚡关键信息
- ▸深度求索9月10日发布DeepSeek V4.1 Flash,为全新模型结构系列中尺寸最小的模型,原生支持多模态视觉理解
- ▸模型采用552B参数MoE架构,引入全新的Causal-Encoder-Decoder结构
- ▸输入输出不对称设计:输入侧仅激活8B参数,输出侧激活16B参数,推理成本显著低于已知同尺寸模型
- ▸官方基准测试显示,V4.1 Flash多项测试超越包括DeepSeek V4 Pro在内的旗舰模型
- ▸新结构设计目标是提升能力上限、加快推理速度并提高吞吐,为更大参数规模模型扩展打基础
🔥犀利点评
小参数激活量打平甚至超越自家旗舰,这是把MoE玩法又推进了一步——不对称激活结构说明DeepSeek已经不满足于堆参数,而是开始重新设计推理经济学。对下游应用方来说,低成本高性能意味着智驾座舱、端侧多模态这类对成本极度敏感的场景又多了一个现实选项。当然,官方自测数据要看第三方实测再下结论,但架构创新方向本身已足够搅动行业。
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 驱动之家 阅读全文 →