资讯

智谱新模型“牛来”跑在10万国产卡上,SemiAnalaysis评价“英伟达护城河再受考验”

华尔街见闻·2026/8/27 00:22:51🔗 原文

📌 概要

<p style="text-align: left;">8月26日,智谱正式确认:此前在开发者社区引发热议的匿名模型Ox Alpha(中文社区称“牛来”),就是其最新发布的GLM-5.3-Flash。模型代号灵感来源于国内近期热映电影《牛来》。</p> <p style="text-align: left;">这个模型在正式亮相前,以匿名形式在OpenRouter和OpenCode上免费开放测试

<p style="text-align: left;">8月26日,智谱正式确认:此前在开发者社区引发热议的匿名模型Ox Alpha(中文社区称“牛来”),就是其最新发布的GLM-5.3-Flash。模型代号灵感来源于国内近期热映电影《牛来》。</p> <p style="text-align: left;">这个模型在正式亮相前,以匿名形式在OpenRouter和OpenCode上免费开放测试,5天内流量累计超过50万亿token,刷新了两个平台的流量增长纪录,当前使用量已超过DeepSeek的两倍以上。但真正引发市场关注的,是智谱随后披露的一个细节:<strong>这些流量,全部由国产芯片承载。</strong></p> <p style="text-align: left;">智谱在官方技术文档中表示,<strong>调用超过10万张国产芯片集群用于该模型推理服务</strong>,“硬件效率及单token成本已经达到了与主流英伟达GPU相当的水平”。</p> <p style="text-align: left;">半导体研究机构SemiAnalysis随即在X平台发文评论:“<strong>所有流量均由国产芯片承载,硬件效率和单token成本已可与英伟达GPU相媲美。继Jalapeño(OpenAI自研推理芯片)昨日宣布之后,CUDA护城河再度受到考验。”</strong></p> <p style="text-align: left;"><img class=" wscnph" src="https://wpimg-wscn.awtmt.com/ca95060f-7194-4a22-bc7e-30cf7de2b6b5.png" /></p> <h2 style="text-align: left;">10万张国产卡:从测试到生产</h2> <p style="text-align: left;">智谱在技术文档中描述了这套国产芯片集群的部署细节。</p> <p style="text-align: left;">单张芯片的主要瓶颈在于内存容量与带宽,支持长达100万token的上下文长度尤为困难。为此,智谱在SGLang基础上构建了专用推理引擎,采用W8A8量化、INT8/FP8/BF16混合缓存量化,以及节点内张量并行等技术,并引入生产级Encode–Prefill–Decode(EPD)分离式架构,将多模态编码、prompt预填充和逐token解码拆分为可独立调度的工作池。</p> <p style="text-align: left;">智谱称,与同一硬件上的初始基线相比,端到端服务性能提升了3倍。</p> <p style="text-align: left;">据《晚点LatePost》了解,<strong>这批芯片的供应商或来自华为、摩尔线程与海光。智谱官方对此未予置评,技术文档中也未明确具体芯片型号。</strong></p> <p style="text-align: left;">SemiAnalysis在评论中特别指出,此前有观点认为只有顶级前沿实验室才具备每日100万亿token的算力规模,“而这里每日100万亿token的免费流量,全部跑在国产芯片上。”</p> <p style="text-align: left;"><img class=" wscnph" src="https://wpimg-wscn.awtmt.com/a1b49692-dfaa-445b-abb0-14b16fff2229.png" /></p> <h2 style="text-align: left;">模型本身:对标DeepSeek,定价是Claude Opus 4.8的1/40</h2> <p style="text-align: left;">GLM-5.3-Flash的参数规模为320B总参数,激活参数18B,参数量约为上一代旗舰GLM-5.3的40%,与DeepSeek V4 Flash几乎持平。</p> <p style="text-align: left;">性能方面,智谱官方评测显示,GLM-5.3-Flash在Artificial Analysis Intelligence Index(AA综合智能指数)中取得57分,超过上一代旗舰GLM-5.2,与Anthropic的Claude Opus 4.8持平,也高于DeepSeek旗舰模型V4 Pro正式版的53分。</p> <p style="text-align: left;"><img class=" wscnph" src="https://wpimg-wscn.awtmt.com/4f9bfe35-a63c-4b76-8a54-6da04d9062f7.png" /></p> <p style="text-align: left;">定价方面,GLM-5.3-Flash每百万token输入0.8元,输出2.8元,缓存命中价格0.23元,为GLM-5.3的十分之一。上线前两周实行半价。</p> <p style="text-align: left;"><strong>智谱表示,GLM-5.3-Flash定价为GLM-5.3的1/10,限时折扣内为GLM-5.3的1/20,为Claude Opus 4.8的1/40。</strong></p> <p style="text-align: left;">与调价后的DeepSeek V4 Flash相比(谷时输入1.5元、输出4.5元),GLM-5.3-Flash在绝大多数常规调用场景下更便宜。</p> <p style="text-align: left;"><img class=" wscnph" src="https://wpimg-wscn.awtmt.com/d0dba9d5-7bec-4b63-8206-ca593294b79d.png" /></p> <h2 style="text-align: left;">架构创新:激活参数和层数近乎减半</h2> <p style="text-align: left;">GLM-5.3-Flash采用了与GLM-5.3完全不同的架构设计,这也是其能够以更低成本实现更高性能的核心原因。</p> <p style="text-align: left;">与GLM-4.5相比,GLM-5.3-Flash总参数量相近(355B vs. 320B),但激活参数量从32B降至18B,层数从92层减至45层,几乎减半。</p> <p style="text-align: left;">智谱称,GLM-5.3-Flash是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型。相较于GLM-5.3,其注意力计算量与KV缓存大小分别降低了3.01倍和4.44倍。</p> <p style="text-align: left;">此外,该模型是GLM-5系列首个原生多模态模型,支持图像和视频输入,也是智谱战略聚焦coding以来首次推出具备多模态能力的新模型。</p> <p style="text-align: left;"><img class=" wscnph" src="https://wpimg-wscn.awtmt.com/391e49b2-92ce-4e3f-be8c-8896e7e07cb6.png" /></p> <h2 style="text-align: left;">涨价潮中的低价突围</h2> <p style="text-align: left;">GLM-5.3-Flash的发布,发生在中国AI模型市场一轮集体涨价之后。</p> <p style="text-align: left;">Kimi K3输出价格高达每百万token 100元,超过前代K2.6三倍以上;智谱上半年提价后输出价格也达到28元;DeepSeek V4 Pro从6元涨至13.5元,高峰时段27元;DeepSeek V4 Flash输出价格从2元涨至4.5元,高峰时段9元。</p> <p style="text-align: left;">涨价的直接后果是需求外溢。《晚点LatePost》指出,DeepSeek V4 Flash提价后,在OpenCode平台上的调用量下滑了一半,这部分需求成为国产模型厂商新的增长空间。</p> <p style="text-align: left;">GLM-5.3-Flash的定价策略,正是瞄准了这一缺口。</p><div style="color: #666; margin-bottom: 15px;">风险提示及免责条款</div> <div> 市场有风险,投资需谨慎。本文不构成个人投资建议,也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资,责任自负。 </div>