资讯

国产GPU首入CNCF国际开源生态!沐曦携手密瓜智能完成llm-d适配:单卡吞吐5773 tokens/s

驱动之家·2026/9/8 08:04:00🔗 原文

📋总体概括

沐曦联合密瓜智能完成曦云C系列GPU对CNCF托管的开源分布式推理项目llm-d的适配,这是llm-d官方支持的加速器名单中首次出现国产GPU。llm-d由Red Hat发起,构建于vLLM、SGLang与Kubernetes之上,GitHub已获超4400 Star,此前仅支持英伟达GPU、谷歌TPU、AMD GPU、英特尔XPU等海外平台。本次适配验证了单卡(Qwen3-14B,单卡吞吐5773 tokens/s)、八卡(DeepSeek-R1-Distill-Llama-70B,TP=8)及Prefill/Decode分离三条部署路径,打通国产芯片接入生产级云原生推理体系的最后一公里。

关键信息

  • 沐曦曦云C系列GPU正式纳入CNCF托管项目llm-d官方支持名单,为该名单中首个国产GPU
  • llm-d由Red Hat发起,基于vLLM、SGLang与Kubernetes构建,GitHub已获超4400 Star
  • 此前llm-d官方部署指南覆盖英伟达GPU、谷歌TPU、AMD GPU、英特尔XPU等海外平台
  • 单卡路径以Qwen3-14B、TP=1验证,单卡吞吐达5773 tokens/s
  • 八卡路径以DeepSeek-R1-Distill-Llama-70B、TP=8运行,并完成Prefill/Decode分离部署验证

🔥犀利点评

跑分好刷,生态难进。国产GPU最缺的从来不是tokens/s,而是被国际开源社区默认接纳的门票——llm-d这类云原生调度项目才是大模型规模化的真实门槛。沐曦拿到首张门票,象征意义大于单点性能,但别高兴太早:4400 Star的项目话语权仍握在Red Hat们手里,CUDA护城河之外又添一层社区生态壁垒,追赶窗口正在收窄。

本文由本站自动聚合,以下为原始来源:前往 驱动之家 阅读全文