资讯
国产GPU首入CNCF国际开源生态!沐曦携手密瓜智能完成llm-d适配:单卡吞吐5773 tokens/s
📋总体概括
沐曦联合密瓜智能完成曦云C系列GPU对CNCF托管的开源分布式推理项目llm-d的适配,这是llm-d官方支持的加速器名单中首次出现国产GPU。llm-d由Red Hat发起,构建于vLLM、SGLang与Kubernetes之上,GitHub已获超4400 Star,此前仅支持英伟达GPU、谷歌TPU、AMD GPU、英特尔XPU等海外平台。本次适配验证了单卡(Qwen3-14B,单卡吞吐5773 tokens/s)、八卡(DeepSeek-R1-Distill-Llama-70B,TP=8)及Prefill/Decode分离三条部署路径,打通国产芯片接入生产级云原生推理体系的最后一公里。
⚡关键信息
- ▸沐曦曦云C系列GPU正式纳入CNCF托管项目llm-d官方支持名单,为该名单中首个国产GPU
- ▸llm-d由Red Hat发起,基于vLLM、SGLang与Kubernetes构建,GitHub已获超4400 Star
- ▸此前llm-d官方部署指南覆盖英伟达GPU、谷歌TPU、AMD GPU、英特尔XPU等海外平台
- ▸单卡路径以Qwen3-14B、TP=1验证,单卡吞吐达5773 tokens/s
- ▸八卡路径以DeepSeek-R1-Distill-Llama-70B、TP=8运行,并完成Prefill/Decode分离部署验证
🔥犀利点评
跑分好刷,生态难进。国产GPU最缺的从来不是tokens/s,而是被国际开源社区默认接纳的门票——llm-d这类云原生调度项目才是大模型规模化的真实门槛。沐曦拿到首张门票,象征意义大于单点性能,但别高兴太早:4400 Star的项目话语权仍握在Red Hat们手里,CUDA护城河之外又添一层社区生态壁垒,追赶窗口正在收窄。
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 驱动之家 阅读全文 →