国产GPU行业,终于摆脱了“纸上谈兵”。
过去大家拼参数、拼算力、拼跑分,看似数据吊打,落地却处处碰壁。
最核心的问题一直没解决:企业砸几十亿买的英伟达算力,怎么办?换不起、扔可惜、用不好。
近期摩尔线程发布的《MTT S5000 Prefill as a Service》白皮书,直接换了一套全新玩法。
不靠参数内卷,不搞强制替代。只用一套异构分工方案,成本砍百万级、推理产能翻5倍、老设备直接提速。
这也是目前国产GPU最接地气、最能赚钱的落地思路。
为什么你的AI算力,一直在白白浪费?
先讲一个所有人都懂的大模型逻辑。
AI回答问题,只有两步:
● Prefill(预填充):一口气读完几万字长文本,重度算力活,累、耗性能、最烧钱。
● Decode(解码):一个字一个字输出答案,重度带宽活,拼速度、拼稳定。
这两步,需要的硬件能力完全不一样。
但现在行业主流操作是:用最贵的高端英伟达卡,全包所有工作。
相当于让大厨既要炒菜、又要端菜。
全力炒菜时,传菜的能力闲置;全力传菜时,炒菜的火力空转。
这就是所有AI公司的隐形亏损:算力错配、高价低配、资源大量浪费。
尤其是现在长文本、AI代理、代码生成普及,读写比例极度失衡,很多场景预处理压力是输出的154倍。
最贵的算力,一直在干最重复的粗活。
摩尔线程破局:PD分离,各司其职
解决办法很简单:专业的事,交给专业的卡。
摩尔线程这套PD分离方案,核心就两件事:
✅ 摩尔线程S5000:包揽最烧钱、最重负载的Prefill预处理。
✅ 原有英伟达显卡:专注流畅输出Decode解码。
不替换、不拆除、不重做、不换架构。新旧设备协同干活,存量资产全部盘活。
很多人问:为什么只有摩尔线程能做好这种异构搭配?
核心底牌:原生FP8格式对齐。
跨芯片协作最大的难题是“语言不通”。
普通国产卡需要软件转格式,延迟飙升、精度受损、画面卡顿。
而S5000原生适配英伟达主流架构格式,数据传输无需转换、零损耗、毫秒级对接。
无缝衔接,即插即用,这才是能商用的硬实力。
成本大降,产能直接翻5倍
不谈虚参数,只谈真金白银的收益。
传统纯英伟达B300同构方案,单台成本高达1400万,资源浪费严重。
换成 S5000+B300 异构组合:
4-5台S5000,就能顶1台B300的预处理能力,整套硬件投入直接省下数百万。
成本降低,只是基础;产能翻倍,才是杀手锏。
这套方案已在智谱AI商用落地,真实生产环境验证:整体Token产能提升5倍。
意味着:花更少的钱,接更多的单,赚更多的利润。
▶ 性能表现同样能打:
64K超长文本场景,吞吐高达95920 tok/s;哪怕拉到400K极限长文本,延迟依旧稳定可控。
不用盲目堆硬件、不用过度预留缓冲,收益稳定可预期。
再看最直观的营收账:
单台S5000满载月收入最高可达64.6万元;即便利用率只有40%,月收入仍有22.6万元。
同时行业首次有了清晰标准:单单位算力每月可创收16.15万元。
从此采购算力不再靠感觉,投入产出一目了然。
不做替代者,只做增效者
这也是这套方案最戳中企业的一点:尊重客户的存量资产。
很多国产方案的逻辑是:换掉英伟达,全盘替代。
企业的顾虑却很现实:几十亿的旧设备,难道全部报废?
摩尔线程彻底避开了这个误区:不推翻现有集群,不重写代码、不换生态。
凭借CUDA兼容和通用架构,S5000可以直接嵌入现有英伟达集群,帮企业扛下最贵、最累的预处理工作。
让老设备跑得更快,让存量资产产生新价值。
别人在“抢市场、搞替代”,摩尔线程在“降成本、帮赚钱”。
长文本、AI智能体、大模型应用全面爆发的当下,单纯拼参数早已没有意义。
行业真正需要的,是能落地、能省钱、能增收的解决方案。
摩尔线程这套PD分离异构方案,重新定义了国产GPU的价值:不是替代谁,而是让每一份算力投入,都赚到更多钱。
这,才是国产算力未来最正确的打开方式。

