你的位置:首页 > 互连技术 > 正文

摩尔线程发布《MTT S5000 Prefill-as-a-Service技术白皮书》,给了一个算力分层方案

发布时间:2026-08-24 来源:转载 责任编辑:Lily

【导读】摩尔线程最近发布了一份技术白皮书,围绕MTT S5000智算卡提出了一个叫“Prefill-as-a-Service”的方案。核心逻辑不复杂:大模型推理有两个阶段,Prefill算力密集型,Decode访存密集型,放在同一套硬件上跑必然互相浪费。摩尔线程的做法是把两者拆开,各跑各的资源池,MTT S5000专门负责Prefill这一端,用高稠密算力和原生FP8支持来压榨首字时延。


202608240441089016.png


背景:长上下文时代,“算力错配”成为推理成本的核心瓶颈


随着大模型输入上下文规模快速迈入数百K到1M 级别,长文本输入带来的算力消耗与首字时延压力持续攀升,正日益成为制约企业推理服务效率与总拥有成本(TCO)的关键瓶颈。传统同构集群的算力部署模式,已难以应对不同计算阶段对硬件资源的差异化需求。


核心痛点在于结构性错配:在大模型在线推理中,输入阶段的Prefill(预填充)属计算密集型任务,受浮点算力约束;输出阶段的Decode(解码)属访存密集型任务,受显存带宽约束。两者在同一物理资源池中混跑,必然导致双向浪费——按Decode带宽选型,则Prefill的大容量显存长期低效;按Prefill算力选型,则Decode计算单元大面积空转。


破局:Prefill-Decode异构解耦,重构推理资源池


《白皮书》指出,突破这一瓶颈的关键在于将Prefill与Decode彻底解耦,使二者各自运行在最契合自身计算特性的硬件资源池上: 


Prefill算力池:专攻高算力利用率与极低首字延迟(TTFT); 


Decode资源池:专攻高并发与稳定的每Token延迟(ITL)。 


通过硬件分层投入,算力配置从“通用冗余”转向“按需匹配”,在满足服务质量(SLO)约束的前提下,实现单位Token基础设施成本大幅下降。


底座:MTT S5000构筑高吞吐Prefill专属算力池


作为一款全功能通用AI加速卡,MTT S5000在硬件特性上与Prefill任务高度契合,展现出出色的工程适配与规模化落地能力:

高计算密度,压缩首字时延。针对Prefill的计算密集型特征,MTT S5000提供高稠密算力,有效压缩首Token生成时延(TTFT);在长上下文场景下,以GLM-5.2为例,单机8卡可实现接近十万级Prefill吞吐,为Agent、长文档分析等业务提供确定性的SLO承诺与容量规划能力。


原生FP8支持,消除格式转换开销。支持FP8至FP64全精度计算,天然适配主流大模型原生精度,Prefill过程不引入额外精度损耗;原生FP8 KV Cache与Decode池保持高度兼容,消除跨节点传输前的格式转换成本,显著降低KV Cache传输时延。


生态成熟兼容,降低落地门槛。依托MUSA软件生态,全面兼容CUDA及PyTorch、SGLang、vLLM等主流推理框架,企业可基于现有代码资产实现平滑迁移与快速适配。


实测验证:严苛SLO约束下,64K上下文场景单机吞吐可达到5.8 MTokens TPM


《白皮书》基于超大参数模型智谱GLM-5.2-FP8,在90%前缀缓存命中率、首字时延P50 TTFT ≤ 6,000ms的严苛硬性SLO约束下,完成了64K至400K序列的极限压测。


以智谱官网API定价为基准(输入8元/百万Token、缓存命中2元/百万Token,综合单价2.6元/百万Token)进行测算,基于实测性能,在理想状态下的商业价值表现如下:


ScreenShot_2026-08-24_173506_362.png


在典型Agent混合上下文负载下,单机更具确定性算力变现能力与清晰的投资回收周期。


结语:以“推理效率+商业回报”重构产业竞争逻辑


大模型产业竞争的下半场,本质上是推理效率与商业回报的较量。摩尔线程通过MTT S5000与Prefill-as-a-Service方案,不仅重塑了长上下文推理的性能与成本边界,更帮助企业在万亿参数与Agent时代牢牢掌握TCO主动权。


完整白皮书请参见:《MTT S5000 Prefill-as-a-Service技术白皮书》

https://developer-hscdn.mthreads.com/public/MTT-S5000-Prefill-as-a-Service-%E6%8A%80%E6%9C%AF%E7%99%BD%E7%9A%AE%E4%B9%A6.pdf


总结

从技术路径来看,Prefill和Decode解耦不是什么新概念,业内早有讨论,但真正拿出具体硬件方案和实测数据的还不多。摩尔线程这次把MTT S5000卡在Prefill这个节点上,等于给算力分层提供了一个可落地的参考。实测数据说明在长上下文场景下,这套打法能在SLO约束下跑出稳定的吞吐,而且用FP8精度跑起来没有额外的格式转换开销,生态上也兼容了主流框架和CUDA代码。


gg_20260512171736_266_20260622170931_179.png

特别推荐
技术文章更多>>
技术白皮书下载更多>>
热门搜索

关闭

 

关闭