摩尔线程×硅基流动联合发布PD分离异构算力混部技术白皮书

近日,摩尔线程与AI推理基础设施平台硅基流动联合发布《PD分离异构算力混部实践技术白皮书》,首次系统阐述基于摩尔线程AI训推一体智算卡MTT S5000与国际高端GPU协同工作的PD分离推理方案。该方案在真实生产级集群环境下,成功实现在Prefill阶段以2:1的部署比例实现国产GPU对国际高端GPU的算力等效替代,全链路服务质量与纯国际高端GPU集群全面对标,为国产算力的大规模商业化部署提供了可量化、可复制的技术实践。

行业趋势:从“训练大模型”到“生产Token” 


当前,大模型行业重心除“训练更大模型”之外,“以更低成本、更高稳定性生产高品质Token”也愈加重要。据工业和信息化部数据,截至2026年6月底,我国智能算力规模已达2185 EFLOPS(FP16),同比增长177%,中国词元市场呈现爆发式增长。

面对算力需求激增与自主安全多元化的双重挑战,AI基础设施如何突破成本、效率与国产化瓶颈成为关键。白皮书指出,将计算密集型的预填充(Prefill)阶段与访存密集型的解码(Decode)阶段分离,并分别调度至更适配的异构算力上执行,是破解上述瓶颈的核心路径。


技术方案PD分离异构算力混部架构


根据白皮书披露的技术方案,双方在4台摩尔线程MTT S5000与2台国际高端GPU组成的“4P2D”异构算力集群上部署Kimi K2.6模型,对标由4台国际高端GPU组成的“2P2D”算力集群。


▼ MTT S5000凭借硬件原生FP8精度支持与充沛的稠密算力储备,专门处理Prefill阶段的大规模矩阵计算与长序列编码;

▼ 国际高端GPU则利用4.8 TB/s的显存带宽高效执行Decode阶段的逐Token生成。


两侧推理精度统一采用FP8,数据格式完全一致,并通过Mooncake RDMA高速网络实现KV Cache的跨芯片零拷贝传输,确保缓存数据的正确性与一致性。

摩尔线程×硅基流动联合发布PD分离异构算力混部技术白皮书

性能实测:全面对标国际高端GPU


性能测试结果显示,摩尔线程MTT S5000单卡在Prefill阶段的吞吐量达到国际高端GPU的46%至54%。在128K上下文、16并发的极限场景下,MTT S5000平均吞吐可达2047 tokens/s。通过2:1(4台MTT S5000 vs 2台国际高端GPU)的集群部署比例,Prefill侧总算力得到有效补足,使异构集群在算力总量维度与纯国际高端GPU集群实现全面对标。

摩尔线程×硅基流动联合发布PD分离异构算力混部技术白皮书

在全链路服务质量方面,异构集群的首Token时延(TTFT)为1至6秒(常规并发),每Token输出时延(TPOT)稳定在0.011至0.020秒之间,系统吞吐随并发增加呈线性平缓下降,全链路指标与纯国际高端GPU集群表现一致,满足在线服务严苛的SLA要求。在长上下文场景中,依托KV Cache FP8压缩存储,该方案可有力支撑1M超长上下文推理。

摩尔线程×硅基流动联合发布PD分离异构算力混部技术白皮书

本方案验证了由 4台MTT S5000 + 2台国际高端GPU组成的4P2D异构算力集群,在处理长序列大模型推理任务时,可有效对标由4台国际高端GPU组成的2P2D算力集群使用。


推理引擎与生态支持:统一框架消除异构壁垒,迁移成本趋零


方案的推理加速能力由硅基流动自研的SiliconLLM推理加速框架与摩尔线程MUSA全栈平台协同提供。针对PD分离场景,双方在以下核心技术层面形成合力:


▼ SiliconLLM通过统一硬件抽象层(HAL)消除MTT S5000与国际高端GPU间的异构壁垒,使两侧模型代码与配置完全一致,并可为Prefill与Decode两侧分别定制并行策略,最大化异构资源利用率;

▼ Prefill节点与Decode节点之间通过Mooncake RDMA高速网络实现KV Cache的零拷贝传输,确保端到端推理时延稳定;

▼ 摩尔线程自研MATE高性能算子库深度适配芯片硬件指令,使计算效率逼近理论峰值。配合自适应无损模型量化技术,让FP8精度在异构芯片上获得与原生FP16对齐的推理性能与精度表现。


摩尔线程MTT S5000是专为大模型训练、推理及高性能计算而设计的全功能GPU智算卡,基于第四代MUSA架构“平湖”打造,完整支持从FP8到FP64的全精度计算,配备大容量显存与高带宽。其核心芯片PH100已首批通过中国信息安全测评中心的国家《安全可靠测评》(2026年第2号),安全可靠等级为I级。


MTT S5000率先实现硬件级原生FP8计算精度支持,在确保模型收敛的同时显著降低显存占用。依托第四代MUSA全栈平台,MTT S5000原生适配PyTorch、Megatron-LM、vLLM及SGLang等主流AI框架,开发者可实现代码的平滑迁移。


工程化落地:打造高品质“词元生产工厂”


白皮书指出,该方案已具备规模化生产落地条件——全链路时延与极限抗压能力满足在线服务SLA要求,RDMA通信兼容性验证通过,可支撑大规模生产部署。该方案以2:1比例实现MTT S5000对国际高端GPU的等效替代,显著降低了推理成本与供应链风险,构建了模型、算力、平台、运营协同的新型基础设施体系。


《PD分离异构算力混部实践技术白皮书》的发布为行业带来了深远意义:

▼ 为国产算力规模化部署提供可行路径,通过异构混部,国产算力可在不牺牲用户体验的前提下逐步替代国际高端产品;

▼ 推动异构算力标准建设,本方案在KV Cache通信、精度对齐、仿真调度等方面形成了可复用的技术规范,为行业提供了可量化的容量规划标准与部署参考;

▼ 支撑全国一体化算力网建设,异构算力的高效协同是实现算力互联互通、资源灵活调度的关键技术基础;

▼ 构建安全可控的AI产业底座,形成模型、算力、平台、运营协同的新型基础设施体系,推动AI应用从试点走向规模化生产。


在以代理式AI、物理AI等为代表的创新浪潮中,全功能GPU正加速AI变革。面对词元时代爆发式的算力需求,摩尔线程基于夸娥(KUAE)智算集群建设三大“AI工厂”——“模型训练工厂”“词元生产工厂”“智能体生产工厂”,凭借全场景通用优势,支撑从训练到推理、从数字世界到物理世界的多元算力需求,构筑起面向未来的AI基础设施。本次白皮书发布的PD分离异构算力混部技术方案,正是“词元生产工厂”实现高品质Token大规模、高性价比生产的关键技术支撑。


AI基础设施的竞争,不只是算力规模的竞争,更是Token生产效率、系统工程能力与产业协同能力的竞争。此次发布的白皮书为构建安全、可控、可持续的AI产业底座提供了坚实的技术基础与工程实践,也为国产算力从“可用”迈向“好用”树立了重要里程碑。

踩(0)

最新文章

相关文章

大家都在看