英特尔为新一代开源多模态视频模型MiniMax H3提供Day 0首发支持。依托英特尔锐炫™ Pro B70的硬核实力及完整软件生态,英特尔在第一时间实现了对该模型的深度适配,充分展现出其在AIGC前沿应用领域中高效响应、快速交付的卓越表现,也为广大创意人士打开了一条低门槛、低成本、快速出片的视频创作新路径。

视频生成模型改写了AI在创意行业中的产业定位:借助AI开启创作的形式,已从边缘变成了主流,大模型也逐渐从辅助工具成长为核心担当,商业潜力持续释放。但成本依然是其规模化落地的道路上绕不开的一道坎。作为开源模型的破局者,MiniMax H3可实现精准可控的多模态内容编辑与生成,同时在成本上也极具优势,大幅降低了企业和开发者、创作者参与内容创作的门槛。
开源模型的高效运行,离不开底层硬件能力的支撑。英特尔始终关注本土生态伙伴的技术动态,持续为本土大模型提供快速适配与深度支持。此次亦是如此,英特尔锐炫Pro B70第一时间完成对MiniMax H3的适配,实现了开箱即用的高效交付。这一快速响应的能力,既源于B70在硬件架构、软件优化等方面的深厚积累,也是英特尔对本土生态长期投入的又一印证。
英特尔团队实现了一种基于多卡 GPU的部署方案,以进一步释放英特尔锐炫™ Pro B70的计算潜力。该方案采用Encoder 8卡张量并行(8TP)、DiT 8 卡 USP(Ulysses Sequence Parallel,并结合Layer-wise Offloading),以及VAE部署于B70 GPU的整体架构,实现了视频生成全流程的GPU加速。
其中,Encoder采用8卡张量并行完成文本编码;作为推理过程中计算量最大的模块,DiT采用8卡USP并结合Layer-wise Offloading技术,使模型参数按层动态加载到GPU,在突破单卡显存限制、降低模型常驻显存需求的同时,支持更大规模DiT模型的部署;VAE则部署于B70 GPU上完成最终的视频解码。该方案兼顾了模型容量与计算效率,为大规模视频生成模型提供了更具扩展性的部署方式。
在此基础上,团队进一步结合张量并行(Tensor Parallel,TP)与USP的优势,开发了2TP × 4USP的混合并行方案。相较于纯8 卡 USP,该方案将USP并行度由8降至4,并引入2路张量并行对计算进行协同加速,在保持模型扩展能力的同时,减少USP带来的通信开销,实现计算负载与通信开销之间更优的平衡,从而进一步提升整体推理性能。
此外,团队还结合llm-scaler-omni项目的XPU Kernel优化,对矩阵乘法、注意力等关键算子进行了持续优化,进一步提升GPU的计算效率,持续降低端到端推理时延,取得了良好的优化效果。
英特尔锐炫Pro B70为用户提供了具有出色成本效益的硬件底座。基于第二代Xe²架构, B70专为图形渲染、通用并行计算与AI加速计算等专业工作负载打造。得益于32个Xe核心与32GB超大显存,它适用于庞大的AI推理需求,不仅能顺畅承载更大规模的 AI 模型与超长上下文,更能在多用户高并发场景下保持高吞吐与快速响应,显著提升模型的部署效益。
在此基础上,英特尔完善的软件生态进一步为模型的部署提供了支撑。配合包含Pytorch, vLLM, SGLang, SGLang Diffusion, ComfyUI, OneAPI在内的完整 AI 软件栈,英特尔锐炫 Pro B70能够灵活满足多样化部署需求。这在帮助企业降低部署门槛的同时,也为开源生态构建了更加稳健的软硬件支持,推动视频模型的生产力向端侧延伸,激活多元场景的创想生机。
面对AI时代的广阔机遇,英特尔加码硬件创新与生态布局,以不断升级的GPU架构、全栈软件支持与开放生态为基础,为客户提供兼具出色成本效益与性能的硬件方案,推动AI向更多元的业务场景快速落地。
