News
资讯中心
首页  >  资讯中心   >  企业动态
2026-09-05 00:08:08来源:jinnianhui
jinnianhui官网-英特尔锐炫Pro B70极速适配MiniMax H3

【导读】英特尔为新一代开源多模态视频模子MiniMax H3提供Day 0首发撑持。依托英特尔锐炫™ Pro B70的硬核实力和完备软件生态,英特尔于第一时间实现了对于该模子的深度适配,充实揭示出其于AIGC前沿运用范畴中高效相应、快速交付的卓着体现,也为泛博创意人士打开了一条低门坎、低成本、快速出片的视频创作新路径。

1785738044192009.png

借助AI开启创作的情势,已经从边沿酿成了主流,年夜模子也逐渐从辅助东西发展为焦点担任,贸易潜力连续开释。但成本依然是其范围化落地的门路上绕不开的一道坎。作为开源模子的破局者,MiniMax H3可实现精准可控的多模态内容编纂与天生,同时于成本上也极具上风,年夜幅降低了企业及开发者、创作者介入内容创作的门坎。

开源模子的高效运行,离不开底层硬件能力的支撑。英特尔始终存眷本土生态伙伴的技能动态,连续为本土年夜模子提供快速适配与深度撑持。这次亦是云云,英特尔锐炫Pro B70第一时间完成对于MiniMax H3的适配,实现了开箱即用的高效交付。这一快速相应的能力,既源在B70于硬件架构、软件优化等方面的深挚堆集,也是英特尔对于本土生态持久投入的又一印证。

英特尔团队实现了一种基在多卡 GPU的部署方案,以进一步开释英特尔锐炫™ Pro B70的计较潜力。该方案采用Encoder 8卡张量并行(8TP)、DiT 8 卡 USP(Ulysses Sequence Parallel,并联合Layer-wise Offloading),以和VAE部署在B70 GPU的总体架构,实现了视频天生全流程的GPU加快。

此中,Encoder采用8卡张量并行完成文本编码;作为推理历程入彀算量最年夜的模块,DiT采用8卡USP并联合Layer-wise Offloading技能,使模子参数按层动态加载到GPU,于冲破单卡显存限定、降低模子常驻显存需求的同时,撑持更年夜范围DiT模子的部署;VAE则部署在B70 GPU上完成终极的视频解码。该方案统筹了模子容量与计较效率,为年夜范围视频天生模子提供了更具扩大性的部署方式。

于此基础上,团队进一步联合张量并行(Tensor Parallel,TP)与USP的上风,开发了2TP × 4USP的混淆并行方案。相较在纯8 卡 USP,该方案将USP并行度由8降至4,并引入2路张量并行对于计较举行协同加快,于连结模子扩大能力的同时,削减USP带来的通讯开消,实现计较负载与通讯开消之间更优的均衡,从而进一步晋升总体推理机能。

此外,团队还有联合llm-scaler-omni项目的XPU Kernel优化,对于矩阵乘法、留意力等要害算子举行了连续优化,进一步晋升GPU的计较效率,连续降低端到端推理时延,取患了优良的优化效果。

英特尔锐炫Pro B70为用户提供了具备精彩成本效益的硬件底座。基在第二代Xe²架构, B70专为图形衬着、通用并行计较与AI加快计较等专业事情负载打造。患上益在32个Xe焦点与32GB超年夜显存,它合用在重大的AI推理需求,不仅能顺畅承载更年夜范围的 AI 模子与超长上下文,更能于多用户高并发场景下连结高吞吐与快速相应,显著晋升模子的部署效益。

于此基础上,英特尔完美的软件生态进一步为模子的部署提供了支撑。共同包罗Pytorch, vLLM, SGLang, SGLang Diffusion, ComfyUI, OneAPI于内的完备 AI 软件栈,英特尔锐炫 Pro B70可以或许矫捷满意多样化部署需求。这于帮忙企业降低部署门坎的同时,也为开源生态构建了越发稳健的软硬件撑持,鞭策视频模子的出产力向端侧延长,激活多元场景的创想生气希望。

面临AI时代的广漠机缘,英特尔加码硬件立异与生态结构,以不停进级的GPU架构、全栈软件撑持与开放生态为基础,为客户提供兼具精彩成本效益与机能的硬件方案,鞭策AI向更多元的营业场景快速落地。

gg_20260512171736_266_20260622170931_179.png

-jinnianhui官网

麦小菜抖音

真甜抖音

麦小菜小程序

真甜小程序