开源量子位·原文 2026年9月11日

RunningHub开源MiniMax H3多卡加速方案,称4卡RTX 6000D生成提速约12倍

量子位报道,一站式AIGC创作平台RunningHub将MiniMax H3的推理加速方案开源至GitHub,称在4张RTX 6000D上生成5秒1344×768视频从348.8秒降至28.7秒,且保留BF16精度。

AI解读:RunningHub把一套MiniMax H3推理加速方案开源到GitHub,核心卖点是在不降低BF16数值精度的前提下,把生成速度拉高约12倍。按报道的测试口径,同样的5秒、1344×768视频,原始BF16 50步方案在4张RTX 6000D上耗时348.8秒,加速后只需28.7秒,耗时减少约92%。

这套方案针对的是无NVLink、走PCIe通信的多卡环境,而不是堆顶级数据中心算力。它把后训练降步数、注意力与缓存算子优化、torch.compile编译优化、多卡并行策略组合起来,最后整合进SGLang multimodal_gen推理引擎,本地部署流程公开。

受影响最直接的是自己拥有多卡设备、想本地跑开源视频模型的创作者、工作室和中小团队:过去改一版创意可能要等几分钟,现在试错间隔被压缩到几十秒级,但实际速度仍取决于卡型、卡数、步数选择与工作流配置,报道中的数字是RunningHub给出的特定环境测试结果。

量子位2026年9月11日报道,一站式AIGC创作平台RunningHub将MiniMax H3的多卡推理加速方案开源至GitHub,仓库地址为github.com/RH-RunningHub/MiniMax-H3-MultiGPU-Lightning。

报道称,同样生成5秒、1344×768视频,在4张RTX 6000D上,原始BF16 50步方案耗时348.8秒;使用RunningHub H3 Lightning完整加速后为28.7秒,提速约12倍,生成耗时减少约92%,并保留BF16数值精度。

15秒视频在8卡环境下的实测数据

报道给出的另一组数据是8张RTX 6000D环境下,H3生成15秒、768×1344视频:纯文字生成约48秒,双参考图生成约73秒。文中据此称,一条15秒的图生视频可以进入“1分钟出结果”的时间尺度。

  • 5秒、1344×768、4张RTX 6000D:原始BF16 50步348.8秒,对比加速后28.7秒
  • 15秒、768×1344、8张RTX 6000D:纯文字生成约48秒,双参考图约73秒
  • 全程保留BF16满血精度,未采用降精度换速度的方式

三刀加速:从模型、执行到多卡通信

报道把技术路径拆成三层。第一刀是引入自研RH后训练加速模型,让H3用更少步数完成生成。原始H3推理默认50步;同样用4张RTX 6000D生成5秒视频,换成RH后训练加速模型的9步测试方案后,时间缩短到43秒,报道称此时已提速8倍。RunningHub的推荐配置是默认4步,快速运动、大幅动作等难任务可切到8步。

第二刀在执行层,组合SageAttention2、Cache-DiT和torch.compile。SageAttention2优化注意力计算,Cache-DiT复用前后步骤之间可复用的中间结果,torch.compile对计算过程做编译优化。报道称这些优化叠加后,43秒进一步压到28.7秒。

第三刀针对多卡并行。报道指出,多卡不等于一定快,在没有NVLink、主要依靠PCIe通信的环境里卡间通信成本尤其明显。RunningHub重新测试不同并行方式后选择TP2+Ulysses4:在8张RTX 6000D、PCIe且无NVLink环境下,该组合相比TP4+Ulysses2速度快约12%,同时减少约14GiB显存占用。

  • RH后训练加速模型:50步方案改为9步测试方案,5秒视频从348.8秒降到43秒
  • SageAttention2、Cache-DiT、torch.compile:在剩余计算上继续压缩,43秒降到28.7秒
  • TP2+Ulysses4:8卡PCIe无NVLink环境下比TP4+Ulysses2快约12%,显存少约14GiB
  • 所有方法整合进SGLang multimodal_gen推理引擎

本地部署与适用硬件

报道强调,H3 Lightning针对的是无NVLink的PCIe多卡环境,RTX 6000D属于公开可购买的专业GPU规格,因此方案面向工作室和企业团队更常见的多卡部署条件。文中提到,若使用B300显卡,出片速度可提升至秒级;从环境安装、模型下载到服务启动和推理测试,本地部署流程均已公开,开发者也可以结合社区加速LoRA自行调整卡数、参数以及速度与画质的取舍。

  • 优化目标环境:无NVLink的PCIe多卡
  • RTX 6000D为公开可购买的专业GPU
  • 有设备的团队可按开源方案自行部署;没有多卡服务器或不想配置环境的创作者可直接在RunningHub平台使用H3 Lightning
  • 报道称使用B300卡可将出片速度提升至秒级

RunningHub围绕H3的生态动作

报道称,H3开源后RunningHub先完成平台接入,随后开源全套ComfyUI节点。平台上有创作者用它做电商内容、短剧、漫剧、声音克隆、动作克隆和音频驱动等。文中举例:创作者@魅力创意的“MiniMax H3·电商多参生视频工作流”可输入商品、模特、场景和卖点生成电商广告;@艾橘溪的音频驱动数字人工作流可上传人物图片加音频,让静态人物说话、唱歌并对上口型节奏;@qwlulnpi的方案可把分镜图、脚本、音频一次生成带画面和声音的成片。

报道称,自H3上线以来,RunningHub平台上已有上千名创作者围绕它开源了近万条创意工作流。文中把H3 Lightning描述为RunningHub把自身工程能力反哺H3、解决推理效率问题的一步,并将其与母公司海马云的技术积累联系起来:海马云2014年成立,长期做GPU容器调度、图形虚拟化、实时流媒体和大规模云渲染,目前在国内建设60余个边缘节点,支撑超过2000万月活用户的智算服务。

  • H3开源后RunningHub完成接入并开源全套ComfyUI节点
  • 平台上千名创作者围绕H3开源近万条创意工作流(据RunningHub平台数据)
  • RunningHub母公司海马云2014年成立,国内建设60余个边缘节点,支撑超2000万月活用户智算服务(据报道)

信息来源

量子位原始来源