跳到正文
硅脉动SiliconMai

MiniMax开源H3,16家芯片与平台同步适配

H3可处理文本、图像、视频和音频,并生成最高2K、最长15秒的带声视频;模型已支持多种主流推理框架。

硅脉动
AI资料图

MiniMax 8月3日开源全模态生成系统H3,华为昇腾、AMD、英特尔等芯片厂商,以及Hugging Face、魔搭和ComfyUI等开发社区与平台在开源首日完成适配。同步适配覆盖模型、芯片和推理工具,是这次发布区别于单纯开放权重的一项关键信息。

H3能够在同一系统中理解文本、图像、视频和音频组成的上下文,并生成最高2K分辨率、最长15秒且带有原生立体声音频的视频。MiniMax称,该模型在预训练阶段就面向多模态任务泛化进行设计,以处理复杂指令和跨媒介内容。

模型由H3-Context-IR、H3-Base和H3-Regenerate-2K三个模块组成。开发者可从Hugging Face下载模型,其中H3-Base已经支持SGLang、vLLM、diffusers和ComfyUI等推理框架或工作流。对开发团队而言,现成的框架适配可以减少从下载权重到运行模型之间的工程工作。

首日参与适配的硬件厂商还包括摩尔线程、沐曦、海光信息、昆仑芯、天数智芯和壁仞科技。覆盖多种国产芯片以及AMD、英特尔平台,有助于开发者按照算力供给和成本选择部署环境,也降低模型被单一硬件生态锁定的程度。

MiniMax表示,H3在Artificial Analysis榜单的视频编辑项目中排名全球第一。这是公司引用的特定榜单结果,实际部署效果仍会受到素材类型、生成时长、硬件配置和推理参数影响。公司尚未在本次发布信息中披露不同硬件上的速度、显存占用或单位生成成本。