### [MiniMax H3 正式开源:一套模型同时看文字、图片、视频和音频](https://www.zhuanpen.com/article/786) **Published:** 2026-08-27T04:10:44 **Author:** coldlony **Excerpt:** MiniMax 把新一代视频模型 H3 开源了。这次的重点,不只是“文字生成视频”,而是让模型同时理解文字、图… MiniMax 把新一代视频模型 H3 开源了。这次的重点,不只是“文字生成视频”,而是让模型同时理解文字、图片、视频和音频,再生成带立体声音频的视频。 官方给出的规格是:视频最长 15 秒,最高支持 2K 分辨率,24 FPS,输出 32 kHz 立体声,还稳定支持 11 种语言。 和普通文生视频的区别很直白:你可以给它首帧和尾帧,也可以给参考图、参考视频和参考音频,让它保留人物、场景、动作,甚至参考声音来生成新的对白和嘴型。 它还支持多种输入方式:最多 9 张参考图、3 段参考视频和 3 段音频,所有输入合计最多 12 个文件。 不过要注意,H3-Context-IR 和 H3-Regenerate-2K 这两个官方工作流模块目前没有一起开源,官方提供 API 来复现完整 2K 流程。模型采用 MiniMax H3 Community License,部署可以走 Hugging Face、魔搭、SGLang、vLLM、diffusers 或 ComfyUI。 价格方面,这篇开源公告没有公布统一价格,想在线调用要以 MiniMax 开放平台实际页面为准。 一句话:MiniMax H3 更像一套“能看多种素材、还能生成带声音视频”的全模态视频系统,而不是单纯的文字转视频模型。 来源:https://www.minimaxi.com/news/minimax-h3-open-source ![](https://superadmin.zhuanpen.com/wp-content/uploads/2026/08/01-%E5%AE%98%E7%BD%91-%E9%A6%96%E5%B1%8F-2.jpg) ![](https://superadmin.zhuanpen.com/wp-content/uploads/2026/08/02-%E5%AE%98%E7%BD%91-%E6%A8%A1%E5%9E%8B%E8%A7%84%E6%A0%BC.jpg) ![](https://superadmin.zhuanpen.com/wp-content/uploads/2026/08/03-%E5%AE%98%E7%BD%91-%E5%BC%80%E6%BA%90%E4%B8%8E%E8%AE%B8%E5%8F%AF.jpg) ![](https://superadmin.zhuanpen.com/wp-content/uploads/2026/08/04-%E4%B8%AD%E6%96%87%E8%A7%A3%E8%AF%BB%E5%9B%BE-2.png) **Categories:** 行业快讯 ---