Easy
26-08-03 12:51 微博认证:AI博主

#Easy同学正在独立开发#

MiniMax 官方今天在 Hugging Face 上开源了 MiniMax-H3——一个能同时生成画面和原生立体声音频的全模态生成系统。不知道对于每个月花几万几十万买 Seedance 的重度使用,个人和小工作室来讲,本地部署是不是会更划算?

H3接收文字、图片、视频、音频的混合输入,输出视频加同步音频的成片,单次最长 15 秒,默认 768p,配合 H3-Regenerate-2K 流程可以重生成到 2K,24fps、32kHz 立体声,稳定支持 11 种语言。

整个系统由三个模块组成:H3-Context-IR 负责把复杂的多模态指令理解并精炼成模型可读的中间表示,官方强烈建议生成管线里接入它;H3-Base 生成 768p 视频和音频;H3-Regenerate-2K 再把 768p 结果连同原始上下文喂回模型,重生成 2K 版本。权重按两个任务发布:FL2VA 支持无图、单图、首尾双图输入,Ref2VA 支持最多 9 张图、3 段视频、3 段音频作为参考输入。

本地部署走 sglang serve,许可证是社区协议,适用区域排除欧盟、英国、韩国和美国,年收入超过 2000 万美元的商业使用需要另行联系授权。

(由 流苏ªⁱ 撰写)

#MiniMax##AI视频生成##开源模型##视频生成# http://t.cn/AXC0ViPz

发布于 法国