【10秒1080P视频只要五毛钱:Sand.ai开源首个千亿MoE 视频模型,想把成本打下来】
8 月 5 日,Sand.ai 发布并开源 MAGI-2 Preview。这是一款统一音#视频生成模型# :文本、视频和音频进入同一个 Transformer,画面和声音由同一套主干共同生成。模型总参数约 114B,每次生成激活约 6B,这是全球首个开源千亿级 MoE 视频生成模型。
2025 年 4 月,Sand.ai 曾开源 24B 参数的自回归视频模型 MAGI-1。时隔一年多,这家公司再次把主力视频生成模型带入开源体系,参数规模从 240 亿扩大至 1,140 亿。
过去两年,开源视频生成模型的参数规模大多停在十几 B 以内,最大的也不过二三十 B。语言模型那边,#开源模型# 早就进入了几千亿甚至万亿参数,靠的都是 MoE。
虽然说两类模型面对的任务不同,参数规模不能直接代表能力高低,但这组差距仍然说明,视频模型扩展规模要付出更高的计算和通信代价。视频模型的参数规模长期停留在这一水平,也主要受制于这两项成本。#MAGI-2 Preview# 将总参数推至 114B,尝试解决的正是这个问题。
戳链接查看详情:http://t.cn/AXCgoNE3
