马力AI和商业思维
26-06-11 12:17 微博认证:知群 CEO 微博新知博主

想做一条会动、还会出声的短视频,你以为得先会剪辑、懂运镜、会配乐,其实现在一张图加一句大白话就够了。

xAI 这几天放出来的 Grok Imagine 1.5,干的就是这件事。你扔给它一张静态图,再用人话说一句「镜头缓缓推近、背景开始下雪」,它就把这张不会动的图变成一段动起来的短片,连声音一起给你配好。

很多人对「AI 做视频」的印象,还停在「我得想个剧本、找素材、一段段拼、再压个背景音乐」上。那套是把人当导演加剪辑师使。Grok 这次把活儿反过来了:你只当那个出主意的人,图你给一张,怎么动你说一句,剩下的它来。

它的逻辑很简单。你上传的那张图,就是视频的第一帧,原图的构图、人物长相、画风它都给你留着,不会动着动着变成另一个人。然后你那句话就是导演口令,说推近就推近,说摇一下、跟着走、慢一点,它照着来。我看了一圈别人晒的例子,有人的提示词朴素到就一句「加一点轻微的镜头推近,加一个微笑表情」,出来的人像就真的轻轻笑了、镜头缓缓往脸上凑。

最让我觉得有点东西的,是声音。市面上多数图生视频(就是拿一张图生成一段视频)工具,画面归画面,声音得你渲染完再回去单独配。Grok Imagine 1.5 是画面和声音在同一次生成里一块出,对白还能对上口型,背景音乐、环境音效一起给你铺好。一张哑巴照片,进去转一圈,出来会动会说话,这个体验跟「先出画面再补音」真不是一回事。

那它到底能拿来干嘛?

老照片是最直接的。家里一张爷爷奶奶的旧照,让画面里的人眨眨眼、镜头慢慢推近,那张定格了几十年的脸,忽然就有了点活气,挺戳人的。

做内容、带货的,产品图、海报图丢进去,加一句「镜头从左往右扫过、打上柔光」,一张平面图立马变成一条能发出去的短片,省掉一整套拍摄和剪辑。

想玩梗的就更随意了,自拍、二次元立绘、表情包,让它眨眼、回头、开口说句话,一张「活照片」就出来了。提示词都不用憋术语,就大白话写动作、写声音,写你想让它怎么动。

当然也得说清边界,免得你抱太高期待。单条目前最长15秒,清晰度到720p、每秒24帧(24fps),你想靠它一口气生成一部片子,不现实。

6月初马斯克自己发了一条用它做的预告片,特洛伊战争那个味道,大场面、烧城、战船全有,浏览量冲到1840万以上,看着是挺唬人。但那条接近40秒的片子,是好几段15秒以内的镜头拼起来的,不是它一次吐出来40秒。名人拿它做的 demo,看个上限就行,别当成你随手一点就能要到的效果。

它这回是先从开发者那条路(官方接口,也就是 API)开放的,普通人在 Grok 里能不能直接点上这个新版,官方说还在按订阅档位慢慢铺,我也没完全摸准你打开是哪个版本。而且 Grok Imagine 从今年3月起就不免费了,想用图和视频生成,得是 X Premium、Premium+ 或者 SuperGrok 的订阅用户。

#马力的AI知识分享#

发布于 北京