我用一句话做了一个科幻小短片。(图2)
先用kimi k3 vibe coding了一个应用(图1),这个应用功能就是把这一句话分解成一组分镜,然后每个分镜都有单独的视频提示词和运镜提示词。
这个应用,接的是gpt5.5的模型,进行剧本的分解。
其实接kimi k3也可以,这不是太贵了么?
然后把这些生成的分镜脚本丢给豆包,用的是seedance2.0 mini,就生成了这个短片。
从头到尾,就一句提示词:
在未来,地表已经毁灭,少数幸存者生活在地下城,有一天,有一个小女孩偶然发现,地表其实已经恢复,适合人类生存,但是地下城的高层隐瞒了这个消息。。。。。。
不要问我,为啥这个镜头里面小女孩的样子和穿的衣服为什么变了?
其实我做了一个主角设定的多视角参考图。
但是豆包的视频生成,不让上传人脸参考图,你用豆包生成的也不行。
我怀疑,视频模型的审核不在豆包这边,所以豆包生成的图片,那个审核也不认。
这就是字节内部的协调问题了。
整个过程,包括vibe coding在内,不到一个小时。
发布于 江苏
