#模型时代# 我用豆包把一个半成品脚本,改成了能直接出科普短剧的工具
这几天体验了一下豆包专业版,把一个原来的半成品Skill,靠agent自己迭代排错,并结合豆包大模型的特性,最后改成了一个能直接产出准“商用级”内容工作流。过程蛮有意思,效果也不错,所以给大家介绍一下。
1.这个Skill叫一键概念解释。灵感来源是Anthropic哲学家Askell最喜欢的一个提示词:
选一个你指定的领域,从中挑一个研究生水平的概念,写一个寓言故事来间接解释这个概念,让读者到最后才隐约意识到这是在讲什么。然后在故事之后,再写一段正式解释。
她说这个方法让她脑子里积累了大量来自不同学科的概念,虽然有时记不住术语,但概念本身会以故事的形式留下来。比如有一个关于进出口贸易的寓言,让她理解了"为什么某些商品倾向于进口而非出口"的经济学原理。
2.我当时很受启发,也用这个提示词作过一些概念解释。
不过,一直想,如果模型的解释,如果不是文字,而是用视觉语言,比如动态漫画,可能也不错,或许还可以直接作为科普素材。
最早我用Codex写了一个Skill Demo。
但由于Codex没有现成的视频、语音模型接口可用。写完是写完了,功能是简陋到离谱:只是把抽象概念生成几格静态画,生硬拼成视频,没字幕适配,没中文字体支持。效果又差强人意,就放下没再管了。
3.借着升级豆包专业版,就把它想起来了,一方面是想考验一下豆包的agent能力;另外一方面,也是觉得豆包大模型的多模态,很适配这个场景。于是就把这个Skill压缩包,直接扔给了豆包专业版的办公任务,让它理解这个Skill,并结合自己的能力进行优化。
4.结果就居然还真的很不错。
它先把整个链路全换成了豆包原生的多模态能力
画图用Seedream,配音用豆包TTS,不用任何外部接口。从Demo效果看,图画从原来的简笔画,变成了宋代工笔重彩,风格统一,几幅画里两个徽商的长相、衣服、色调从头到尾没崩。
接下来,本来只有静态图片拼PPT一样的效果,最终被做了两种模式:
一种是动态漫画,静态画加缓慢的电影级推镜;
另一种是 AI 短剧模式,基于画好的分镜直接生成动态视频,自动配对应场景的环境音,黄河浪声、公堂环境音、风吹树叶声,字幕换成电影里那种白字黑边,导出来直接就能发短视频平台。
当然,也不是全程一次过。第一次生成的视频没声音,我提示了一下“视频没声音”。豆包自己从音频编码查到ffmpeg参数,从WAV格式兼容性查到不同片段采样率不统一,最后把整个音频合成逻辑全重写了,统一编码统一采样率,把bug修好了。
现在先展示一下动态漫画的Demo,大家实际感受一下。#AILifeDemo#
