AI做Vox剪纸风科普视频全流程拆解:从风格模板、分镜生成到剪辑配音,零基础也能跑通

微信扫一扫,分享到朋友圈

AI做Vox剪纸风科普视频全流程拆解:从风格模板、分镜生成到剪辑配音,零基础也能跑通
收藏 0 0

上个月我在B站刷到一条讲英伟达发家史的短视频,画面是那种Vox风格的剪纸动画,人物是纸片质感,背景有纹理,镜头还有轻微推拉。我当时觉得这种风格特别有调性,就想自己搞一个。结果按网上随便找的教程折腾了一晚上,出来的画面风格完全对不上,文字全是乱码,人脸歪到没法看。

后来我把这套流程重新捋了一遍,发现核心问题不是工具不行,而是我压根没理解这类视频的生产逻辑。现在我把跑通的完整流程写出来,用到的工具就两个,一个负责写脚本和分镜,一个负责出图出视频。

开篇:效果预览与工具准备

做这种Vox剪纸风视频,核心就三样东西:一个AI对话工具(我用的是Qd),一个谷歌的Flow网页端,还有一个谷歌的Omni视频模型。工具清单很简单,不需要装任何本地软件,Flow直接浏览器打开就能用。

零基础工具清单:Qd + 谷歌Flow + Omni模型

先说结论:这套流程现在能做到什么程度。原作者做了大量风格测试,从蓝图风、黏土风到像素风,同一个方法在多种风格下都跑通了。整体效果能达到80到90分的水平,意思是成品能看、能发,但你要逐帧抠细节,还是能发现不少小毛病。这个心理预期要先建立好。

核心原理:锁定风格、替换动作

我第一次做翻车,就是每个镜头都重新写一遍完整提示词,结果风格一会儿深色一会儿浅色,人物长相也变来变去。后来看了别人的做法才明白,这类视频的关键不是每次从零生成,而是做一张风格表,然后在每个片段里只替换动作描述,风格部分从头到尾保持不变。

这个方法其实是从角色设定表迁移过来的。你喜欢看动画设定集的话,会发现角色都有固定的人设图,正面、侧面、表情、服装都是锁死的。做动态图形也是一样的道理,先做一张风格模板图,把它当成整条视频的视觉基准,之后所有镜头都在这张基准上做微调。

风格表+动作替换:保持系列片段一致性的关键

具体的提示词结构分三块:背景描述、风格描述、动作描述。背景和风格两块锁定不动,只改动作部分。比如第一个镜头是“人物从画面左侧走进来”,第二个镜头是“人物手指向图表”,风格提示词原封不动复制粘贴。这样做出来的视频,哪怕生成十几次,画面风格依然是统一的。

实操步骤:出模板、写分镜

先把你想做的视频想法告诉Qd。如果你完全没有头绪,直接去抖音或B站找一条别人做好的剪纸风视频,把链接发过去,跟它说:“我想做这样一个视频,帮我整理一套流程,把需要的插件都装好。”它会自己安装插件和相关的skill,不用手动配置。

Vox剪纸风风格提示词示例

然后让Qd写一条风格提示词。以Vox风格为例,提示词里要包含颜色方案、字体风格(是否全大写)、核心视觉元素。不需要写得太细,Omni模型的理解力足够强,这些信息已经能让它完整get到风格了。把这条风格提示词发给谷歌Flow,让它生成图片,多做几张,挑一张最接近你想要的感觉的,当作模板图。

这步完成以后,把视频主题告诉Qd。我测试时给的主题是“为什么飞机舷窗几乎都是圆角的”,它会自动写好口播文案和分镜脚本,每个分镜附带对应的画面提示词,直接拿来就能用。

生成视频:延续尾帧、批量产出

拿到分镜提示词后,粘贴到谷歌Flow里,选视频生成,时长选6秒。这里有个关键细节:提示词末尾要加上一段话,意思是不要有人声、不要背景音乐,只要画面里的翻书音效。因为配音和背景乐是后期自己配的,如果让AI生成的时候带上了声音,到剪辑那步还得想办法分离,很麻烦。

每个分镜都按这个方式生成,素材攒够后下载下来。还有一个让转场更流畅的技巧:生成第二段分镜的时候,可以把上一段视频的尾帧截图上传作为参考图,或者在提示词里明确写“必须按照上一个视频最后一帧的画面延续”。这样做出来的下一个镜头,起始画面和上一条的结尾是接得上的,转场就自然很多。

这个方法实测有效,但也别指望完全无缝。AI对“延续尾帧”的理解不是100%,遇到微小的跳跃,靠剪辑时的叠化过渡能遮盖掉大部分。

剪辑配音:合并素材、合成口播

所有素材生成完后,先把它们丢给Qd,让它把所有片段按顺序合并成一个完整视频。然后把这个粗糙的成片导入剪映,再把口播文案交给剪映的文本朗读功能,选一个合适的音色生成配音轨。

配音这块建议别用AI直接生成的视频原声,效果会差很多。用剪映里的专属音色,或者自己录音,听起来更自然。把配音轨拖到时间线上对齐画面,微调一下卡点节奏,一条完整的Vox风格科普视频就出来了。

我实测下来,6秒一个镜头,一条3到5分钟的科普视频大概需要30到50个片段。批量生成的时间成本主要在等待渲染上,人不用守着,可以挂着让它跑。这也是这套流程比传统逐帧制作快得多的原因。

模型选型:四模型对比与Remotion适用场景

为了验证Omni是不是真的适合做动态图形,原作者做了四个模型的对比测试:Veo 3.0、Sora 2、Hailuo和Omni flash。说实话这不完全公平,因为Veo 3.0在Artlist里没有参考图模式,只能用起始帧模式硬上。但从结果看,Omni flash在理解参考图、还原风格、排版文字这几项上都是最好的。

四模型对比:Omni Flash综合表现最强

另外两个模型的问题很典型:Veo在流畅动画上力不从心,Sora表面看着还行,凑近看数字全糊了,画风中途还会跑偏。Omni虽然也有瑕疵,比如细节处理不够精致、复杂动作偶尔崩坏,但它是唯一一个能把参考图风格稳稳吃住的。更关键的是,在几个顶级模型里它最便宜。

再说说Remotion。很多人觉得有了AI生视频,代码生成动态图形的工具该淘汰了。实际上Remotion在精确控制这块还是没对手。你想在视频里展示一组具体数据,2月份要有一个更高的峰值,用文字生成图像几乎不可能做到精确,但用代码直接调数值,想改多细都行。而且Remotion可以编程化批量产出,渲染1000个视频、每个视频里改个名字,成本几乎为零。

Omni vs Remotion:各有所长,可混合使用

但Remotion的短板也很明显:做不了那种带炫酷镜头运动的Vox动画,想要快速出结果、操作简单,还是得靠Omni。这两个不是替代关系,真正效率高的做法是混着用:数据图表交给Remotion,风格化动态镜头交给Omni,各取所长。

避坑指南:字体、动作与提示词细节

做动态图形有个经验法则:字体越大,AI处理得越好。大号字体生成的文字基本准确,但那种排得密密麻麻的小字,凑近看全是错的。所以要尽量用大字号排版,别为难AI。

经验法则:优先用大号字体和简单动作

动作也是同理,越简单越好。复杂的肢体动作和高动态镜头容易翻车,简单的人物移动和手势成功率高很多。想做长镜头的话,得先接受画面可能存在瑕疵,用后期剪辑把明显错误剪掉。

还有一个坑是Google Gemini对知名面孔非常敏感。你只要提示词里带上真实人名,它大概率拒绝生成。原作者的做法是在人物眼睛位置加一条黑色遮罩条纹,先让GPT生成带条纹的图片,再用这张图去生成视频。效果意外地好,既规避了限制,又保留了风格。

最后说提示词的一个坑:哪怕你附加了参考图,视频提示词里仍然要明确写出风格描述。光贴图不写风格词,画面生成到一半很可能自己跑偏。

总结:混合工作流与建议

这套流程跑下来,我的感受是:AI动态图形已经从“玩具阶段”进入“能用的阶段”了。前几年想做个剪纸风动画,得先学AE做模板,再逐帧调动作,没有一两天出不来。现在从定风格到出成品,熟练之后一个下午就能搞定。

但也要说清楚:它还没到完美的程度。像素级的挑剔依然能找到一堆问题,文字偶尔出错、动作偶尔僵硬、人物脸部不够稳定。按原作者的话说,我们到了一个80到90分的阶段,能用,但需要你动脑筋去隐藏那些瑕疵。

如果你想试试这条路径,我的建议是:别从复杂的内容开始。找个3分钟以内的科普脚本,做一张风格模板图,挑两三个简单的镜头跑通全流程,再去扩展到完整视频。工具摆在那里,跑通一次比看十篇教程都有用。

视频教程下载

文章可能无法完整分享清楚,下面是原项目视频教程,粉丝朋友可以自行下载学习。提前说明:资源链接内可能会存在引流广告信息,请自行甄别。

百度网盘:

Avatar photo
离谱思维:网创项目网站长,坚持更新分享互联网各类网创项目和个人网创经验,欢迎大家的访问。
上一篇

不用抽卡!抖音百万赞漫剧AI工作流:智能体出剧本分镜三视图,LibTV连帧剪映成片

下一篇

保姆级AI童年治愈系动画教程:固定人物换装、AI写剧本脚本、生图生视频到剪辑成片

你也可能喜欢

发表评论

插入图片
Lip本人 Lip本人
Lip本人
返回顶部

互联网头等舱

① 本站文章项目内容大部分是站长通过各种付费网创社群搜集而来,免费分享给大家阅读学习,开开眼界。
② 更多项目实操视频教程可进入顶部菜单副业库内获取。
③ 团队实操项目情况均分享在朋友圈,欢迎围观(v:819955084)
PS:文章中出现的软件工具联系站长领取