我做AI绘画副业两年多,踩过最大的坑就是人物不统一,上一秒还是麻花辫小姑娘,下一秒就换个脸。后来才摸清门道,得先用豆包把人物形象固定死,后面所有图片、视频才能保持一个人。这套流程我跑通之后,从写剧本到出成片,一条视频只要一个下午。
先说个真实的翻车现场。我第一次做这类视频,提示词里只写了”小女孩、麻花辫、粉色短袖”,结果生成的人物没有腿。后来才反应过来,鞋子没写进去,AI就默认只画上半身。别笑,这个坑特别多人踩,下面每一步我都会把容易出错的地方标出来。
固定人物形象
打开豆包,把固定人物的提示词模板复制进去,然后在上面加上人物设定。比如:一个8岁小女孩,双麻花辫,粉色短袖,白色短裙,白色凉鞋,头上戴粉色发卡。注意,全身照、正面、站立,这几项必须写清楚。

我对着一开始生成好的形象不太满意,因为背景太乱。就在对话里加了一句”纯白色背景”,重新生成,选一张最满意的保存下来。这张图就是后面所有操作的”人物底图”。
换衣服怎么操作?去小红书或者淘宝搜”小女孩穿搭”,找一张你觉得好看的搭配图保存下来。返回豆包,把穿搭图发过去,加上固定话术:图一小女孩的拍照姿势不变,发型不变,换成图二的短袖和裙子,鞋子也换。生成后保存,人物就换好新衣服了。

这里有个关键细节:每次换完装,要盯着图片检查手指、脚有没有残缺。AI生成的人物经常出现六根手指或者脚部模糊,发现问题就重新生成,别偷懒。
AI生成故事剧本
人物搞定后,下一步是故事剧本。不会写剧本很正常,让豆包帮你写。
把写剧本的固定模板复制发给豆包,然后在里面修改补充,我一般会加上这些信息:山东农村、夏天、晴天、小女孩和爷爷奶奶的农村生活。如果你想写”赶大集”这个题材,就补充具体情节,比如爷爷带小女孩赶集,买了糖葫芦和新裙子。想写什么就往里加什么,把骨架搭好,豆包会给你填肉。
剧本开头要加”黄金三秒”能吸引人的设定,字数要求改成1500字。这个字数刚好够做一分钟左右的视频,太少了内容单薄,太多了剪辑费劲。
AI生成分镜脚本
剧本有了,接下来要把剧本变成能直接用于视频生成的分镜脚本。这一步我用DeepSeek,它有固定的脚本模板。
把豆包生成的剧本复制粘贴到DeepSeek的脚本模板里,故事主体这块需要自己写一下,就是把人物描述放进去。比如:8岁女孩彤彤,双麻花辫,粉色短袖,白色短裙,白色凉鞋。然后发给DeepSeek,它就会把剧本拆成一个个分镜,每个镜头包含画面描述、台词、动作。

这里分享一个小经验:DeepSeek生成脚本后,自己还是得看一眼,觉得哪里简单了就手动改一下。比如”爷爷扛着锄头走进院子”,我会改成”爷爷扛着锄头,从院门口慢慢走进来,步子有点慢,看见彤彤就笑了”。画面描述越具体,后面生成图片就越省事。
固定场景设计
场景不固定的话,每张图片背景都不一样,视频连起来看会很跳。这一步还是在豆包里操作。
先找一个喜欢的场景图,比如北方农村小院,发给豆包说”反推提示词”,它会把这个图片的提示词分析出来。然后把复制出来的提示词粘贴到DeepSeek,让它优化成一条适合场景固定的提示词。再回到豆包,把优化后的提示词发过去,加上一句固定话术:”这是我的小院,请保存。”

按这个方法,把小院的大门口、卧室、厨房、客厅分别固定下来。以后生成任何分镜图片,直接调用对应场景就行。
生成分镜图片
脚本和场景都准备好了,现在用即梦生成分镜图片。
打开即梦,选图片生成,模型选4.0,比例选4:3,这个比例很重要,后期生成视频时保持一致才不会变形。把脚本里”有人的”分镜内容粘贴进去,在角色选择那里,把固定好的彤彤、爷爷、奶奶的图片都上传上去,分别标记。比如50岁爷爷对应图三,小女孩彤彤对应图一,奶奶对应图二。然后发给即梦。
生成后先别急着高兴,放大检查一遍再保存。水印问题我会在下面专门讲。
图片生成视频
分镜图片选一张最满意的,用豆包生成视频。
点AI创作里的视频生成,把图片传上去。这里有个顺序要求:场景图放最前面,人物图放后面,顺序反了视频画面比例会乱。视频时长选10秒,比例选原比例,这样能保证4:3的画面不被裁切。视频生成模式下有个固定话术,把分镜脚本里对应的画面描述粘贴进去,如果默认的生成效果不错就不用改。

豆包生成的视频会带水印,直接用会显得很业余。我的解决办法是用一个小程序去水印,把视频链接复制进去处理一下再导出。当然如果画面表现得特别自然,水印位置又刚好不影响观看,也可以先留着。
视频剪辑、字幕与导出
所有分镜视频都生成好之后,用剪映把它们按顺序组装起来。
开场先加音乐,我在抖音收藏里选一首适合的BGM。音乐开头如果有空白段,用分割把前面多余的部分剪掉,再把音频拖动到视频起点。画面切换的地方加一点转场效果,不用太复杂,基础转场就行。
添加字幕用剪映的”识别字幕”功能,跑一遍就能自动生成。识别完后如果字体难看,点样式里换一个,但颜色我建议还是用黑色底白边,观感最清晰,花字看起来花哨,实际上很廉价。
剪辑完导出时选2K分辨率。导出后我还会用wink做一次画质修复,它的超清模式会明显提升画面的细腻程度,短视频平台压缩后依然能保持清晰度。
封面制作与去水印
封面直接影响点击率,这一步别省。打开美图秀秀,选拼图,挑3到4张最有代表性的分镜图,比例选3:4,高级编辑里打开无缝融合,让图片之间过渡自然。
[图片缺失:美图秀秀拼图:3:4比例+无缝融合做封面]
拼好后加标题文字。我习惯用剪映添加字幕,字体选粗一点、显眼一点的,放在封面上方或中间。颜色可以选稍微亮一点的,但别用太花的渐变,影响辨识度。
最后再统一检查一遍视频有没有残留的水印。豆包生成的视频用微信小程序去水印,即梦生成的图片水印,可以分享到抖音保存无水印版。这个环节要花点时间,但成片干净很多。
这套流程走完,一条完整的童年治愈系动画视频就出来了。第一遍做别着急,固定人物和场景这两个步骤最花时间,后面就顺了。你先从固定一个小女孩形象开始试,跑通一个10秒的片段,再考虑做完整故事。做得多了,各个工具的提示词模板你自然就会自己改了。
视频教程下载
文章可能无法完整分享清楚,下面是原项目视频教程,粉丝朋友可以自行下载学习。提前说明:资源链接内可能会存在引流广告信息,请自行甄别。
百度网盘:




