在微信小程序里搜一个”文案提取”,把同行视频链接贴进去点一下,几十秒后整段口播稿就躺在文本框里了。这一步是整条流程的起点,决定了后面分镜、生图、配音要围绕什么内容展开。科普类视频通常控制在3分钟左右,对应1100到1300字,再长的话后面生视频的环节会很累。拿到稿子只是开始,真正要处理的是怎么把它变成自己的东西,以及怎么让AI把文字拆成一个个能生成画面的镜头。
文案生产:两种方法——洗稿同行爆款与AI选题生成信息增量
文案来源有两条路,适合不同阶段的账号。
第一条是直接拿同行的爆款来洗。找对标账号里数据好的视频,复制链接,丢进微信小程序的”文案提取”工具,几个同类小程序都能用,能出文字就行。提取出来的稿子先存到记事本里,方便后面调用。
洗稿用国产大模型就行,DeepSeek可以,能上Claude的话效果更好,写出来的东西更有人味,逻辑没那么硬。操作上开专家模式,把提取的文案粘进去,标题也一并复制过来。这里有一套现成的提示词,大概12个点左右,需要手动改的地方只有两处:一是标题,改成跟原视频一样的;二是结尾的开头部分,建议直接沿用原博主的开场白——他的开头能留住人,说明这个钩子是经过验证的。

提示词里其他内容不要自己动。改过的人知道怎么调,没做过的很容易越改越乱,最后生成的稿子根本没法看。生成出来的文案中规中矩,原博主的信息增量基本都保留了。这种方法快,几分钟出稿,适合没做过这类账号、刚起步的人,别人的爆款是市场验证过的,拿来跑流量相对稳。
弊端也明显:信息增量和别的博主高度重合,同质化概率高,想进精选就难。所以如果能自己补信息增量,最好替换掉一部分。

第二条路是用AI生成选题,再补独家信息增量。用国内可直连的中转站,不用翻墙,每天有免费额度,做选题、写文案够用,经常用可以几块钱开个会员。模型选适合冷知识科普赛道的那个,提示词就一句话:参考附件,要求有用、不浮躁、不抽象、有画面感。附件里放的是整理好的25篇爆款文案合集,让AI照着这个风格和选题方向出题。

选题定下来后去收集信息增量,随便找个工具,豆包也行,一次要5个点。每个选题配4到5个信息增量比较合适,少了撑不起3分钟,多了冗余。拿到这5个点,复制进AI,加上标题,告诉它”根据规则帮我生成一篇文案”。生成完不要直接用,多跑几遍,每次结果都有差异,挑读起来不累、讲得清楚的那版。追求人味的话,Claude 4.6写出来的比DeepSeek更顺,DeepSeek逻辑性强但读着累。

配音制作:本地TTS工具部署与声音克隆配音
配音用本地部署的TTS工具,完全免费,每天不限次数。市面上有些配音软件要收费,声音也一般,这个本地工具是更划算的选择。
下载压缩包到本地直接解压,打开文件夹点最下面的”启动TTS”,等它加载完会弹出一个网页界面。界面里是自己克隆好的音频,声音来源建议克隆自己的,不要克隆其他博主的声音,那是别人的版权。

选好音色,把上一环节写好的文案贴进输入框,选批次推理,下面的参数设不设置效果差不多。点生成语音,文本长的话等待时间会久一点。生成完在剪辑时要把气口修一下,有时候音调拖得太长,听着不舒服。

视频制作:WorkBuddy安装VOXeasy Skill生成分镜脚本
VOX风格视频的核心逻辑是:文案和配音由人做好,剩下分镜、图片提示词、视频提示词全交给AI。
工具用WorkBuddy,腾讯出的Agent软件,注册后有两三千积分,生成一次1300字文案的分镜用不到100积分,每天还能免费领100积分,基本用不完,真用完了换个号就行。
Skill从GitHub拿。进GitHub搜VOXeasy,第一个结果点进去,点Code,再点Download ZIP下载。不直接发安装包有两个原因,一是合规,二是尊重开源社区开发者的更新,自己下最新版能优先用上新功能。

安装方式很简单,把压缩包解压到本地,在WorkBuddy里添加文件,告诉它”帮我安装这个skill,不只是在这个项目使用,直接安装到WorkBuddy”。装好后技能栏里能看到VOXeasy。
做分镜时新建任务,点加号勾选VOXeasy技能,把提示词放进去。风格版要放在前面,让它参考自己的风格版,不然生成出来是报纸那种风格,不太好看,当然这个因人而异。分镜依据配音长度来切,音频从剪辑软件里导出:识别字幕后点导出,选音频导出到桌面,再拖进WorkBuddy。有自己IP人物的可以放进去,没有就把那段话删掉。文案复制粘贴到对应位置,模型选Kimi K2.7 code,其他模型测过,这个最稳。

生成的结果每个镜头带两组提示词,image是图片提示词,video是视频提示词。
视频制作:AI生图与豆包生视频循环拼接成片
生图用第三方平台,充值最低7块钱200积分,生成一张图3积分,这是整条流程里唯一要付费的地方。点画图,默认模型JBT image 2,画面比例选16比9,其他不动,把分镜里的图片提示词复制进去发送就行。
不想投钱的话,豆包或即梦也能生图,只是可能要抽几次才满意。

图生成好后让它动起来,用豆包。点新对话,里面有视频生成,把图片拖进去,找到对应的视频提示词复制过来。注意提示词里”shot 1″后面中括号里写的6秒,就是这条镜头的时长,选16比9、6秒,点生成。所有分镜按这个方式循环做完,最后在剪映里拼接。
追求极致效果可以用更贵的模型,但一条视频可能得10到20块,抽卡多的话二三十,成本偏高,豆包免费够用。

工具获取与注意事项:GitHub下载Skill、多账号操作与成本控制
Skill的GitHub链接和提示词会整理在文档里,进GitHub搜VOXeasy,第一个结果点进去,Code里点Download ZIP。自己下最新版,别用别人转发的旧包。
豆包账号一个不够用。桌面上备6个账号,图片可以一边生成,两个账号错开跑视频,双开操作,这个不用教,很简单。
成本上,整条流程只有生图要花钱,7块钱200积分,一张图3积分。文案、配音、分镜、生视频全部免费。豆包账号不够就换号,WorkBuddy积分每天领100,基本用不完。
总结:全流程回顾与常见问题
流程串起来就是:提取同行爆款文案,或用AI参考25篇爆款合集出选题、补5个信息增量生成原创稿,文案控制在1100到1300字;本地TTS克隆自己的声音配音,剪辑时修气口;WorkBuddy装VOXeasy Skill,放风格版、导配音音频、贴文案,用Kimi K2.7 code生成带图片和视频提示词的分镜;第三方平台按图片提示词生图,3积分一张;豆包按视频提示词和对应秒数把图生成动态片段,循环做完在剪映拼接。
几个容易卡住的点:提示词不要自己乱改,改乱了生成的稿子没法用;洗稿适合新号起量,想进精选得替换信息增量;克隆声音只克隆自己的,别人的有版权;豆包单号次数不够,提前备好几个账号错开用。可以先从洗一篇同行爆款、跑通一次分镜生成试起,把整条链路走顺了再考虑批量。
视频教程下载
文章可能无法完整分享清楚,下面是原项目视频教程,粉丝朋友可以自行下载学习。提前说明:资源链接内可能会存在引流广告信息,请自行甄别。
百度网盘:
