全栈AI副业实战:零代码搭建本地模型微调+数字人+知识库,一节课全搞定

微信扫一扫,分享到朋友圈

全栈AI副业实战:零代码搭建本地模型微调+数字人+知识库,一节课全搞定
收藏 0 0

开篇引入

我第一次用这个Hyper Frame插件自动剪辑口播视频的时候,愣是看了半天没敢信。录了段15秒的口播,人靠左边站,右边留出空白,插件自己识别了字幕内容,在空白处给我加了标题和动画。而且它加的东西是基于我说话内容自动生成的,不是瞎贴——比如我说“拆解”两个字,它就在右上角加了个“拆解”的动效框。整个过程没写一行代码,就开了几个对话框,花了不到半小时。

但说实话,踩的坑也不少。最开始我不知道插件只能处理知识博主那种单人口播,以为啥视频都能用,结果塞了个多人对话的素材进去,动画位置全乱套了。后面慢慢试了几遍,才把整个流程摸顺。

如果你也想搞一套自动化内容生产的副业,不用盯着那些需要显卡和编程基础的东西,我踩出来的这条路——零代码跑本地模型、自动剪口播、搭知识库、生成数字人视频——可能更对你的胃口。下面我按顺序把每个环节怎么干拆开讲。

核心工具:Codex智能体平台安装与配置

把这个事说在前头,整个课程核心就靠一个东西:Codex智能体平台。它不要求你懂编程代码,甚至不用敲命令行,你在对话框里说人话,它就能理解你要干什么,然后自动调用工具、写脚本、协调流程。

装它也不费事。先去商店搜“coded”免费下载。装完别急,因为原生登录有时候麻烦,我推荐用coded加加管理工具来折腾。从GitHub release下载最新版本安装包(国内打不开就用课程提供的备用包),装完后点开。

左边点“供应商配置”,点“添加供应商”,名称随便起,接入模式选“纯API”。然后去DeepSeek官网的API开放平台,创建API key,复制填进去。baseURL填DeepSeek提供的链接(一般是`https://api.deepseek.com`)。选chat选项,点“从上游获取”拿到模型列表,选pro模型。最后给DeepSeek充个十块钱看余额。

重启code袋,选“其他方式登录”,粘贴你的API Key,右下角确保选中pro模型,就能开始对话了。我把权限设成了“完全访问权限”,这样它不用每次问我能不能操作,效率高得多。

使用codedax自动安装本地语音识别模型(无需付费API)

语音识别模型本地部署

搞口播视频第一步是拿字幕。我原来用API付费的服务,后来发现本地跑也行,便宜还快。

这一步用的是faster-whisper模型。最低配置CPU 4核以上、内存8G,推荐tiny/base/small版本,大型跑不动也别试。先让AI查你电脑配置,再推荐模型,然后让它安装并指定从ModelScope下载。

提一嘴,Hugging Face上模型虽然多,但国内访问慢,你不加指令它会默认走HF,两天下载不完。必须明确说“请到ModelScope当中帮我下载并安装”,这样它走国内站点,速度快。模型默认下载到C盘用户文件夹下,不用改位置,删的时候直接删文件夹就行。

装完后测一下,你随便说句话让AI转成字幕时间线,后续Hyper Frame插件就用这个时间线在对应位置加动画。

Hyper Frame插件自动化剪辑

插件安装很简单,左边点插件按钮,搜“hyper frame”,点安装并授权。这个插件是专门做知识博主口播动画的,我试过其他开源方案,就这个效果能看。

但别上来就让它直接加效果——你先做“运镜脚本”。比如设计第三到第五秒动画放哪、长啥样、内容是什么,再做个故事版画出来,最后把两者都给插件参考,它就会按你规划的执行,减少返工。

第一步录制15秒左右口播视频,人靠左或右,留出空白区域。第二步用本地faster-whisper拿字幕时间线。第三步做运镜脚本和故事版。第四步用插件加动画输出最终视频。

第一次执行插件,它会安装环境依赖(ffmpeg等),大概要半小时。之后每次调用就快多了。我还有个技巧:效果满意后,把整套流程封装成技能,后续直接调用。

在coded中搜索并安装hyper frame自动化剪辑插件

数字人视频生成(API配置与封装)

数字人视频我踩了不少坑。一开始想本地部署开源项目,发现项目随便就50G,占C盘空间不说,效果还一般。后来换了方案:用API调用,不依赖本地算力

整个流程分三步:先抓取抖音文案,再用MiniMax转语音,最后调数字人接口生成视频。语音驱动效果比文本驱动好太多——我做测试时文本驱动生成的视频嘴型对不上,换成语音驱动后自然多了。

先配置语音接口,我推荐mini max。你要在它的控制台创建API key,然后点“克隆自己的音色”,读三条语音就能生成。复制音色ID,在Codex里测试语音合成功能。

下一步找数字人API。国内平台推荐禅镜,价格和效果都不错。到它的API控制台,点左下角API,复制接口文档,获取stoken(24小时有效)。用API定制数字人形象:录制一分钟左右的人物出镜视频,起名称,选参数(类型、分辨率1080P、不抠背景),提交任务等待训练。

训好后用文本驱动生成视频。如果你遇到乱码,让API在请求中文时用UTF-8编码。语音驱动时,先文字生成语音,再上传语音文件合成口播,效果更好。

封装成技能后,你只需要给一个视频链接,它自己会提取文案→转语音→合成口播视频,全程自动化。

知识库搭建(RAG与本地模型)

知识库不需要训练模型,直接上传PDF等文档就能做向量检索。我用的是IGflow框架,纯开源,支持本地化部署,不用外部API。

第一步,下载安装Docker桌面版,启动服务。第二步,在IGflow官方GitHub点Code→Download ZIP,解压。第三步,进入docker文件夹,在命令行执行安装命令。

注意:安装包约50G,默认在C盘,得提前留空间。执行完后浏览器输入localhost:80,注册登录。

在IGflow中,你需要配置Ollama来做本地大模型。先装Ollama,用命令下载chat模型(如千问2 7B)和embedding模型(如ZH中文embedding)。然后在IGflow→模型供应商→Ollama,添加模型。Windows用户要加环境变量`OLLAMA_HOST=0.0.0.0:11434`,否则连不上。

实际操作:点创建知识库,设置名称、语言,选本地embedding模型,解析方法选论文格式(利用deepdoc的OCR模块),上传PDF,点执行。系统会OCR、分段、embedding、入库。然后新建助理,选知识库,再提问就能得到带引用的答案。

知识库这块最大的好处是:内容随时更新,你不需重新训练模型。我放了几十篇行业论文进去,每次问问题它都能从文档中找到答案,比微调省事多了。

创建RAG知识库,上传论文PDF进行OCR与向量化存储

模型微调实战

微调是给模型“定制专业能力”的。我用千问2.5VL 3B模型做多模态微调——让它能看懂图片里的细节。

先新建conda环境(python 3.10),git下载项目或手动下载解压,安装依赖。CPU版的torch要卸掉,装GPU版(2.4.0,CUDA 12或11.x)。进项目路径,执行webUI启动命令,界面自动弹出。

选模型库搜“千问2.5 VL”,点模型文件看切片,点“下载模型”,用ModelScope的命令指定路径下载。手动下载后把文件夹路径传入微调工具,选LoRA方法。

关键在数据准备。数据集格式参考lava-factory项目下的`dit_infer.json`,格式为“message”包含content(角色user和assistant)。样本例子:穿安全帽和手套、人站施工现场、有车、吊车、有箱子。我截了5张图,每张标出作业人数、安全员是否在场、是否施工。让AI生成脚本处理数据,填充字段。

微调时选指令微调,训练轮数300,batch和梯度累积按你机器配置来,Lora参数用默认。点开始后终端先转换数据格式,再训练。200epoch后导出合并,选原始模型路径和微调结果路径,导出到新目录。

测试:合并后模型上传图片问“有几个人在作业、安全员是否在场、是否施工”,输出格式正确,识别准确率从以前的50%提高到90%以上。

微调门槛不高,但花时间在数据准备上。你得确保标注准确、一致,不然模型学歪了更难调。

选择微调基座模型(千问2.5VL 3B),查看模型文件并下载

RPA自动化数据采集

做分析没数据不行,我靠影刀RPA无缝抓取博主内容。这不复杂,拖拖拽拽就能编排流程。

先下载装影刀RPA(浏览器搜官网,免费下载),注册登录后新建PC自动化应用。装好浏览器插件,在扩展程序里开启开关。

建“我的文案采集助手”,拖拽“打开Excel表”组件,连接到本地Excel文件。再加“打开选择文件对话框”,选文件,输出路径。然后“获取已打开的网页对象”,选浏览器。

循环部分:拖“循环Excel内容”,遍历每行,设置行索引和列索引。循环内部加“打印日志”,输出当前行第一列的博主链接。再用“跳转至一个新网址”模块打开链接,等待加载。

博主主页打开后,用“fo次数循环”从0到4(循环5次),在里面点“点击元素”(捕获网页链接),等1秒。然后“获取元素对象”捕获文本内容,“写入内容至excel工作表”保存。

跑的时候注意:第一次跑容易报错——循环里加了“退出键”关闭页面,点元素时索引要动态赋值(设全局变量index与循环匹配)。我调了这个过程大概半小时,之后就能稳定运行了。

拖拽组件编排RPA流程,打开本地Excel读取博主链接

电商图文与视频生成流程

这块是做副业变现的关键。我拿电商详情页举例。

流程:用户上传产品图和对标图,AI分析参考图布局、颜色、内容,生成同风格详情页。工具推荐GPT imagine(支持中文文字,无需额外API),但不能用豆包做图文。

第一步配图像理解API(火山引擎豆包视觉模型,如豆包1.5视觉pro),用来分析参考详情页的布局、颜色等。第二步配图生图API(GPT imagine via 中转站,比官网和火山引擎便宜)。

实操:在火山方舟选视觉理解模型并开通,复制API key。测试时输入图片让模型理解内容,再让AI做图——先让AI拆解参考图的提示词,再用图生图API生成对应的详情页图。同一个详情页有几个图,就要生成几个,必须对应上。我把整个流程封装成技能,输入:文件夹含参考详情页图和一张实际产品图。输出:全部详情页图。

电商视频也类似:输入参考视频,AI自动切帧成九张图,分析风格和拍摄手法,生成九宫格图,再用即梦2一次性生成复刻视频。但注意:视频成本较高(15秒6-8元),建议先做5秒试水,用3个运镜图,480P、9:16竖版,看效果再跑量。

测试火山引擎图片生成API,根据提示词获得示例图

微信小程序开发

零代码开发小程序听起来唬人,但有了Codex,你只需要说话。

先注册微信小程序账号,认证后将APPID复制出来。下载微信开发者工具,安装后点加号创建项目——项目名称随便起,目录选新建空文件夹,粘贴APPID,后端服务选“微信云开发”(新账号6个月免费),点创建。

然后在Codex中选“使用现有文件夹”,选刚才创建的文件夹(已有模板代码),权限设完全访问。在Codex对话框里,你当客户、AI当产品经理,说需求:“我要做一个AI热点分析工具,包含搜索框、关键词推荐、数据可视化分析、自动生成视频标题大纲等功能。”

AI会先出需求文档(.md),然后做UI界面(用HTML展示),再写后端代码(调用API)。云环境用于第三方API调用和用户数据存储,需配置云函数。我做测试时遇到“网络开小差了”,翻了好几遍——原来云函数超时只有3秒,改成20秒就好了。

小程序开发过程可以不花一分训练费,整个应用从需求到界面到功能反复迭代,费的就是几块钱的token钱。测试通过后点右上角“上传”,提交审核。不想备案可以在“成员管理”加体验成员(最多15个微信号)让朋友扫码用。

获取微信小程序APPID,用于云开发环境配置

技能封装与自动化工作流

做完前面所有步骤后,最重要的事来了:把流程封装成技能包

为什么要封?因为同一套流程你以后要重复做(比如给不同产品生成详情页、给不同博主做账号分析),每次自己说一遍太傻了。封装好后,输入主题它自动执行,省时省力。

封装方法也简单:在你的项目文件夹里,Codex会自动创建`scalell.md`主文件和`s`可执行脚本文件夹。`scalell.md`记录技能的描述、输入、输出、执行步骤,`s`存代码和指令。

实操时:先让AI做几次全流程(生成标题→做图→做视频→剪辑),测试没问题后,对它说“把刚才的流程封装成技能”。它会自动把步骤写成标准化描述和代码。之后调用时,直接在对话框说“调取某某技能”或引用`scalell.md`链接,AI就能按模板执行。

我做过一个给历史人物做短视频的技能,输入“刘邦”,它自动出剧本→做8张配图→生成7段视频→创建剪映草稿,全程约4分钟。效率是之前的几十倍。

创建coded项目,设置完全访问权限以允许AI操作本地文件

注意事项与总结

讲白了,这课教的东西不是让你一口气学完的,是让你把它当成工具箱,用到哪步学哪步。前期不用每个环节都亲自做通,先理解流程,选1-2个你想干的尝试。

几个坑我先替你踩了:

  • **Hyper Frame插件只适合个人知识博主口播**,多人对话、复杂场景别用,效果一塌糊涂。
  • **语音模型本地部署**,必须指定ModelScope下载,不然慢到怀疑人生。
  • **数字人API测试**,先做5秒试水,别上来就60秒的长视频——成本和bug排查时间都翻倍。
  • **RPA采集**,跑之前关闭Excel文件,不然读写锁定报错。每步加个“等几秒”的延迟,防止页面没加载完。
  • **模型微调**,数据标注必须准确统一,否则模型学了错的更难搞。我一开始五张图标了好几次才达标。
  • **知识库搭建**,装Docker和IGflow时C盘至少留100G空间,不然夜里卡在“下载50%”上。
  • **小程序开发审核**,做之前想清楚要不要备案,不备案最多邀请15个体验成员。

如果你看到这里,最诚心的建议是:可以先从“口播自动化剪辑”和“知识库”两个方向下手。门槛低、免费额度多、见效快。跑通一个,你就有信心再啃后面的大模块。

别的项目我不评价,但这条路我走下过,不是吹的。

Avatar photo
离谱思维:网创项目网站长,坚持更新分享互联网各类网创项目和个人网创经验,欢迎大家的访问。
上一篇

网盘拉新工具号玩法:执行力拉满,轻松月入1W+

下一篇

番茄小说达人变现:全自动挂机阅读赚收益,日入300+

你也可能喜欢

发表评论

插入图片
Lip本人 Lip本人
Lip本人
返回顶部

互联网头等舱

① 本站文章项目内容大部分是站长通过各种付费网创社群搜集而来,免费分享给大家阅读学习,开开眼界。
② 更多项目实操视频教程可进入顶部菜单副业库内获取。
③ 团队实操项目情况均分享在朋友圈,欢迎围观(v:819955084)
PS:文章中出现的软件工具联系站长领取