开篇引入
上个月有个朋友兴冲冲跑来找我,说他刷到一个云上天宫的视频,单条点赞57万,评论区全在问怎么做的。他花了三天时间,用AI生成了几十张图,没有一张能看。要么宫殿像普通庙宇,要么人物比例完全不对,云海跟棉花糖似的糊成一团。
他问我:那些爆款到底是怎么做出来的?
我做了3年AI视频副业,踩过的坑比他看过的教程还多。这类中式仙宫视频看着玄乎,拆开来看核心就三件事:图片质量、动态生成、剪辑节奏。图片决定你能不能火,视频决定观众愿不愿意看完,剪辑决定完播率。
这篇文章我把整套流程掰开揉碎讲清楚,包括提示词模板、模型选择、成本控制、变现路子,全部来自实操经验。
核心逻辑:巨物比例与透视错觉
先搞明白一件事:这类视频之所以爆,不是因为AI生成的画面有多精致,而是它精准击中了人对”巨物”的本能震撼。
你去看那些高赞的云上仙宫视频,几乎都有一个共同特征:人物在画面里只是一个小色点,宫殿却大到超出画框,向云端无限延伸。这种比例反差制造出强烈的空间压迫感,配合云海流动和光影变化,观众会不自觉停下来放大看细节。
具体怎么实现?记住三个关键词:巨物尺度、留白构图、光影层次。
人物要小,建筑要大,两者之间形成至少几十倍的体量差。画面上要有大面积的云海或留白,不能塞得太满。光线方向要统一,最好有那种穿透云层的丁达尔效应,或者夕阳斜照的暖色调。
做这类内容,构图最忌讳的是”板正”。正对着宫殿拍,画面完全对称,这种图生成出来大概率是废的。稍微带点仰角,或者人物放在画面三分之一的位置,空间感立刻就不一样了。
图片生成:提示词模板与画面风格控制
图片是整个视频的地基。我试过市面上几乎所有主流生图模型,GPT、banana、Stable Diffusion都跑过,折腾一圈下来,Midjourney在生成这种东方仙宫风格上还是最稳的。虽然也要抽卡,但出图质量和对提示词的理解能力确实领先。
生图提示词有个稳定模板,直接套用就行。核心结构是:场景描述+建筑细节+人物状态+镜头语言+光影色调。
我常用的一个模板长这样:
> 宏伟的东方仙宫建筑群,朱红巨柱,玉石栏杆,飞檐翘角,宫殿向云端延伸。前景有渺小的人物行走,中景是层层叠叠的宫殿楼阁,远景是连绵云海和巨大的日月。超广角镜头,仰拍视角,丁达尔光线穿透云层,整体色调偏暖金,国风水墨意境,8K高清。
注意几个容易出问题的点。第一,AI经常在画面里生成莫名其妙的文字或水印,生图时在提示词末尾加一句”画面不要出现任何文字、logo或水印”,能省掉不少后期修复的功夫。第二,同一段提示词最好多跑几次,Midjourney同一提示词出图的多样性很强,构图和光线差别可能很大,从中挑最满意的一张再进入下一步。

如果你实在不擅长写提示词,有个取巧的办法:找一张你觉得好看的参考图,直接发给AI让它反推提示词。比起电图,这种方式给AI的发挥空间更大,生成出来的画面往往更有惊喜。
图片生成后,如果有些细节不满意,比如画面里多了一栋不想要的房子,或者某片区域觉得碍眼,可以用局部编辑功能框选那块区域,输入”去除这里的房屋”之类的指令精准修改。视野不够宽广就用扩图功能,角度不合适就调整构图。

视频生成:动态提示词与模型选择
图片搞定后,真正让画面”活”起来的是视频生成环节。这里有两个选择:在线API生成,或者本地部署ComfyUI跑。
先说在线方案。目前CogVideoX 2.5(简称CD2.5)是这类风格视频综合效果最好的模型之一,动态表现比2.0版本强不少。操作流程不复杂:把选好的图片拖进去,配上视频提示词,选好模型和分辨率,点生成就行。
视频提示词和图片提示词是两套逻辑。图片提示词重点描述”画面里有什么”,视频提示词要写清楚”画面怎么动”。云往哪个方向飘、水怎么流动、人物是走路还是回眸、镜头是推近还是拉远,都要交代清楚。
我准备了两套视频提示词模板,一套低动态,一套高动态。低动态适合氛围静谧的开场镜头,云和水的运动幅度小,整体画面沉稳。高动态适合音乐情绪起来后的高潮段落,云的翻涌更剧烈,画面冲击力更强。根据视频的叙事节奏交替使用,观感会好很多。

关于模型选择,有个容易忽略的坑:每个模型对提示词的偏好不一样。CD2.5那套提示词风格,未必适用于MiniMax或其他模型。最好先让AI去查一下官方示例和社区里的提示词参考,按照目标模型的偏好改写一遍,出片效果会有明显提升。
模型参数方面,画面比例保持16:9,分辨率720P起步。CD2.5的720P每秒成本大概在0.78元左右,480P折合下来约0.21元每秒,可以根据预算选择。时长建议单镜头5到8秒,别拉满。我测试过,5秒视频生成大约4分半钟,15秒就要接近50分钟,时长翻3倍但时间翻了10倍,得不偿失。

本地部署是另一条路,适合有显卡、想省API费用的玩家。流程大概是这样:下载爆款视频,丢给AI自动截取关键帧并高清重绘,拿到参考图后让AI扩展出同场景的不同镜头,再反推出每个关键帧对应的视频提示词。

本地生视频的最大成本是时间不是钱。我用的4090,5秒视频大约4分半钟,15秒要接近50分钟。所以镜头时长控制在5到8秒最划算,具体让AI按每个镜头的内容自己安排就行。

这里插一句,本地部署对新手不太友好。要装ComfyUI,配置工作流和模型,还要处理各种依赖。我当初折腾了整整两天才跑通。如果你只是想试试水,建议先从在线API开始,跑通整个流程再考虑本地化。
后期剪辑与调参
所有视频片段生成好后,剪辑环节直接决定最终成片质感。
我用的是剪映,免费且够用。流程很简单:导入所有片段,按叙事顺序排列,调整每段时长,添加转场和滤镜,最后配上合适的背景音乐。

音乐选择上,适配中式仙宫主题的曲子目前主要就两首,一首叫《相逢是》,另一首叫《空山野马》。我个人更喜欢前者,旋律和这类画面的契合度更高。导入音乐后,用剪映的”自动踩点”功能拆分节拍,再按照节拍节奏去安排片段切换,卡点准确的话,成片的观赏性会提升一个档次。
滤镜别加太多,选一两个淡雅风格的就够了。这类视频本身的色彩层次已经很丰富,过度调色反而会破坏原有的光影质感。
有个经验供参考:视频生成时单个场景出4到5秒就够了,我习惯出5秒,为了给剪辑留出缓冲空间。所有片段拼接时,注意相邻镜头之间的色调统一,避免画面风格跳跃太突兀。
变现方式与创新方向
视频做出来了,怎么变现?我实操下来主要有三条路。
第一是创作者激励。平台对这类原创视频有流量扶持,播放量直接换算收益。不过这个收入不稳定,爆款和扑街的差距能到几十倍。
第二是IP授权和视觉定制。当你的账号做出名堂,会有游戏公司或品牌方来找你合作,制作游戏视觉画面、概念宣传片之类的。这个单价高,但需要积累。
第三是动态壁纸。把视频做成手机或电脑的动态壁纸出售,属于被动收入,适合批量产出后挂到相关平台。
关于创新方向,我提供两个思路。一是从纯风景展示升级为叙事或微剧情,加入简单的故事主线或角色动线,让观众有代入感。二是做跨界风格融合,比如东方赛博、中式科幻,把传统建筑和未来机械、霓虹光效组合在一起,视觉反差越大越容易出圈。
总结
这套流程跑下来,你会发现中式仙宫视频的制作门槛没有想象中那么高。核心就三步:用Midjourney生成高质量图片,用CogVideoX让画面动起来,用剪映完成节奏把控。每一步都有成熟的工具和模板支撑,真正考验人的是审美和耐心。
如果你刚接触这个领域,可以先从模仿开始。找几个你喜欢的爆款视频,拆解它们的构图和运镜方式,用同样的逻辑去生成自己的内容。跑通一遍完整流程后,再慢慢摸索属于自己的风格和叙事方式。
先做出一条完整的视频,哪怕只有10秒。做完第一条,你就知道下一步该往哪个方向使劲了。
视频教程下载
文章可能无法完整分享清楚,下面是原项目视频教程,粉丝朋友可以自行下载学习。提前说明:资源链接内可能会存在引流广告信息,请自行甄别。
百度网盘:
