用 AI 生成视频这件事,最近半年已经从”能不能做”变成了”怎么做出来”。但很多人在 ComfyUI 里跑出一个视频片段后,就不知道下一步该干嘛了——那一段 4 秒、480p、8fps 的东西,和真正能发出去的产品之间,还隔着很长的一段路。

这篇文章就来讲清楚这条完整链路:从 ComfyUI 生成第一帧,到最终发布到抖音、B 站、小红书上的成片,每一步该做什么、用什么工具、为什么这么做。

全文大约 20 分钟读完,建议你收藏之后,一边看一边动手做。

先看清:ComfyUI 到底能给你什么

ComfyUI 是一个本地 AI 视觉生成框架,基于节点式工作流,完全免费开源。它本身不是一个”视频生成软件”,而是一个”视觉生成引擎 + 工作流编辑器”。

在 ComfyUI 里,你能跑的 AI 视频模型主要有这几类:

模型 类型 输入 输出 3060 12G 能否跑
Wan2.1 / Wan2.2 文本→视频 文字提示 2-10 秒短视频 能(需 lowvram)
HunyuanVideo 文本→视频 文字提示 2-10 秒短视频 能(低分辨率)
CogVideoX 文本→视频 文字提示 4-6 秒短视频 能(最轻量)
AnimateDiff 文本→视频 文字/图片 4-16 帧动画 能(最成熟)
SVD 图→视频 图片 2-4 秒动画 勉强(12G 卡线)

3060 12G 之所以是 AI 视频创作的甜点卡,是因为它的 12GB 显存刚好踩在大多数视频模型的最低要求线上。合理配置能跑通上面所有模型。

但是,ComfyUI 直接输出的那段视频,通常长这样:

  • 分辨率 480x512 或 720x1280
  • 帧率 8-24fps(观感像 PPT)
  • 时长 2-10 秒
  • 画面可能有抖动、崩坏、色彩不一致
  • 是竖版、横版还是 16:9,取决于你设的分辨率

这段视频是素材,不是成品。

第一步:在 ComfyUI 里完成一次完整的生成工作流

真正能用的工作流,至少包含下面五个环节,它们可以串在一条 ComfyUI 工作流里一次性跑完:

1. 主模型生成

根据你想做的内容选模型。文字→视频选 Wan2.1 或 AnimateDiff;图→视频选 SVD 或 AnimateDiff + ControlNet。

这一步的关键提示词技巧:描述具体动作,不要只写风格。”一只猫在奔跑” 比 “一只猫” 好一百倍,因为视频生成模型对动态描述敏感得多。

2. 补帧(Frame Interpolation)

这是必做环节。

AI 生成的视频通常只有 8-12fps,人眼会觉得一卡一卡的。用 RIFE / AMT / FLAVR 节点把帧率插到 30fps 或 60fps,观感立刻从 PPT 变成视频。

3060 12G 跑 RIFE 补帧:一段 30 秒视频大概 1-3 分钟。

3. 超分辨率(Upscale)

把 480p 拉到 720p 或 1080p,用 SwinIR 或 Real-ESRGAN 节点。4x 倍率下,512→2048 单张图 10-30 秒,整个视频 5-15 分钟。

注意:超分不是万能的。如果原片已经糊了,超分只是把糊放大。

4. 人脸修复

AI 生成的人脸经常崩坏——手指扭曲、五官错位、表情僵硬。用 GFPGAN 或 CodeFormer 节点修复,尤其是有人脸出镜的内容必须加这一步。

5. 画面稳定化与色彩调整

用 Warp 节点做光流稳定化,解决画面抖动。用 Color Correct 节点统一色调。这一步不复杂,但做了之后成片质感提升很大。

把上面五步串成一条 ComfyUI 工作流,输入提示词,输出就是可用的”半成品成品”。

第二步:后期剪辑——这一步才叫”成品”

这是 AI 视频创作者最容易忽略的一步。

AI 一次只能生成几秒,但你想发一条 1 分钟的视频,就需要生成十几段素材再拼起来。拼接、转场、节奏,这些 ComfyUI 做不了,必须靠剪辑软件。

具体来说,后期剪辑要完成这些事:

多段素材拼接

AI 生成的素材每段只有几秒,1 分钟内容需要 10-20 段。在剪辑软件里把这些片段按节奏排好,是剪辑的核心工作。

转场与节奏

纯 AI 素材没有”呼吸感”。通过切镜时机、转场效果(叠化、闪白、缩放)、音效卡点,给视频注入节奏。这一层是目前 AI 视频创作的真正壁垒——同样的 AI 工具,有人做出 500 万播放,有人做出 500 播放,差的就在这里。

配音

这是降维打击。目前 90% 的 AI 视频账号没有配音,或者用的机器音。自己录,或者用 AI 配音工具(标贝、剪映配音),配上自己的文案,内容立刻有了”人味”。

配乐

配乐给情绪。用免费音乐库(剪映自带、Pixabay、YouTube Audio Library)避免版权风险。

字幕

剪映和达芬奇都有自动字幕识别,准确率对中文足够高。

调色与风格统一

AI 生成的各段素材色调往往不一致——有的偏蓝、有的偏黄、有的亮有的暗。在剪辑软件里做一次全局调色,整体感立刻上来。

剪辑软件怎么选

3060 12G 用户的最佳选择:

软件 价格 推荐度 适合谁
剪映专业版 免费 ★★★★★ 绝大多数 AI 视频创作者
达芬奇 免费 ★★★★☆ 对调色有要求的人
Premiere Pro 付费 ★★★★☆ 专业剪辑需求

我推荐剪映专业版。它免费、上手快,最关键的是内置了 AI 配音、自动字幕、音效卡点——这些恰恰是 AI 视频创作最缺的能力。

第三步:输出格式适配

每个平台的最佳参数不同,同一个素材要导出不同版本:

平台 分辨率 帧率 比例 时长
抖音 1080x1920 30fps 9:16 3 分钟+
小红书 1080x1920 30fps 9:16 或 3:4 30 分钟
B 站 1920x1080 60fps 16:9 30 分钟
视频号 1080x1920 30fps 9:16 30 分钟
快手 1080x1920 30fps 9:16 30 分钟

我的习惯是:在剪辑软件里做好一条主线版本,然后对需要不同分辨率和比例的平台,用达芬奇或剪映的”批量导出”功能导出多版本。

第四步:合规——很多人在这一步翻车

全平台对 AI 内容的要求都在收紧:

  • 必须标注 AI 生成:抖音、快手、B 站、小红书、视频号全部要求发布时勾选”AI 生成内容”。不标会被限流甚至下架。
  • 版权注意:AI 生成画面本身的版权归属目前法律上仍是灰色地带,但平台目前不追究。注意配乐版权,用免费素材库最稳。
  • 真人形象:如果 AI 生成了可辨认的真人形象,涉及肖像权问题,不要用在商业内容中。

完整工具链总结

这是我目前自己在用的链路,适合 3060 12G 的本地创作者:

环节 工具 说明
生成 ComfyUI(Wan2.1 / AnimateDiff) 本地免费,完全可控
补帧 ComfyUI(RIFE 节点) 12fps → 60fps
超分 ComfyUI(SwinIR 节点) 480p → 1080p
配音 剪映配音 / 即梦 AI 内置,免费
配乐 剪映音乐库 免费无版权风险
剪辑 剪映专业版 免费,内置字幕+转场
导出 按平台出不同版本 9:16 给抖音/小红书/视频号,16:9 给 B 站
发布 勾选 AI 标识 合规

整条链路零成本,3060 12G 就能跑通。

时间成本参考

以一条 1 分钟抖音短视频为例,新手的时间分配:

步骤 时间
构思选题 + 写文案 1-2 小时
ComfyUI 生成 + 后处理(12 段素材) 2-6 小时
剪辑软件合成 1-2 小时
配音 + 字幕 30 分钟
调色 + 导出 30 分钟
发布 + 标注 10 分钟
总计(新手) 6-12 小时

熟练后可以压到 2-3 小时。

最后想说

AI 视频的创作门槛在降低,但创作上限在提高。工具越来越强,但”做出好内容”这件事,永远取决于创意、叙事和人。

用 AI 工具生成画面只是最基础的环节,真正让内容有人看、有共鸣的,是你在画面之上加的那层”人味”——你自己的文案、你自己的声音、你自己的节奏。

这才是 AI 时代内容创作者的核心竞争力。