ComfyUI 全景介绍:你即将踏入的 AI 创作世界
2026-08-09 更新
由 AI智能库 编写
一、ComfyUI 是什么
1.1 一句话定义
ComfyUI 是一个基于节点(Node)的 Stable Diffusion 图形化操作界面与推理引擎。
你可以把它理解成“AI 绘画的乐高积木”——每一个功能模块是一个节点(方块),你用线把它们连起来,数据从一个节点流向下一个节点,最终输出一张图片或一段视频。
1.2 它在 AI 绘画生态中的位置
目前主流的 AI 图像生成工具有三条路线:
| 工具 | 运行方式 | 特点 | 适合人群 |
|---|---|---|---|
| Midjourney | 闭源云端 | 输入文字→出图,极简 | 设计师、快速出图 |
| SD WebUI (A1111) | 本地/云端 | 表单式操作,插件丰富 | 入门用户 |
| ComfyUI | 本地/云端 | 节点式工作流,高度自由 | 进阶用户、商业生产 |
ComfyUI 不是用来替代 Midjourney 的——它是一套可编程的图像/视频生成引擎。当你需要精确控制每一步、需要把流程复用给团队、需要接入 API 做批量生产时,ComfyUI 几乎是唯一的选择。
1.3 为什么不直接用 Midjourney
这个问题很关键。很多新手会问:”MJ 一句话就出图了,为什么要学这么复杂的 ComfyUI?”
答案在于控制力和生产力:
- MJ 像自动挡汽车——踩油门就走,但你没法手动换挡
- ComfyUI 像手动挡赛车——学习成本更高,但你能精确控制每一个参数、每一个环节
- 加载自己的 LoRA 模型,让 AI 画出你指定的人物/风格
- ControlNet 精准控制,用骨骼图控制人物姿势、用深度图控制空间关系
- 工作流复用,一次搭建,团队所有人一键复用
- 视频生成,文生视频、图生视频、首尾帧控制
- 数字人,图片对口型、动作迁移、人物替换
- API 自动化,批量生成 1000 张电商主图,无需人工点击
二、核心概念:节点式工作流
2.1 什么是”节点”
节点(Node)是 ComfyUI 的最小功能单元。每个节点长成一个圆角方块,包含:
- 输入端口(左侧):接收上游数据
- 输出端口(右侧):向下游输出结果
- 参数(方块内部):可调节的设置项
例如最常用的 Load Checkpoint 节点,它没有输入(它是起点),但输出三个东西:MODEL(模型权重)、CLIP(文本编码器)、VAE(变分自编码器)。
2.2 什么是”工作流”
工作流(Workflow)就是一堆节点用线连起来形成的”流水线”。数据从左边的节点出发,经过中间节点的处理,最终到达右边的输出节点。
下面这张图展示了一个最标准的文生图工作流:
让我们逐个节点解读这张图:
| 节点 | 作用 | 关键参数 |
|---|---|---|
| Load Checkpoint | 加载大模型(如 SDXL) | 选择 .safetensors 文件 |
| CLIP Text Encode (正向) | 把提示词编码为模型能理解的向量 | a beautiful girl... |
| CLIP Text Encode (负向) | 把不想要的内容编码为约束 | bad quality, blurry... |
| Empty Latent Image | 创建空白潜空间画布 | 宽 512 × 高 512 |
| KSampler | 核心!执行扩散采样生成图像 | steps=20, cfg=7, sampler=euler |
| VAE Decode | 把潜空间数据解码为可见图像 | — |
| Save Image | 保存最终图片 | output.png |
2.3 数据流向
用一句话概括文生图的数据流:
模型 → 编码提示词 → 在空白画布上采样 → 解码成图片 → 保存
这个流程贯穿整个 ComfyUI 学习的始终。后面所有的高级工作流(图生图、ControlNet、视频生成),本质上都是在这条主干上增加分支和控制节点。
三、ComfyUI vs 传统 WebUI
3.1 操作方式对比
| 维度 | ComfyUI | WebUI (A1111) |
|---|---|---|
| 操作模式 | 节点连线,可视化编程 | 表单填参数,点按钮 |
| 工作流复用 | 保存为 JSON,一键加载 | 需手动记录参数 |
| 复杂逻辑 | 支持循环、条件分支、并行 | 难以实现 |
| 学习曲线 | 较陡(需理解节点概念) | 较平缓 |
| 新模型适配 | 第一时间支持 | 较慢 |
| API 调用 | 原生支持 | 需额外配置 |
| 资源占用 | 更低(按需加载节点) | 较高 |
- 刚入门、只想出图玩玩 → WebUI 或 Midjourney
- 想深度控制、做商业生产、做视频 → ComfyUI
- 团队协作、批量自动化 → ComfyUI
本课程专注于 ComfyUI,因为它是 2026 年 AI 创作(图像+视频+数字人)的事实标准。
四、ComfyUI 能做什么
4.1 图像生成
- 文生图:输入文字描述,生成图片
- 图生图:输入参考图 + 文字,生成新图
- 局部重绘:只修改图片的某个区域
- 外扩补图:把图片向四周扩展
- 高清放大:低清图变高清
- 图像编辑:换背景、换衣服、改表情
4.2 视频生成
- 文生视频:文字描述 → 动态视频
- 图生视频:静态图 → 让它动起来
- 首尾帧控制:指定开头和结尾帧,AI 生成中间过渡
- 视频插帧:让卡顿视频变流畅
- 视频高清放大:提升视频画质
4.3 数字人
- 对口型:图片/视频 + 音频 → 嘴型同步说话
- 动作迁移:把一段舞蹈动作迁移到你的图片人物上
- 人物替换:把视频中的人脸换成另一个人
4.4 声音克隆
- 语音克隆:用几秒参考音频克隆任意人的声音
- 文字转语音:输入文字,用克隆的声音朗读
4.5 商业应用
AI 头像写真、电商主图、产品摄影、AI 短剧、动画、宣传片、数字人直播带货、批量内容生产。
五、课程总览与学习路线
5.1 七大章节一览
| 章节 | 主题 | 课时 | 核心能力 |
|---|---|---|---|
| 1 | 云端入门 | 2-7 | 不装软件也能用 ComfyUI |
| 2 | 本地部署 | 8-15 | 把 ComfyUI 装到自己的电脑 |
| 3 | 图像工作流 | 16-36 | 掌握所有主流图像模型 |
| 4 | 视频工作流 | 37-58 | 从静态图走向动态视频 |
| 5 | 影视理论 | 59-62 | 让画面具备电影感 |
| 6 | 高阶创作 | 63-115 | 完整项目实战 |
| 7 | 商业实战 | 116-128 | 商业级广告片制作 |
5.2 难度成长
课程遵循”认知 → 实操 → 进阶 → 精通 → 实战”的递进逻辑:
- 第 1-15 课:零基础入门,跑通第一个工作流(难度 ★★☆☆☆)
- 第 16-36 课:图像生成核心,掌握所有主流模型(难度 ★★★☆☆)
- 第 37-58 课:视频生成,进入动态领域(难度 ★★★★☆)
- 第 59-128 课:影视理论 + 项目实战(难度 ★★★★★)
六、前置准备
硬件要求
| 项目 | 最低配置 | 推荐配置 |
|---|---|---|
| 显卡 | NVIDIA 6GB 显存 | NVIDIA 12GB+ 显存 |
| 内存 | 8GB | 16GB+ |
| 硬盘 | 50GB 可用空间 | 200GB+ SSD |
| 系统 | Win10 / macOS 12 / Linux | Win11 / macOS 14 |
第 1 章的 RunningHub 云端方案就是为你准备的,打开浏览器就能用,不挑硬件。
软件准备
- Git(用于下载插件)
- 7-Zip(解压模型文件)
- 浏览器(Chrome / Edge)
- 科学上网工具(下载模型时需要)
七、关键术语速查
后面会反复出现这些术语,先混个眼熟:
本课小结
- ComfyUI 是节点式工作流的 AI 创作引擎,控制力远超 Midjourney
- 核心思想是数据在节点间流动,最终输出图像/视频
- 它能做图像、视频、数字人、声音克隆、商业生产
- 课程共 128 课时,从云端入门到商业实战,循序渐进
课后任务
- 浏览课程总目录,找到你最期待的 3 节课
- 确认你的硬件配置:在命令行输入
nvidia-smi查看显卡信息 - 思考一个问题:你最想用 ComfyUI 做什么?把答案记下来,这将是你学习的最大动力
第 02 课:ComfyUI 工作流底层运行原理
我们将深入拆解节点、连接、数据类型,搞懂 ComfyUI 到底是怎么把一行文字变成一张图片的。这是理解后续所有工作流的基础。








