从一句话到一张图：看懂 Stable Diffusion 的“潜空间扩散”生成流程（配图详解）

优质文章学习记录

08 Apr 2026 — 5 min read

Stable Diffusion Pipeline

Source: Aayush’s Blog, “Stable Diffusion using Hugging Face – Putting everything together” (2022).Used with attribution.

当你输入一句 “A dog wearing a hat（戴帽子的狗）”，模型最后输出一张高清图片。中间到底发生了什么？
这张图展示的，其实就是 Stable Diffusion 这类潜空间扩散模型（Latent Diffusion Model）最核心的工作流：文本 → 语义向量 → 潜空间噪声 → 逐步去噪 → VAE 解码成图像。
本文将按图逐块拆解，并补充它背后的关键概念与工程细节，让你真正理解扩散模型是如何“画画”的。

1. 这张图在讲什么？

这张图描述了典型的 Stable Diffusion 文生图管线：

Prompt 文本 → CLIP 文本编码得到 text embeddings
从高斯噪声开始初始化潜变量 latents
U-Net 在 text embeddings 条件引导下做多步迭代去噪（由 scheduler 控制）
得到最终的 conditioned latents
VAE 解码成真实像素图输出（如 512×512）

2. 模块一：CLIP Model —— 文本如何变成“可计算的语义”

图左侧是 CLIP Model，主要过程包括：

Tokenizer（分词器）：把文字拆成 token
Token to Embedding：把 token 映射到向量空间
输出 Text Embeddings (1×77×768)

2.1 为什么是 77×768？

以 SD 1.x 为例：

最大 token 长度固定为 77（包含起止符号等）
每个 token 对应一个 768 维语义向量（CLIP Text Encoder 的 hidden size）

因此最终的文本表示是一个矩阵：

\text{text\_embeddings} \in \mathbb{R}^{1 \times 77 \times 768}

这个 embedding 就是后续 U-Net 去噪过程的“条件信号”，相当于让模型知道：它去噪的目标应该朝向“戴帽子的狗”。

3. 模块二：Gaussian Noise → Latents —— 为什么从噪声开始？

图的右上角是 Gaussian Noise（高斯噪声）：

形状：1×4×64×64

这就是 Stable Diffusion 的“起点”。

3.1 为什么不是直接在 512×512 像素上扩散？

这是 Stable Diffusion 的核心创新：不在像素空间扩散，而在潜空间（latent space）扩散。

真实图像：3×512×512
潜空间：4×64×64

这相当于把图像压缩了 8 倍（512 / 64 = 8），计算量大幅下降。

这就是 Latent Diffusion 的意义：更快、更省显存，同时保持画质。

3.2 这 4 个通道是什么？

这是 VAE 编码后的 latent feature map 的通道数（对 SD 1.x 常见配置就是 4）。

4. 模块三：U-Net —— 扩散模型真正“画画”的地方

图中黄色块是 U-Net，它是扩散模型的核心网络，负责：

输入：当前 timestep 的 noisy latents（含噪潜变量）
条件：text embeddings
输出：噪声预测（或直接预测 x0 / v，取决于训练方式）

4.1 U-Net 为什么叫 U-Net？

因为它是“编码器-解码器”的结构，中间通过 skip connection 保留空间细节，适合做图像相关任务。

4.2 文本是怎么“进”U-Net 的？

通常通过 Cross-Attention（交叉注意力）：

Query 来自 latent feature
Key/Value 来自 text embeddings

这意味着：

模型每一步去噪时，都在不断“对齐”文字语义与图像潜空间结构。

4.3 CFG：提示词引导

虽然图里没写，但实际流程几乎都会用 Classifier-Free Guidance（CFG）：

同时跑 有条件（prompt） 与 无条件（空 prompt）
两者结果线性组合，让生成更贴近 prompt

\epsilon = \epsilon_{\text{uncond}} + s \left( \epsilon_{\text{cond}} - \epsilon_{\text{uncond}} \right)

其中 s 是 guidance scale（常见 5~12）。

5. 模块四：Scheduler —— 控制“加噪/去噪”的时间策略

图右侧橙色块是 Scheduler algorithm to add noise，它负责管理扩散过程中的：

时间步（timestep）
噪声强度（noise schedule）
采样算法（DDIM、Euler、DPM++ 等）

5.1 为什么图里写 “Repeat N times”？

因为扩散模型的生成不是“一步到位”，而是 多步迭代：

通常 N = 20~50
每一步根据 scheduler 指定的规则更新 latents

这就是所谓的 采样过程（sampling）。

去噪步数越多，通常细节越丰富，但耗时越长；不同采样器会影响风格与稳定性。

6. 模块五：VAE —— 从潜空间回到像素世界

图中绿色块是 VAE，它是一个：

Encoder：把图像压缩到 latent
Decoder：把 latent 解码回图像

在文生图里我们只用 Decoder：

image = VAE.decode(conditioned_latents)

输出图像尺寸是：3×512×512（RGB）

这也是图右下角 Output Image 的来源。

7. 串起来：Stable Diffusion 的整体流程（对应图）

结合图，我们可以用“工程视角”的伪流程理解：

输入 prompt
用 CLIP 把 prompt 编码成 text embeddings
初始化随机高斯噪声 latents（1×4×64×64）
for t in timesteps:
- U-Net(latents, t, text_embeddings) → 预测噪声
- Scheduler 根据预测噪声更新 latents
VAE 解码 latents → 输出 512×512 图片

8. 为什么这种结构强大？有三个关键优势

8.1 潜空间扩散：速度与质量的折中最佳解

相比像素扩散：更快、更省显存
相比 GAN：更可控、更稳定

8.2 CLIP 语义空间：文本可精细控制图像内容

Cross-attention + CFG 让 prompt 能精准影响形状、颜色、风格、细节。

8.3 Scheduler 可插拔：采样策略决定“生成气质”

不同 scheduler（Euler、DDIM、DPM++）决定：

清晰度
细节锐利程度
风格偏向
收敛速度

9. 读图小结

Stable Diffusion = 文本条件 + 潜空间扩散 + U-Net 去噪 + VAE 解码

Prompt 给方向
CLIP 给语义
U-Net 做生成
Scheduler 控节奏
VAE 把结果搬回像素世界

理解了这条链路，就可以掌握扩散模型最重要的知识骨架。

N46Whisper：让日语视频字幕制作变得如此简单

N46Whisper：让日语视频字幕制作变得如此简单【免费下载链接】N46WhisperWhisper based Japanese subtitle generator 项目地址: https://gitcode.com/gh_mirrors/n4/N46Whisper 还在为日语视频制作字幕而头疼吗？N46Whisper正是你一直在寻找的智能解决方案！这款基于云端AI技术的日语语音识别工具，彻底改变了传统字幕制作的繁琐流程，让每个人都能轻松上手。为什么你需要这款工具想象一下，原本需要数小时手动打字的工作，现在只需要几分钟就能完成。这就是N46Whisper带来的效率革命： * 零门槛使用：无需安装任何软件，打开浏览器就能开始工作 * AI精准识别：采用先进的Whisper技术，日语语音识别准确率惊人 * 云端极速处理：借助Google Colab的强大计算能力，处理速度超乎想象 * 双格式支持：ass和srt两种主流格式任你选择快速入门：三步搞定日语字幕第一步：准备环境打开Google Colab，上传N46Whisper.ipynb文件，系

Local Moondream2精彩案例分享：Stable Diffusion用户提示词优化前后对比

Local Moondream2精彩案例分享：Stable Diffusion用户提示词优化前后对比让你的电脑拥有"眼睛"，一键生成专业级绘画提示词 1. 引言：当AI绘画遇到"描述困难症" 很多Stable Diffusion用户都遇到过这样的困境：脑子里有很棒的创意画面，但就是不知道该怎么用文字描述出来。要么描述得太简单，生成效果不尽人意；要么描述得太复杂，AI反而理解偏差。这就是Local Moondream2的价值所在——它就像一个专业的"视觉翻译官"，能够看懂你的图片，然后用AI绘画最理解的语言，生成精准详细的英文提示词。本文将通过多个真实案例，展示Local Moondream2如何将普通用户的简单描述，优化成专业级的绘画提示词，让你亲眼见证提示词优化前后的惊人差异。 2. 什么是Local Moondream2？ 2.1 你的本地视觉助手 Local Moondream2是一个基于Moondream2构建的超轻量级视觉对话Web界面。简单来说，它能让你的电脑拥有"眼睛"

SmolVLA高算力适配：TensorRT加速可行性分析与ONNX导出实操

SmolVLA高算力适配：TensorRT加速可行性分析与ONNX导出实操 1. 项目背景与核心价值 SmolVLA作为一款专为经济实惠机器人技术设计的紧凑型视觉-语言-动作模型，在资源受限环境下展现出了令人印象深刻的性能。这个约5亿参数的模型能够同时处理视觉输入、语言指令和动作输出，为机器人控制提供了端到端的解决方案。在实际部署中，我们经常面临一个关键挑战：如何在保持模型精度的同时，进一步提升推理速度以满足实时控制需求？这就是TensorRT加速技术发挥作用的地方。通过将SmolVLA模型转换为TensorRT引擎，我们有望获得显著的性能提升，特别是在NVIDIA GPU硬件上。本文将带你深入了解SmolVLA模型的TensorRT加速可行性，并提供详细的ONNX导出实操指南，帮助你在自己的机器人项目中实现更高效的推理性能。 2. TensorRT加速技术解析 2.1 TensorRT的核心优势 TensorRT是NVIDIA推出的高性能深度学习推理优化器和运行时库，它通过多种技术手段提升模型推理效率： * 图层融合：将多个连续的操作层合并为单个内核，减少内

Codex，Copilot 是什么

Codex是什么 Codex 是 OpenAI 研发的一款专注于代码生成的大型语言模型，它可以根据自然语言描述自动编写程序代码，在软件开发、自动化测试等领域展现出了强大的应用潜力。下面为你详细介绍： 1. 核心功能 * 代码生成：Codex 能够依据自然语言指令生成代码，像函数、类或者完整的应用程序都不在话下。它支持多种编程语言，例如 Python、JavaScript、Java、C++ 等。 * 代码补全：和编辑器的自动补全功能类似，但 Codex 更加强大，它可以基于上下文理解开发者的意图，进而补全复杂的代码片段。 * 代码翻译：Codex 可以把一种编程语言编写的代码翻译成另一种语言，大大降低了技术栈迁移的难度。 * 解释代码：它能够将代码转换为自然语言，帮助开发者理解现有项目。 2. 技术原理 * 基于 GPT 架构：Codex 是基于 GPT（Generative Pre-trained Transformer）架构开发的，并且针对代码生成任务进行了优化。