外观
文生图模型如何工作
一句话总览:文生图 ≈ 视频模型同一套扩散/DiT 原理的"单帧特例"——视频生成模型如何工作讲过的机制(扩散、潜空间、DiT、CFG、流匹配、蒸馏)全部成立,不重复讲。本章只讲图像特有的三件事:谱系怎么演进到今天、图生图与指令修图怎么工作、图像侧参数各自对应什么实操含义——最后落回漫剧管线的三条出图纪律。
1. 与视频模型的关系:单帧特例
把视频模型原理的时间维拿掉,就是图像模型:一帧画面被 VAE 压进潜空间、切成 patch 当 token、DiT 在文本条件下迭代去噪、再解码回像素。没有帧间注意力,所以图像没有"闪烁/果冻/中途变脸"这组时间维问题——但它有自己的高发翻车区:手部、文字、结构这些单帧内的高频细节(VAE 压缩丢高频的机制不变,见视频模型原理 §2)。
两个值得知道的差异:
- 图像模型成熟度高视频模型 1~2 代:Latent Diffusion 图像模型 2022 年已产品化,视频 DiT 到 2024 年才起势——所以漫剧管线把角色一致性、构图、光影全部锁在图像阶段("能修、能局部重绘、能反复调"的阶段),视频模型只承担运动。这不是偏好,是两代成熟度差决定的工程分工;
- 图像原生分辨率更高:2025 年后的图像模型原生 2K~4K 直出(视频还在 720P/1080P 爬坡)——图像阶段的"静"与"高清"是优势不是短板,它给了局部重绘与静帧化(剪辑)足够的像素余量。
2. 谱系演进:从 U-Net 到统一多模态
理解你手里的工具处在哪一代,就知道该对它有什么期待。图像生成的五代简史(均为论文或官方口径):
| 代际 | 代表 | 架构要点 | 对你出图的意义 |
|---|---|---|---|
| 2022 | Stable Diffusion 1.5(LDM, CVPR 2022) | VAE + U-Net + CLIP 文本编码器,潜空间开源起点 | 开创了"提示词工程"时代——短词、关键词堆叠 |
| 2023 | SDXL(arXiv:2307.01952) | U-Net 大 3 倍、双文本编码器 | 高分辨率与细节跃升 |
| 2024 | SD3(arXiv:2403.03206)/ FLUX.1(BFL 官方,SD 原作者班底) | DiT/MMDiT 取代 U-Net、flow matching 取代 ε-预测、T5 大文本编码器加入并成为主力(CLIP 仍并用) | 长句自然语言描述开始可用;采样步数大降 |
| 2025~ | 统一多模态模型:GPT-4o 图像(OpenAI 官方)、Gemini 2.5 Flash Image(Google 官方)、Seedream 系(见下) | 生成与编辑统一进一个模型、多轮对话修图、多图参考 | 当前主力形态——即梦/豆包底层就是它 |
三条演进主线,每条都对应一个实操体感:
- U-Net → DiT(MMDiT):与视频模型同一波架构换代(机制见视频模型原理 §3)——画面 patch 与文本 token 在同一注意力里交互,构图与文字的指令遵循同时变强;
- CLIP → T5/大语言模型编码器:文本理解力跃升——这是"为什么新一代模型听得懂长句、分得清'黑发男性与白发老者'"的直接原因(属性污染问题大幅缓解,但没有根除,多人同框规避策略照旧,见提示词工程 §1);
- ε-预测 → flow matching:采样轨迹更直、步数更少(机制见视频模型原理 §1)——2K 图秒级直出的前提。
"自回归 vs 扩散"的分层口径(2025 年后最容易讲错的一点,写作与阅读时都请分层):OpenAI 官方称 GPT-4o 图像为"自回归统一多模态模型"(文本/视觉端到端训练);但具体怎么逐块出图,官方未公开架构细节,学界的逆向推测(自回归视觉 token + 扩散解码头)不能当作官方结论引用。Gemini 与 Seedream 的闭源部分同理——本教程一律标"官方未公开"。
漫剧主力:Seedream 系演进坐标
你的主力工具(即梦)底层就是这条线(按公开资料整理,截至 2026 年 9 月):
- Seedream 3.0(技术报告 arXiv:2504.11346,2025-04):MMDiT 架构、中英双语原生、原生 2K、文字渲染准确率英文 94%/中文 90%——"画面里不写小字"的纪律在松动,但贴图路线仍是稳妥解(分镜·信息镜头);
- Seedream 4.0(技术报告 arXiv:2509.20427,2025-09):文生图与图像编辑联合训练、参考图超过 10 张仍保持结构稳定(论文自评口径)、2K 图约 1.4 秒——多图参考能力的代际跳跃;
- Seedream 4.5(2025-12【官方,发布口径见财联社等报道】):主打跨图一致性模块——同批多图的人物身份/服装/光照统一,角色一致性的平台级加码;
- Seedream 5.0(Preview 2026-02-10 上线【官方/媒体】,Pro 版 2026 年中迭代【官方】):联网实时检索生图、思维链推理、示例式编辑(给前后对照图让模型迁移同类变换)、图层分离与设计理解——无公开技术报告,架构细节官方未公开。
实操推论:模板纪律的价值在变,不在消失。文本理解变强后,"画风词必须放句首、短句关键词"的硬约束在放松(长自然语言描述也可行);但画风定版的固定模板依然是全剧统一的工程手段——它解决的从来不只是"模型听不懂",更是"几百张图如何不漂移"。
3. 图生图与局部重绘:中途起笔的去噪
图生图(img2img)机制:把原图经 VAE 编码进潜空间 → 按比例注入噪声 → 从中途开始去噪。那个比例就是重绘幅度(denoising strength)——它决定"起点离原图多远":
text
0.0 = 输出与原图完全相同 0.3 ≈ 只改细节纹理
0.5 ≈ 保留构图、重画内容 0.8+ ≈ 接近重新生成(原图只剩影子)**局部重绘(inpainting)**是图生图的蒙版版:蒙版区域加噪重建、其余区域保持不动;专用重绘模型还额外接收"干净原图 + 蒙版"两路条件,边缘融合更好(机制与"参考图注入"同属条件注入家族,见角色一致性)。
实操推论一:表情差分为什么必须用局部重绘(图像资产 §3)——只给眼、嘴区域加噪,脸型、发型、配色在数学上零改动,这就是"表情一致性的关键手法"的机制解释。
实操推论二:修手部崩坏时重绘幅度取 0.4~0.6 是经验甜区——太低手还是那只崩手,太高会把周围画乱、引入第二个待修区域(社区经验口径,以你的实测校准)。
4. 指令修图:为什么"听得懂话"
"把左手改为拿咖啡"这种自然语言修图,机制不是玄学,是数据工程。开山之作 InstructPix2Pix(CVPR 2023)的配方:用 GPT-3 批量生成编辑指令文本、用文生图模型批量造"编辑前 → 编辑后"对照图——生成 45 万+ 候选编辑对、过滤后约 31 万对用于监督微调:模型"听得懂指令",是因为它在几十万对(指令, 原图 → 改后图)样本上被反复喂过。
2025 年后的新一代(FLUX.1 Kontext,arXiv:2506.15742;Qwen-Image-Edit,arXiv:2508.02324;Seedream 4.0 起)把这件事做成了统一序列建模:参考图经 VAE 编码成 token,与待生成 token 拼进同一个序列(in-context),生成与编辑统一在一个模型里——"看图说话"和"看图改图"成了同一种能力。Qwen-Image 还做了双编码:同一张输入图同时喂给视觉语言模型(取高层语义)与 VAE(取低层细节),编辑时语义连贯与视觉保真两头都保。
实操推论一:修图指令三要素(动作明确、数值量化、一次一个指令)有了机制背书——指令模型在"明确、单一"的样本上学得最好;一次下三个指令 = 要求模型外推到训练分布稀疏区,翻车率自然高。
实操推论二:多轮编辑有质量衰减——每一轮编辑都是一次 VAE 编解码(高频细节有损,机制见视频模型原理 §2)。所以母图(定妆照等)存档用无损 PNG、中间文件不反复转存(数字媒介基础·图像),重大修改回母图重起一轮,别在第 5 手编辑结果上继续叠。
5. 图像侧参数地图
图像工具的参数面板,每个滑块对应一个已知机制(平台命名各异,以当前页面为准):
| 参数 | 机制 | 实操含义 |
|---|---|---|
| 种子(seed) | 初始化随机噪声的随机数 | 同种子 + 同参数 + 同模型版本可复现同图——调好结构后固定 seed 微调措辞(单变量调试的复现手段);换 seed = 换一条采样路径(图像版抽卡决策树第 3 级的零成本换法)。注意:跨模型版本/跨平台同 seed 不复现 |
| 步数(steps) | 迭代去噪次数 | 平台"极速/高品质"档的本质 = 步数与蒸馏程度(视频模型原理 §1);探索用低步数、定稿用高步数 |
| 引导强度(CFG) | 条件预测与无条件预测的差值放大倍率(Ho & Salimans 2022,机制见视频模型原理 §1) | 拉高更贴提示词但易过饱和/僵硬;注意新一代 flow/蒸馏模型的推荐值远低于 SD 时代经验,别拿旧数值硬套 |
| 参考强度 | 与 CFG 不是一回事——它是"文本 vs 参考图"两路条件的权重分配(即梦 API 对应参数官方定义为文本影响程度,社区滑块语义为"越遵循参考图") | 甜区与调参场景见图像资产 §5 调参表;漂移往高调、僵硬往低调 |
| 负面提示词 | 把 CFG 的"无条件"一路替换为"负方向条件" | 该进负面栏的内容别写进正文("不要出现手"反而激活手——提示词工程铁律 3) |
实操推论:换工具/换模型版本后,提示词与参数经验要重新做单变量校准——各家文本编码器、训练分布与默认参数都不同(失效模式与迁移纪律见提示词工程 §5)。
6. 落到漫剧:三条出图纪律的机制背书
图像资产章的三条核心纪律,现在可以把"为什么"补齐:
- 参考图锁角色 → 图像条件的信息量比文本条件大几个数量级(同一段外貌,文字几十个 token vs 图像几千个 patch token);平台参考功能的技术原型是 IP-Adapter 的解耦交叉注意力(详解见角色一致性 §2),新一代统一多模态模型则把参考图直接拼进上下文序列(§4)——"参考图管像谁,提示词管干什么";
- 一图一难点 → 注意力资源有限:多个精细物件同图,各自分到的注意力都不足以定型(注意力稀释机制见提示词工程 §1),翻车率近似相乘——拆镜是降维打击(调试实录见图像资产 §5);
- 单变量调试 → 采样路径对一切输入敏感(提示词、seed、参考强度、步数),一次改两处就永远无法归因"哪处起了作用"——单变量不是慢,是唯一能积累确定性的路径。
出图准确率四层框架(语义符合/资产一致/无瑕疵/工程达标)与机制的对应关系:语义层问题找文本编码与注意力(§2),一致层问题找条件注入(§4、§6),瑕疵层问题找高频细节与 VAE(§1),工程层是纯流程——诊断地图的每一层,都有机制可回。
自测
- 为什么说文生图是视频模型原理的"单帧特例"?图像没有哪组视频特有的问题,又多了哪组自己的问题?
- 为什么新一代模型的"指令遵循"比 SD 时代强?(至少说出两条架构原因)
- 修手部崩坏时,重绘幅度应该往高调还是往低调?为什么?
- "参考强度"和"引导强度(CFG)"是同一个东西吗?各管什么?
- 为什么重大修改应该回母图重起一轮,而不是在第 5 手编辑结果上继续改?
查看答案
- 把时间维拿掉两者同构:VAE 潜空间 + patch token + DiT 去噪 + 文本条件注入(见 §1)。图像没有帧间注意力带来的闪烁/果冻/中途变脸;多了单帧内高频细节问题——手部、文字、结构(VAE 压缩丢高频的同一机制在单帧内的表现)。
- ① U-Net → DiT/MMDiT:画面 patch 与文本 token 在同一注意力里交互;② CLIP → T5/大语言模型文本编码器:文本理解力跃升(另可加 flow matching 让采样更稳)。三者共同让长句描述与复杂指令可用(见 §2)。
- 取中间甜区(经验 0.4~0.6)。太低:起点离崩手太近,重画出来的还是那只手;太高:起点离原图太远,周围区域被一起重画、引入第二个待修区域(见 §3)。
- 不是。CFG 管"文本条件的推力有多大"(条件 vs 无条件的差值放大);参考强度管"文本与参考图两路条件谁说了算"(条件之间的权重分配)。混用两者的经验数值是新手高频错误(见 §5)。
- 每轮编辑都是一次 VAE 编码-解码,高频细节逐轮有损;叠加多轮后画质与细节持续衰减。母图是无损存档的"源码",重大修改回源码重起(见 §4 实操推论二)。
延伸阅读
- Latent Diffusion 论文(LDM/SD 的起点):https://arxiv.org/abs/2112.10752
- SD3 论文(MMDiT + rectified flow):https://arxiv.org/abs/2403.03206
- FLUX.1 Kontext 论文(in-context 统一生成与编辑):https://arxiv.org/abs/2506.15742
- Qwen-Image 技术报告(双编码编辑):https://arxiv.org/abs/2508.02324
- Seedream 3.0 / 4.0 技术报告:https://arxiv.org/abs/2504.11346 · https://arxiv.org/abs/2509.20427
- InstructPix2Pix 论文(指令编辑的数据配方):https://arxiv.org/abs/2211.09800
- CFG 原论文:https://arxiv.org/abs/2207.12598