外观
Midjourney 与图像生成
2022 年 8 月,美国科罗拉多州博览会(Colorado State Fair)年度艺术竞赛的数字艺术类奖项爆出大新闻:一位名叫 Jason Allen 的参赛者用 Midjourney 生成、再经 Photoshop 与 Gigapixel AI 增强的图像《Théâtre D'opéra Spatial》拿到了第一名。消息传开后,"AI 绘画能否算艺术"的争论迅速出圈,也把**文生图(text-to-image)**这项技术第一次真正推到了公众面前。
如果把文生图看作一场"造图革命",Midjourney 就是这场革命里最受瞩目的产品之一:它不是最早上线的(DALL·E 2 更早),不是技术最开放的(Stable Diffusion 完全开源),但它用一套以"美学"为核心的产品方法论,把 AI 图像生成变成了一门数亿美元级的订阅生意。本文以 Midjourney 为切口,复盘 2022–2023 年文生图爆发的完整故事:三足鼎立的产业格局、扩散模型的技术底座、Midjourney 的产品迭代,以及这场革命对设计、版权与创作者经济的深远影响。想看技术底层原理,可先读扩散模型与生成式 AI。
一、2022–2023:文生图的"三足鼎立"
文生图不是 2022 年才有的想法。早在 2015 年前后,图像描述与条件生成模型就已在像素层面尝试,但质量远不够用。真正的引爆点是 2021–2022 年扩散模型(diffusion model)成熟之后——它把"文字变图"从"能看出轮廓"推进到了"以假乱真"。
2022 年是决定行业格局的一年,三家代表同时发力:
| 产品 | 厂商 | 关键时间 | 开放程度 | 特色 |
|---|---|---|---|---|
| DALL·E 2 | OpenAI | 2022.04 发布 | 闭源、排队、按图计费 | 真实感飞跃,语义理解强 |
| Stable Diffusion | Stability AI | 2022.08 开源 1.4 | 权重开源,本地可跑 | 生态最大,可控可改 |
| Midjourney | Midjourney Inc. | 2022.07 公开 beta | 订阅制、Discord 内使用 | 美学风格登顶,社区最热 |
三条路线的定位差异非常清晰:
- DALL·E 2 代表"研究驱动":OpenAI 从 DALL·E 1(2021 年)到 DALL·E 2 打磨了一年多的真实感,发布即惊艳业界,但闭源加排队让大众只能"围观";
- Stable Diffusion 代表"开源驱动":在 LAION-5B(约 58.5 亿图文对)数据集上训练,权重以相对开放的许可公开,任何人都能下载、改造、本地部署,直接催生了庞大的社区生态;
- Midjourney 代表"产品驱动":它既不发表研究论文,也没有开源野心,而是把"生成结果好不好看"做到极致,用 Discord 机器人这种极低的使用门槛收割大众市场。
为什么恰好在 2022 年爆发?
三大要素在那两年恰好同时成熟:扩散模型在 2020–2021 年完成理论奠基(DDPM、DDIM、LDM),CLIP 在 2021 年解决了"文字—图像对齐",而 LAION-5B 这类海量图文对数据集与规模化算力让"训得动"成为现实。技术、数据、算力三碰头,文生图才从实验室走向大众。这段演进的完整脉络见演进简史。
二、技术底座:扩散模型如何让"文字变图"
不管产品形态怎么变,2022 年这批文生图系统的技术底座高度一致:扩散模型 + 文本编码器 + (可选)控制与定制插件。
1. 从 DDPM 到 LDM:在潜空间里"去噪"
扩散模型的核心思想是"先破坏、再学习恢复":训练时给图像逐步加高斯噪声直到变成纯噪声,同时让神经网络学会反向去噪;生成时从随机噪声出发,一步步"还原"出一张符合训练数据分布的图像。**DDPM(Denoising Diffusion Probabilistic Models,去噪扩散概率模型,2020)**证明了这条路能产出高质量图像,但有个致命问题——慢:要在像素空间迭代上千步。
**Latent Diffusion Models(LDM,潜空间扩散模型,2022)**用一个巧妙的工程化改造解决了它:先在潜空间(latent space)里扩散,而不是在像素空间。先用一个自编码器把 512×512 的图像压缩成 64×64×4 的潜变量(约压缩 48 倍),再在这个低维空间里加噪、去噪,最后用解码器把潜变量还原成图像。计算量直接下降一个数量级——Stable Diffusion 正是 LDM 的产品化,这也是它能在消费级 GPU 上跑起来的原因。更完整的数学原理见扩散模型与生成式 AI。
2. CLIP:让文字和图像"对齐"
光有图像生成器还不够,系统还得"听懂"人类写的提示词。这里的关键组件是 CLIP(Contrastive Language-Image Pre-training,对比语言—图像预训练),OpenAI 2021 年提出。CLIP 用约 4 亿个"图片—文字"对做对比学习,把文本和图像映射到同一个语义空间:一句"一只坐在雪地里的狐狸"和一张对应的照片,在空间里的距离应该很近;和不相关的图片应该很远。
Stable Diffusion 1.x 与 Midjourney 早期版本都直接借用 CLIP 的文本编码器:用户输入的提示词被编码成语义向量,通过交叉注意力(cross-attention)机制注入扩散模型的每一层,让"去噪"过程始终朝向"与文字匹配"的方向。CLIP 的局限也很明显——上下文窗口短(77 个 token)、对中文等非英语支持弱、对抽象概念(如"悲伤的黄昏")理解有限,这些短板成了后来提示词工程(prompt engineering)大量技巧的出发点。多模态对齐的更完整介绍见多模态模型。
3. ControlNet 与 LoRA:从"抽卡"到"作画"
扩散模型天然是"随机生成器":同样的提示词,每次输出的构图都不一样,早期用户把这种不确定性戏称为"抽卡"。2023 年起,两条技术路线把"抽卡"变成了"作画":
- ControlNet(2023.02):通过"复制并冻结原 UNet + 训练一个可训练副本"的方式,把线稿、深度图、人体姿态骨架、语义分割图等结构信息注入生成过程。从此用户可以说"按这张线稿上色""保持这个构图换风格"——精确的结构控制让文生图进入了设计师可用的阶段;
- LoRA(Low-Rank Adaptation,低秩适配):最初为微调大语言模型提出的参数高效微调(PEFT)方法,用低秩矩阵只更新少量参数。社区很快把它迁移到文生图:只用几十张图就能训练出一个几十到几百 MB 的 LoRA 文件,为模型"定制"角色、画风或物品,多个 LoRA 还能叠加使用。想自己动手训练,可参考微调与 PEFT(LoRA)与微调实战。
一句话判断
如果只留一条经验:生成质量由底座模型决定,而"能不能用"由控制能力决定。2023 年之后,文生图的竞争焦点已经不再是"谁画得更好看",而是"谁更能精确听你的话"。
三、Midjourney 产品拆解:为什么它"最好看"
Midjourney 没有公开技术论文,外界对它的架构只能猜测(普遍认为它基于扩散模型家族,并深度使用了微调与美学数据校准)。但它的产品方法论是可以公开复盘的三件事:Discord 交互、版本迭代、美学调优。
1. 把产品做进 Discord
Midjourney 是极少数把产品完全做在 Discord 里的公司:用户在服务器里输入 /imagine 命令加提示词,机器人返回四张候选图,再用 U1–U4(放大某一张)、V1–V4(基于某一张生成变体)进行交互。这套交互的妙处在于:
- 零安装成本:不需要下载 App、不需要懂配置,跟着社区教程五分钟上手;
- 社区即流量:所有人生成的内容默认公开在公共频道里,形成源源不断的内容瀑布流,"逛别人的生成"本身就是留存手段;
- 免费广告与数据:用户在公共频道里的大量真实反馈(哪张图被放大、被喜欢)成为模型调优的天然信号。
text
/imagine prompt: a red fox in the snow, golden hour, photorealistic --ar 16:9 --v 6
# 常见后缀:--ar 画幅比 --stylize 风格强度 --v 版本号 --seed 随机种子不是没有代价
Discord 交互意味着提示词与图像默认对同服务器用户可见,对隐私敏感的商业用户并不友好(后来 Midjourney 才推出 Stealth 模式与网页版)。这种"产品选择 vs 隐私"的张力至今存在。
2. 版本迭代:V1 → V6 → V7
Midjourney 的版本迭代是观察"文生图进化"的最佳窗口,也是理解"美学调优"的活教材(截至 2025 年中):
| 版本 | 时间(约) | 代表性变化 |
|---|---|---|
| V1 | 2022.02 | 实验室原型,粗颗粒风格 |
| V2 | 2022.04 | 提升构图与细节 |
| V3 | 2022.07 | 公开 beta,风格化强烈,社区爆发 |
| V4 | 2022.11 | 真实感大增,支持更复杂提示 |
| V5 | 2023.03 | 手部渲染改善,细节接近照片 |
| V5.2 | 2023.06 | 更强的提示理解与风格控制 |
| V6 | 2023.12 | 大幅提升自然语言理解与真实感 |
| V6.1 | 2024.07 | 皮肤、毛发细节进一步优化 |
| V7 | 2025.04 | 个性化画像、草稿模式,速度与质量兼得 |
两个值得注意的转折:V3→V4 让 Midjourney 从"风格强烈的插画感"转向"接近真实的质感",奠定其"最好看"的口碑;V6→V7 则把重心从"提高画质"转向"理解你是谁"——V7 引入个性化(personalization),允许用户通过点赞/收藏生成自己的画像(profile),让模型输出贴合个人审美,这已经在做"用户模型"了。
3. 美学调优:Midjourney 的核心竞争力
Midjourney 与其它模型最大的差异在于刻意让模型"偏爱好看":通过精选高质量训练数据、人工打分与微调,让模型在"忠实于提示词"和"输出美学上更讨喜"之间偏向后者。这直接催生了**提示词工程(prompt engineering)**作为一门手艺的流行——同样的描述,加不加 --ar 16:9、--stylize、--v 6 之类的参数,结果天差地别。提示词的常用技巧、参数解析与反模式,见提示词工程与提示词实战手册。
为什么 Midjourney"好看"而 SD"难调"?
一个广为流传的比喻:Midjourney 把"审美"预设在模型里,用户只需描述内容;Stable Diffusion 则把"审美"当作用户自己调的旋钮——同一句提示词,用不同底模、不同采样器、不同 CFG 值,风格千差万别。前者省心但可控性低,后者灵活但门槛高。这也解释了为什么一个成了大众产品,一个成了技术社区的最爱。
四、Stable Diffusion 生态:开源的世界
如果说 Midjourney 是"一个公司打磨一个产品",Stable Diffusion 就是"一个权重引爆一个世界"。SD 1.4 权重开源后,围绕它长出了三层生态:
- 权重与模型市场:Civitai、Hugging Face 等平台托管了海量社区微调模型——以 .ckpt / .safetensors 形式分发,分"底模"(如 SDXL、DreamShaper、Realistic Vision)与"LoRA"(角色、风格、物品),覆盖从二次元到写实人像的几乎所有画风。模型速查见模型与榜单速查;
- 工具链:WebUI(AUTOMATIC1111)把 SD 变成可视化界面;ComfyUI 用节点图把整个生成管线(文生图、图生图、ControlNet、LoRA、放大、蒙版重绘)暴露成可编辑、可复用的"工作流"(workflow),成为专业用户与自动化生产的标配;
- 生产管线集成:设计师把 SD/ComfyUI 接入 Photoshop、Blender、游戏资产管线,用"ControlNet 出构图 + 放大修复 + LoRA 保风格"的流水线批量产图。
开源生态的代价也在下一节展开:可控性带来复杂性,自由权重带来滥用风险。开源与闭源取舍的更多维度讨论见常见陷阱与反模式。
五、应用与影响:从"玩具"到"生产力"
文生图在 2022 年还是"图一乐",到 2024 年已渗透进多个行业的生产流程:
- 设计:从"从零手绘"变成"提示词出草图 → 筛选 → 精修",一套物料可批量出多个版本;电商用图生图把商品图换背景、换场景、出模特图;
- 游戏原画:概念设计师用文生图批量产出角色与场景候选,再人工整合细化,前期探索周期大幅缩短;
- 摄影与后期:修复旧照片、无中生有补细节;部分商业拍摄开始用 AI"数字模特"替代真实棚拍;
- 提示词经济:提示词交易平台(PromptBase 等)、提示词工程师岗位、围绕提示词的教程课程层出不穷——2023 年前后,"会写提示词"一度被称作"新时代的文案"。随着模型理解力提升,提示词的价值正从"神秘咒语"回归"表达能力"。
同样不可忽视的是阴影面:版权与训练数据争议是文生图行业最大的一颗雷。Stable Diffusion 训练自从互联网抓取的 LAION-5B,其中包含大量受版权保护的图片,由此引发了两类标志性诉讼:
- Getty Images 诉 Stability AI(2023):Getty 指控其模型输出了带 Getty 水印痕迹的图像,属直接侵权;
- 三位艺术家集体诉讼(2023):主张模型未经许可"学习"了他们的画风。
核心法律问题——"训练行为是否构成侵权""输出是否算衍生作品"——至今没有定论。行业的两条回应路径是"授权数据"(如 Adobe Firefly 只用授权图训练)与"AI 内容标识/水印"。更系统的安全与合规视角见AI 安全与治理。
六、里程碑:科罗拉多州博览会事件
回到开头的故事。2022 年 8 月,Jason Allen 用 Midjourney 生成、再经 Photoshop 与 Gigapixel AI 增强的《Théâtre D'opéra Spatial》获得科罗拉多州博览会数字艺术类一等奖,评委事先并不知道作品出自 AI。Allen 事后主动公开创作过程,争议随之引爆:
- 支持者认为:"用笔还是用提示词,都是创作工具的选择"——Allen 也的确经过大量提示词筛选与后期编辑,并非"一键出图";
- 反对者认为:AI 在训练中"消化"了无数人类画师的风格,获奖是对人类创作者的不公平竞争;
- 中立观察者则指出:规则本身没有为 AI 工具做好准备——当"什么是艺术家"的定义开始松动,比赛规则与版权制度都需要重写。
这场争议的余波持续了很久。2023 年 9 月,美国版权局(US Copyright Office)拒绝了 Allen 为该作品申请版权的请求,理由是"人类创作因素不足",其后多次上诉均被驳回——截至 2025 年中,该作品仍未能获得版权保护。这起事件连同 2023 年的"Zarya of the Dawn"漫画案(AI 生成图像部分被拒、文字与编排部分获保护),共同构成了"AI 生成内容能否拥有版权"这一法律难题的早期判例,也是理解AI 安全与治理中"真实性危机"的最佳案例。
七、权衡与取舍
用了几代文生图产品之后,实践者会反复遇到四组权衡:
- 开源自部署 vs 闭源订阅:SD 免费可控但自己要管 GPU、安全过滤与版本迭代;Midjourney 开箱即用、质量稳定,但底层不可控、数据出境。团队决策本质上是"成本结构"问题而非技术偏好问题;
- 质量 vs 可控性:Midjourney 默认"好看"但精确控制难;SD + ControlNet 能精确复现构图但需要反复调参。项目要"风格探索"还是"精确落地",决定选哪条路线;
- 生成 vs 记忆:模型可能"背下"训练集里的图,产生版权与抄袭风险(自动指标甚至分不清生成和复制),交付商业项目前需做人工审查;
- 速度 vs 质量:同样的模型,用 20 步还是 50 步采样、用基础模型还是蒸馏模型,时间与质量是显式的交换。推理侧的优化手段见推理优化与量化。
一句落地建议
个人学习可以先玩 Midjourney 建立"审美直觉",再学 SD + ComfyUI 掌握"控制能力",最后用 LoRA 定制自己的风格——这条路最省时间。术语不熟时可随时查术语表。
延伸阅读
- 扩散模型与生成式 AI:本文技术底座的完整数学与工程讲解;
- 多模态模型:CLIP、图文对齐与多模态统一模型的来龙去脉;
- 微调与 PEFT(LoRA):LoRA 的原理与适用场景;
- 提示词工程与提示词实战手册:Midjourney 提示词的参数、技巧与反模式;
- Sora 与视频生成:图像生成的下一个战场——文生视频;
- AI 安全与治理:版权、水印、深度伪造与治理框架;
- 演进简史与学习路径:把文生图放进整个 AI 热门概念版图;
- 模型与榜单速查:SD 各版本、LoRA 市场与榜单信息。
参考资料
- Ho, Jain, Abbeel. Denoising Diffusion Probabilistic Models (NeurIPS 2020) —— DDPM,扩散模型成为实用生成器的奠基论文
- Rombach et al. High-Resolution Image Synthesis with Latent Diffusion Models (CVPR 2022) —— LDM,Stable Diffusion 的直接前身
- Radford et al. Learning Transferable Visual Models From Natural Language Supervision (ICML 2021) —— CLIP 原始论文
- Zhang, Rao, Agrawala. Adding Conditional Control to Text-to-Image Diffusion Models (ICCV 2023) —— ControlNet
- Hu et al. LoRA: Low-Rank Adaptation of Large Language Models (ICLR 2022) —— LoRA 原始论文
- Schuhmann et al. LAION-5B: An open large-scale dataset for training next generation image-text models (NeurIPS 2022) —— SD 训练数据来源
- Midjourney 官方网站 —— 产品入口与版本公告
- Midjourney 官方文档 —— 参数、版本说明与使用指南
- Stability AI 官方网站 —— Stable Diffusion 系列发布与许可说明
- ComfyUI 官方仓库 —— 节点式工作流的开源实现
- Colorado State Fair 获奖事件报道(The New York Times, 2022) —— 科罗拉多州博览会事件的一手报道
- U.S. Copyright Office. AI 与版权政策 —— AI 生成内容版权的官方口径