Skip to content

Midjourney 与图像生成

本页速览 以 Midjourney 为切口拆解 2022-2023 文生图爆发:DALL·E 2、Stable Diffusion、Midjourney 三足鼎立背后的扩散模型与 CLIP 技术底座、产品迭代方法论、开源生态与版权争议。

本页含时效性内容,数据截止于 2025-06;JD、榜单、产品功能等信息可能已变化,引用前请核对原始出处。

Midjourney 与图像生成 ​

2022 年 8 月,美国科罗拉多州博览会(Colorado State Fair)年度艺术竞赛的数字艺术类奖项爆出大新闻:一位名叫 Jason Allen 的参赛者用 Midjourney 生成、再经 Photoshop 与 Gigapixel AI 增强的图像《Théâtre D'opéra Spatial》拿到了第一名。消息传开后,"AI 绘画能否算艺术"的争论迅速出圈,也把**文生图(text-to-image)**这项技术第一次真正推到了公众面前。

如果把文生图看作一场"造图革命",Midjourney 就是这场革命里最受瞩目的产品之一:它不是最早上线的(DALL·E 2 更早),不是技术最开放的(Stable Diffusion 完全开源),但它用一套以"美学"为核心的产品方法论,把 AI 图像生成变成了一门数亿美元级的订阅生意。本文以 Midjourney 为切口,复盘 2022–2023 年文生图爆发的完整故事:三足鼎立的产业格局、扩散模型的技术底座、Midjourney 的产品迭代,以及这场革命对设计、版权与创作者经济的深远影响。想看技术底层原理,可先读扩散模型与生成式 AI。

一、2022–2023:文生图的"三足鼎立" ​

文生图不是 2022 年才有的想法。早在 2015 年前后,图像描述与条件生成模型就已在像素层面尝试,但质量远不够用。真正的引爆点是 2021–2022 年扩散模型(diffusion model)成熟之后——它把"文字变图"从"能看出轮廓"推进到了"以假乱真"。

2022 年是决定行业格局的一年,三家代表同时发力:

产品厂商关键时间开放程度特色
DALL·E 2OpenAI2022.04 发布闭源、排队、按图计费真实感飞跃,语义理解强
Stable DiffusionStability AI2022.08 开源 1.4权重开源,本地可跑生态最大,可控可改
MidjourneyMidjourney Inc.2022.07 公开 beta订阅制、Discord 内使用美学风格登顶,社区最热

三条路线的定位差异非常清晰:

  • DALL·E 2 代表"研究驱动":OpenAI 从 DALL·E 1(2021 年)到 DALL·E 2 打磨了一年多的真实感,发布即惊艳业界,但闭源加排队让大众只能"围观";
  • Stable Diffusion 代表"开源驱动":在 LAION-5B(约 58.5 亿图文对)数据集上训练,权重以相对开放的许可公开,任何人都能下载、改造、本地部署,直接催生了庞大的社区生态;
  • Midjourney 代表"产品驱动":它既不发表研究论文,也没有开源野心,而是把"生成结果好不好看"做到极致,用 Discord 机器人这种极低的使用门槛收割大众市场。

为什么恰好在 2022 年爆发?

三大要素在那两年恰好同时成熟:扩散模型在 2020–2021 年完成理论奠基(DDPM、DDIM、LDM),CLIP 在 2021 年解决了"文字—图像对齐",而 LAION-5B 这类海量图文对数据集与规模化算力让"训得动"成为现实。技术、数据、算力三碰头,文生图才从实验室走向大众。这段演进的完整脉络见演进简史。

二、技术底座:扩散模型如何让"文字变图" ​

不管产品形态怎么变,2022 年这批文生图系统的技术底座高度一致:扩散模型 + 文本编码器 + (可选)控制与定制插件。

1. 从 DDPM 到 LDM:在潜空间里"去噪" ​

扩散模型的核心思想是"先破坏、再学习恢复":训练时给图像逐步加高斯噪声直到变成纯噪声,同时让神经网络学会反向去噪;生成时从随机噪声出发,一步步"还原"出一张符合训练数据分布的图像。**DDPM(Denoising Diffusion Probabilistic Models,去噪扩散概率模型,2020)**证明了这条路能产出高质量图像,但有个致命问题——慢:要在像素空间迭代上千步。

**Latent Diffusion Models(LDM,潜空间扩散模型,2022)**用一个巧妙的工程化改造解决了它:先在潜空间(latent space)里扩散,而不是在像素空间。先用一个自编码器把 512×512 的图像压缩成 64×64×4 的潜变量(约压缩 48 倍),再在这个低维空间里加噪、去噪,最后用解码器把潜变量还原成图像。计算量直接下降一个数量级——Stable Diffusion 正是 LDM 的产品化,这也是它能在消费级 GPU 上跑起来的原因。更完整的数学原理见扩散模型与生成式 AI。

2. CLIP:让文字和图像"对齐" ​

光有图像生成器还不够,系统还得"听懂"人类写的提示词。这里的关键组件是 CLIP(Contrastive Language-Image Pre-training,对比语言—图像预训练),OpenAI 2021 年提出。CLIP 用约 4 亿个"图片—文字"对做对比学习,把文本和图像映射到同一个语义空间:一句"一只坐在雪地里的狐狸"和一张对应的照片,在空间里的距离应该很近;和不相关的图片应该很远。

Stable Diffusion 1.x 与 Midjourney 早期版本都直接借用 CLIP 的文本编码器:用户输入的提示词被编码成语义向量,通过交叉注意力(cross-attention)机制注入扩散模型的每一层,让"去噪"过程始终朝向"与文字匹配"的方向。CLIP 的局限也很明显——上下文窗口短(77 个 token)、对中文等非英语支持弱、对抽象概念(如"悲伤的黄昏")理解有限,这些短板成了后来提示词工程(prompt engineering)大量技巧的出发点。多模态对齐的更完整介绍见多模态模型。

3. ControlNet 与 LoRA:从"抽卡"到"作画" ​

扩散模型天然是"随机生成器":同样的提示词,每次输出的构图都不一样,早期用户把这种不确定性戏称为"抽卡"。2023 年起,两条技术路线把"抽卡"变成了"作画":

  • ControlNet(2023.02):通过"复制并冻结原 UNet + 训练一个可训练副本"的方式,把线稿、深度图、人体姿态骨架、语义分割图等结构信息注入生成过程。从此用户可以说"按这张线稿上色""保持这个构图换风格"——精确的结构控制让文生图进入了设计师可用的阶段;
  • LoRA(Low-Rank Adaptation,低秩适配):最初为微调大语言模型提出的参数高效微调(PEFT)方法,用低秩矩阵只更新少量参数。社区很快把它迁移到文生图:只用几十张图就能训练出一个几十到几百 MB 的 LoRA 文件,为模型"定制"角色、画风或物品,多个 LoRA 还能叠加使用。想自己动手训练,可参考微调与 PEFT(LoRA)与微调实战。

一句话判断

如果只留一条经验:生成质量由底座模型决定,而"能不能用"由控制能力决定。2023 年之后,文生图的竞争焦点已经不再是"谁画得更好看",而是"谁更能精确听你的话"。

三、Midjourney 产品拆解:为什么它"最好看" ​

Midjourney 没有公开技术论文,外界对它的架构只能猜测(普遍认为它基于扩散模型家族,并深度使用了微调与美学数据校准)。但它的产品方法论是可以公开复盘的三件事:Discord 交互、版本迭代、美学调优。

1. 把产品做进 Discord ​

Midjourney 是极少数把产品完全做在 Discord 里的公司:用户在服务器里输入 /imagine 命令加提示词,机器人返回四张候选图,再用 U1–U4(放大某一张)、V1–V4(基于某一张生成变体)进行交互。这套交互的妙处在于:

  • 零安装成本:不需要下载 App、不需要懂配置,跟着社区教程五分钟上手;
  • 社区即流量:所有人生成的内容默认公开在公共频道里,形成源源不断的内容瀑布流,"逛别人的生成"本身就是留存手段;
  • 免费广告与数据:用户在公共频道里的大量真实反馈(哪张图被放大、被喜欢)成为模型调优的天然信号。
text
/imagine prompt: a red fox in the snow, golden hour, photorealistic --ar 16:9 --v 6
# 常见后缀:--ar 画幅比  --stylize 风格强度  --v 版本号  --seed 随机种子

不是没有代价

Discord 交互意味着提示词与图像默认对同服务器用户可见,对隐私敏感的商业用户并不友好(后来 Midjourney 才推出 Stealth 模式与网页版)。这种"产品选择 vs 隐私"的张力至今存在。

2. 版本迭代:V1 → V6 → V7 ​

Midjourney 的版本迭代是观察"文生图进化"的最佳窗口,也是理解"美学调优"的活教材(截至 2025 年中):

版本时间(约)代表性变化
V12022.02实验室原型,粗颗粒风格
V22022.04提升构图与细节
V32022.07公开 beta,风格化强烈,社区爆发
V42022.11真实感大增,支持更复杂提示
V52023.03手部渲染改善,细节接近照片
V5.22023.06更强的提示理解与风格控制
V62023.12大幅提升自然语言理解与真实感
V6.12024.07皮肤、毛发细节进一步优化
V72025.04个性化画像、草稿模式,速度与质量兼得

两个值得注意的转折:V3→V4 让 Midjourney 从"风格强烈的插画感"转向"接近真实的质感",奠定其"最好看"的口碑;V6→V7 则把重心从"提高画质"转向"理解你是谁"——V7 引入个性化(personalization),允许用户通过点赞/收藏生成自己的画像(profile),让模型输出贴合个人审美,这已经在做"用户模型"了。

3. 美学调优:Midjourney 的核心竞争力 ​

Midjourney 与其它模型最大的差异在于刻意让模型"偏爱好看":通过精选高质量训练数据、人工打分与微调,让模型在"忠实于提示词"和"输出美学上更讨喜"之间偏向后者。这直接催生了**提示词工程(prompt engineering)**作为一门手艺的流行——同样的描述,加不加 --ar 16:9、--stylize、--v 6 之类的参数,结果天差地别。提示词的常用技巧、参数解析与反模式,见提示词工程与提示词实战手册。

为什么 Midjourney"好看"而 SD"难调"?

一个广为流传的比喻:Midjourney 把"审美"预设在模型里,用户只需描述内容;Stable Diffusion 则把"审美"当作用户自己调的旋钮——同一句提示词,用不同底模、不同采样器、不同 CFG 值,风格千差万别。前者省心但可控性低,后者灵活但门槛高。这也解释了为什么一个成了大众产品,一个成了技术社区的最爱。

四、Stable Diffusion 生态:开源的世界 ​

如果说 Midjourney 是"一个公司打磨一个产品",Stable Diffusion 就是"一个权重引爆一个世界"。SD 1.4 权重开源后,围绕它长出了三层生态:

  1. 权重与模型市场:Civitai、Hugging Face 等平台托管了海量社区微调模型——以 .ckpt / .safetensors 形式分发,分"底模"(如 SDXL、DreamShaper、Realistic Vision)与"LoRA"(角色、风格、物品),覆盖从二次元到写实人像的几乎所有画风。模型速查见模型与榜单速查;
  2. 工具链:WebUI(AUTOMATIC1111)把 SD 变成可视化界面;ComfyUI 用节点图把整个生成管线(文生图、图生图、ControlNet、LoRA、放大、蒙版重绘)暴露成可编辑、可复用的"工作流"(workflow),成为专业用户与自动化生产的标配;
  3. 生产管线集成:设计师把 SD/ComfyUI 接入 Photoshop、Blender、游戏资产管线,用"ControlNet 出构图 + 放大修复 + LoRA 保风格"的流水线批量产图。

开源生态的代价也在下一节展开:可控性带来复杂性,自由权重带来滥用风险。开源与闭源取舍的更多维度讨论见常见陷阱与反模式。

五、应用与影响:从"玩具"到"生产力" ​

文生图在 2022 年还是"图一乐",到 2024 年已渗透进多个行业的生产流程:

  • 设计:从"从零手绘"变成"提示词出草图 → 筛选 → 精修",一套物料可批量出多个版本;电商用图生图把商品图换背景、换场景、出模特图;
  • 游戏原画:概念设计师用文生图批量产出角色与场景候选,再人工整合细化,前期探索周期大幅缩短;
  • 摄影与后期:修复旧照片、无中生有补细节;部分商业拍摄开始用 AI"数字模特"替代真实棚拍;
  • 提示词经济:提示词交易平台(PromptBase 等)、提示词工程师岗位、围绕提示词的教程课程层出不穷——2023 年前后,"会写提示词"一度被称作"新时代的文案"。随着模型理解力提升,提示词的价值正从"神秘咒语"回归"表达能力"。

同样不可忽视的是阴影面:版权与训练数据争议是文生图行业最大的一颗雷。Stable Diffusion 训练自从互联网抓取的 LAION-5B,其中包含大量受版权保护的图片,由此引发了两类标志性诉讼:

  • Getty Images 诉 Stability AI(2023):Getty 指控其模型输出了带 Getty 水印痕迹的图像,属直接侵权;
  • 三位艺术家集体诉讼(2023):主张模型未经许可"学习"了他们的画风。

核心法律问题——"训练行为是否构成侵权""输出是否算衍生作品"——至今没有定论。行业的两条回应路径是"授权数据"(如 Adobe Firefly 只用授权图训练)与"AI 内容标识/水印"。更系统的安全与合规视角见AI 安全与治理。

六、里程碑:科罗拉多州博览会事件 ​

回到开头的故事。2022 年 8 月,Jason Allen 用 Midjourney 生成、再经 Photoshop 与 Gigapixel AI 增强的《Théâtre D'opéra Spatial》获得科罗拉多州博览会数字艺术类一等奖,评委事先并不知道作品出自 AI。Allen 事后主动公开创作过程,争议随之引爆:

  • 支持者认为:"用笔还是用提示词,都是创作工具的选择"——Allen 也的确经过大量提示词筛选与后期编辑,并非"一键出图";
  • 反对者认为:AI 在训练中"消化"了无数人类画师的风格,获奖是对人类创作者的不公平竞争;
  • 中立观察者则指出:规则本身没有为 AI 工具做好准备——当"什么是艺术家"的定义开始松动,比赛规则与版权制度都需要重写。

这场争议的余波持续了很久。2023 年 9 月,美国版权局(US Copyright Office)拒绝了 Allen 为该作品申请版权的请求,理由是"人类创作因素不足",其后多次上诉均被驳回——截至 2025 年中,该作品仍未能获得版权保护。这起事件连同 2023 年的"Zarya of the Dawn"漫画案(AI 生成图像部分被拒、文字与编排部分获保护),共同构成了"AI 生成内容能否拥有版权"这一法律难题的早期判例,也是理解AI 安全与治理中"真实性危机"的最佳案例。

七、权衡与取舍 ​

用了几代文生图产品之后,实践者会反复遇到四组权衡:

  • 开源自部署 vs 闭源订阅:SD 免费可控但自己要管 GPU、安全过滤与版本迭代;Midjourney 开箱即用、质量稳定,但底层不可控、数据出境。团队决策本质上是"成本结构"问题而非技术偏好问题;
  • 质量 vs 可控性:Midjourney 默认"好看"但精确控制难;SD + ControlNet 能精确复现构图但需要反复调参。项目要"风格探索"还是"精确落地",决定选哪条路线;
  • 生成 vs 记忆:模型可能"背下"训练集里的图,产生版权与抄袭风险(自动指标甚至分不清生成和复制),交付商业项目前需做人工审查;
  • 速度 vs 质量:同样的模型,用 20 步还是 50 步采样、用基础模型还是蒸馏模型,时间与质量是显式的交换。推理侧的优化手段见推理优化与量化。

一句落地建议

个人学习可以先玩 Midjourney 建立"审美直觉",再学 SD + ComfyUI 掌握"控制能力",最后用 LoRA 定制自己的风格——这条路最省时间。术语不熟时可随时查术语表。

延伸阅读 ​

参考资料 ​