来源:互联网 更新时间:2026-08-06 15:32
假设我们有一幅完整的图像,可以把它想象成一幅清晰的风景画。在扩散模型的正向过程(也就是添加噪声的阶段)中,我们就像在画布上一点点地喷洒墨水。每一次喷洒的量都很少,但随着步骤的累积,这幅画逐渐被墨点覆盖,画面变得模糊不清,到最后,只剩下混沌一片的墨斑。
那反向过程呢?它就好比我们拥有一个能逆转喷洒墨水的魔法工具。通过它,我们可以一步步地移除画布上的墨点,把原作一点一点地“捞”回来。模型的训练,本质上就是教会这个工具如何在混沌中还原出清晰的画面。
理解了这一点就好办了。当模型学会了这套“去噪”本领后,我们只需要给它一整片随机的噪声斑点,它就能凭借训练中积累的经验,逐步把这些噪声修复成一张完整的图像。

先说Stable Diffusion 2吧。它的基础是潜在扩散模型,这是在潜在空间里完成扩散过程的。它用的是U-Net架构来做编码和解码,把图像压进潜在空间后再处理。
U-Net最早是Olaf Ronneberger在2015年提出的,初衷是解决生物医学图像分割的问题。它的名字很形象,因为架构看起来就像一个字母“U”。主要由两部分组成:
U-Net有个关键设计:编码器和解码器之间的跳跃连接。相当于给解码器修了一条“高速通道”,直接把编码器里的空间信息传过去,生成结果自然更精细。这个架构后来在扩散模型里也火了,成了生成高质量图像的好帮手。
到了Stable Diffusion 3,架构换成了Diffusion Transformer(DiT),不用U-Net了。这是一个新的思路,用一个处理图像小片段的系统取代了传统的图像构建模块。同时,它还融合了流匹配技术。DiT本质上就是把扩散模型和Transformer架构捏在了一起。
Stability AI最新发布的这个Stable Diffusion 3,在多主题提示处理、图像质量和拼写能力上都表现得很抢眼。目前还处于早期预览阶段,如果感兴趣想参与改进,已经开放了等待名单。
Stable Diffusion 3把Diffusion Transformer结构和Flow Matching结合起来了。来看看这意味着什么。
DiT的结构,其实是把扩散模型的能力和Transformer的可扩展性、灵活性捏在了一起。扩散模型靠迭代去噪,在生成任务上已经证明了自己的实力;Transformer呢,擅长捕捉数据里的长程依赖关系,在NLP和CV领域都拿过好成绩。两者结合,自然能生成更强大、更高效的模型,去捕捉那些复杂的数据分布。
DiT的架构基础是一串标准Transformer层,和Vision Transformer或者NLP里的Transformer层类似。但它在每一层里都融入了扩散过程——说白了,就是把扩散机制塞进了自注意力机制里。通常还会加上一个条件机制,用来做类别条件图像生成。这个条件机制实现方式多样,比如在输入序列里加上类别标记,或者让注意力机制依赖类别信息。
处理图像时,DiT也用分块的办法,跟ViT一样——每个图像块被展平成序列,然后由Transformer层处理。它经常用自适应层归一化(adaLN)来提升训练稳定性和表现,adaLN会根据输入数据调整归一化参数,让模型能适应不同的输入分布特点。
举个例子,DiT-XL/2-G模型在FID-50K指标上表现很好,同时计算量相对较低,这意味着它在生成高质量图像的同时,效率也很高。
DiTs通常用标准的生成模型训练方法,比如最大似然估计或变分推断。输入训练数据,迭代更新模型参数,最小化合适的损失函数。训练过程中可能还会用到一些额外技术,比如模型权重的指数移动平均、数据增强、正则化,都是为了提升性能和稳定性。
DiT的一个关键优势在于它的可伸缩性。借助Transformer架构的扩展能力,它能轻松处理大规模的生成任务,包括高分辨率图像生成。在基准数据集上,DiT交出的成绩单很亮眼——FID、Inception得分、精确度/召回率这些指标,经常能刷出领先结果。
下面这张图展示了DiT模型的整体架构,以及两种不同的DiT块设计:一种是带自适应层归一化的,另一种是带交叉注意力的。
DiT模型利用Transformer架构的优势,在扩散模型里生成高质量图像。这两种DiT块的设计,分别通过自适应层归一化和交叉注意力来高效利用条件信息,让模型在扩散过程中生成更符合要求的图像。
下面这张图展示了不同Transformer模型规模和patch大小对生成图像质量的影响。以生成的狗的图像为例,可以很直观地看到差异。
在图像生成任务里,选择合适的patch size能让模型更好地捕捉特征,提升生成效果。
Flow Matching是一种训练连续归一化流(CNF)的新框架,目标就是克服传统训练方法的一些局限。它引入了一种无需模拟的方法论,利用条件结构高效地扩展到高维数据集,同时还能提升采样和生成能力。
传统的CNF训练方法,计算成本高,尤其是处理高维数据时。Flow Matching提供了一条替代路径——无需模拟,简化训练过程,同时保持高质量的采样和生成性能。
FM已经在不同分辨率的数据集(如CIFAR-10、ImageNet)上证明了有效性。它在负对数似然(NLL)、样本质量(FID)和训练效率(NFE)方面都达到了领先水平。和现有方法对比,FM在更快的收敛速度、更高的采样效率上,优势明显。
下面进一步拆解一下:
Diffusion Transformer架构和Flow Matching的结合,是文本到图像生成领域里一条很有趣的技术路径。
DiT把Transformer强大的序列建模能力和扩散模型的高质量图像生成能力结合在一起。这种结合让模型能更有效地捕捉文本提示和对应图像之间的复杂关系,输出更连贯、更符合上下文的结果。语言和图像之间的关系太重要了——当模型能真正理解人类语言的含义,并把它融进生成过程时,我们就离更可控的图像生成系统又近了一步。
Flow Matching让模型能学习图像数据的底层分布,生成与之紧密匹配的样本。通过把生成的图像和目标分布对齐,Flow Matching确保了输出在视觉上既吸引人,又呈现真实特征。据Stability的研究人员透露,DiT与FM的整合显著提升了图像质量——更精细的细节、更锐利的纹理、更准确的文本提示表现。这种保真度的提升,不仅改善了用户体验,也拓宽了数字艺术、设计、娱乐等应用范围。
文本到图像生成还有个挑战:处理含有多个主题的提示。这也是为什么我们平时看到的AI生成图像,大多只呈现单个人物。DiT和FM的结合,让模型能更准确、更连贯地处理复杂的多主题提示。这意味着用户可以根据细致的文本描述,生成多样和复杂的图像,为创造性表达和故事讲述打开了新的可能性。
总的来说,DiT和FM的结合,代表了文本到图像生成方法学的一次重要进步。通过发挥两者的优势,这个创新框架提供了更强大的建模能力、更优质的图像生成效果,并且在优先考虑安全和伦理的前提下,能够高效地处理多主题提示。
Ondo将于今日上线股票永续合约
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
晶核艾尔莎角色盘点 晶核艾尔莎强度分析与实战表现
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
区块链OTC交易所有哪几家比较正规?
新破天一剑太极刀任务攻略 破天一剑怎么取太极刀
Intel喜讯连连:18A工艺良率提升到85%、CPU将涨价15%
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
合集38个项目筹集5.406亿美元 Figure融资2亿
AMD英特尔集体失眠!英伟达Rosa CPU搭载Rigel核:单核性能碾压x86
遗忘之海密室通关教程 遗忘之海密室全关卡解谜思路与难点解析
五菱星光L六座新能源SUV上市:三版可选,中配12.28
抖音怎么取消申请退货退款?抖音上取消退货怎么操作
蚂蚁庄园今日答案7月21日(今日已更新) 蚂蚁庄园今天正确答案是什么呢
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
macOS 28将移除Rosetta 2兼容层,Intel应用面临运行危机
潜水员戴夫丛林DLC接吻的鱼任务攻略
电视剧《白领公寓》剧情介绍
探索我的世界材质包16x32x64x 解密我的世界材质包16x32x64x的魅力与技术
五千元以下的笔记本几乎消失!经销商:至少一年看不到涨价尽头
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc