首页站长资讯Stable Diffusion 3技术报告流出，Sora构架再立大功！生图圈开源暴打Midjourney和DALL·E 3？

19612

Stable Diffusion 3技术报告流出，Sora构架再立大功！生图圈开源暴打Midjourney和DALL·E 3？

站长网2024-03-06 17:14:012阅

【新智元导读】Stability AI放出了号称能暴打闭源模型的Stable Diffusion3的技术报告，采用DiT构架的新模型在灵活性和性能上都达到了新的高度。

Stability AI在发布了Stable Diffusion3之后，今天公布了详细的技术报告。

论文深入分析了Stable Diffusion3的核心技术——改进版的Diffusion模型和一个基于DiT的文生图全新架构!

报告地址:

https://stabilityai-public-packages.s3.us-west-2.amazonaws.com/Stable Diffusion 3 Paper.pdf

通过人类评价测试，Stable Diffusion3在字体设计和对提示的精准响应方面，超过了DALL·E3、Midjourney v6和Ideogram v1。

Stability AI新开发的多模态扩散Transformer（MMDiT）架构，采用了分别针对图像和语言表示的独立权重集，与SD3的早期版本相比，显著提升了对文本的理解和文字的拼写能力。

性能评估

在人类反馈的基础之上，技术报告将SD3于大量开源模型SDXL、SDXL Turbo、Stable Cascade、Playground v2.5和 Pixart-α，以及闭源模型DALL·E3、Midjourney v6和 Ideogram v1进行了详细的对比评估。

评估员根据与给定提示的一致性、文本的清晰度以及图像的整体美观度选择了每个模型的最佳输出:

测试结果显示，无论是在遵循提示的准确性、文本的清晰呈现还是图像的视觉美感方面，Stable Diffusion3都达到或超过了当前文生图生成技术的最高水平。

完全没有针对硬件进行过优化的SD3模型具有8B参数，能够在24GB显存的RTX4090消费级GPU上运行，并且在使用50个采样步骤的情况下，生成1024x1024分辨率的图像需耗时34秒。

此外，Stable Diffusion3在发布时将提供多个版本，参数范围从8亿到80亿，从而能以进一步降低使用的硬件门槛。

架构细节曝光

在文生图的过程中，模型需同时处理文本和图像这两种不同的信息。所以作者将这个新框架称之为MMDiT。

在文本到图像生成的过程中，模型需同时处理文本和图像这两种不同的信息类型。这就是作者将这种新技术称为MMDiT（多模态Diffusion Transformer的简称）的原因。

与Stable Diffusion之前的版本一样，SD3采用了预训练模型来提取适合的文本和图像的表达形式。

具体而言，他们利用了三种不同的文本编码器——两个CLIP模型和一个T5——来处理文本信息，同时使用了一个更为先进的自编码模型来处理图像信息。

SD3的架构是在Diffusion Transformer（DiT）的基础上建立的。由于文本和图像信息的差异，SD3为这两种信息各自设置了独立的权重。

这种设计相当于为每种信息类型配备了两个独立的Transformer，但在执行注意力机制时，会将两种信息的数据序列合并，这样就可以在各自的领域内独立工作的同时，能保持够相互参考和融合。

通过这种独特的构架，图像和文本信息之间可以相互流动和交互，从而在生成的结果中提高对内容的整体理解和视觉表现。

而且，这种架构未来还可以轻松扩展到其他包括视频在内的多种模态。

得益于SD3在遵循提示方面的进步，模型能够精确生成集中于多种不同主题和特性的图像，同时在图像风格上也保持了极高的灵活性。

通过重赋权法改进Rectified Flow

除了推出的全新Diffusion Transformer构架之外，SD3对于Diffusion模型也进行了重大的改进。

SD3采用了Rectified Flow（RF）策略，将训练数据和噪声沿着直线轨迹连接起来。

这种方法让模型的推理路径更加直接，因此可以通过更少的步骤完成样本的生成。

作者在训练流程中引入了一种创新的轨迹采样计划，特别增加了对轨迹中间部分的权重，这些部分的预测任务更具挑战性。

通过与其他60种扩散轨迹（例如 LDM、EDM 和 ADM）进行比较，作者发现尽管之前的RF方法在少步骤采样中表现更佳，但随着采样步骤增多，性能会慢慢下降。

为了避免这种情况的出现，作者提出的加权RF方法，就能够持续提升模型性能。

扩展RF Transformer模型

Stability AI训练了多个不同规模的模型，从15个模块、450M参数到38个模块、8B参数，发现模型大小和训练步骤都能平滑地降低验证损失。

为了验证这是否意味着模型输出有实质性的改进，他们还评估了自动图像对齐指标和人类偏好评分。

结果表明，这些评估指标与验证损失强相关，说明验证损失是衡量模型整体性能的有效指标。

此外，这种扩展趋势没有达到饱和点，让我们对未来能够进一步提升模型性能持乐观态度。

作者在256*256像素分辨率下，在4096的批大小下，用不同参数数对模型进行了500k步训练。

上图说明了长时间训练较大模型对样本质量的影响。

上表显示了GenEval的结果。当使用作者提出的训练方法并提高训练图像的分辨率时，最大的模型在大多数类别中都表现出色，在总分上超过了 DALL·E3。

根据作者对不同构架模型的测试对比，MMDiT效果非常好，超过了DiT，Cross DiT，UViT，MM-DiT。

灵活的文本编码器

通过在推理阶段去除占用大量内存的4.7B参数的T5文本编码器，SD3的内存需求得到了大幅降低，而性能损失微乎其微。

去除这个文本编码器不会影响图像的视觉美感（不使用T5的胜率为50%），只会略微降低文本的准确遵循能力(胜率为46%)。

然而，为了充分发挥SD3在生成文字的能力，作者还是建议使用T5编码器。

因为作者发现在没有它的情况下，排版生成文字的性能会有更大的下降（胜率为38%）。

网友热议

网友们对Stability AI不断撩拨用户但是不让用的行为显得有些不耐烦了，纷纷催促赶快上线让大家使用。

看了技术报考后，网友说看来现在生图圈子要成第一个开源碾压闭源的赛道了!

参考资料:

https://stability.ai/news/stable-diffusion-3-research-paper

StableDiffusion3技术报告流出Sora构架再立大功生图圈开源暴打Midjourney和DALLE 3

0002

评论列表

共(0)条

相关推荐

站长资讯
QQ浏览器推出“小笔记”电脑版支持多种格式导出和分享
QQ浏览器推出的"小笔记"电脑版是一个高效的知识整理工具，旨在帮助用户提升信息整理和利用效率，构建个人信息库。它具备多场景记录功能，可以满足网页、公众号、文档和搜索等页面内容的收集需求，并支持多种格式的导出和分享。"小笔记"的云端同步功能使用户能够在不同设备上无缝接续编辑过程，实现移动办公和知识管理的连续性。
站长网2024-07-30 11:05:53
0000
站长资讯
业界领先的这些大模型，都被一家「收编」了
毋庸置疑，GPT-4发布是一件足以载入AI史册的大事件。但随着时间的推移，人们也发现，即使是最先进的大模型也还没有强大到可以把所有的事情都做完。比如，如果你把一份很长的文本粘贴到GPT-4的对话框，它会告诉你文本过长，处理不了（它支持的上下文窗口仅为32ktoken，约2.5万汉字）。
站长网2023-10-14 09:13:27
0000
UPS 利用人工智能来打击包裹盗窃：使用 AI 为收件地址评分
据Safewise估计，去年美国约有2.6亿个包裹失踪，许多包裹在门前区域被盗，而此类盗窃常常被摄像头录下。随着节日季节的临近，包裹失窃成为人们最关心的问题之一，一家快递公司正在使用人工智能（AI）来对抗「porchpirates（门廊海盗）」。
站长网站长资讯2023-12-21 09:48:41
0000
站长资讯
多尺度深度生成模型NeuralPLexer：预测蛋白质-配体复合物结构
**划重点:**1.🔬**新方法介绍:**IambicTherapeutics、英伟达、加州理工学院联合开发的NeuralPLexer利用深度生成模型，仅通过蛋白质序列和配体分子图输入即可直接预测蛋白质-配体复合物结构。
站长网2024-02-22 09:22:15
0003
站长资讯
Align Your Steps：低步数推理保持高质量结果适用于SD 1.5和SDXL
划重点:-通过优化采样计划提升生成模型效率和质量-可适用于多种数据合成基准测试，包括图像、视频等-用户友好的插拔式优化计划应用，提升生成过程中的稳定性和质量在深度学习领域，扩散模型（DMs）作为生成建模的前沿方法已经得到广泛应用。然而，DMs的一个关键缺点是其较慢的采样速度，这主要是由于需要通过大型神经网络进行多次顺序函数评估。
站长网2024-04-26 16:17:14
0000