商城首页欢迎来到中国正版软件门户

文章教程　|　产品大全　|　软件问答

您的位置：首页 > 业界资讯 >最新发布的Stable Diffusion 3论文揭示关键架构细节，对Sora的复现是否具有帮助？

最新发布的Stable Diffusion 3论文揭示关键架构细节，对Sora的复现是否具有帮助？

　　发布于2024-12-12　阅读（0）

扫一扫，手机访问

Stable Diffusion 3 的论文终于来了！

这个模型于两周前发布，采用了与 Sora 相同的 DiT（Diffusion Transformer）架构，一经发布就引起了不小的轰动。

与之前版本相比，Stable Diffusion 3 生成的图质量有了显著提升，现在支持多主题提示，并且文字书写效果也得到了改善，不再出现乱码情况。

Stability AI 指出，Stable Diffusion 3 是一个系列模型，其参数量从800M到8B不等。这一参数范围意味着该模型可以在许多便携设备上直接运行，从而显著降低了使用AI大型模型的门槛。

在最新发布的论文中，Stability AI 表示，在基于人类偏好的评估中，Stable Diffusion 3 优于当前最先进的文本到图像生成系统，如 DALL・E 3、Midjourney v6 和 Ideogram v1。不久之后，他们将公开该研究的实验数据、代码和模型权重。

Stable Diffusion 3论文终于发布，架构细节大揭秘，对复现Sora有帮助？

在论文中，Stability AI 透露了关于 Stable Diffusion 3 的更多细节。

Stable Diffusion 3论文终于发布，架构细节大揭秘，对复现Sora有帮助？

论文标题：Scaling Rectified Flow Transformers for High-Resolution Image Synthesis
论文链接：https://stabilityai-public-packages.s3.us-west-2.amazonaws.com/Stable+Diffusion+3+Paper.pdf

架构细节

对于文本到图像的生成，Stable Diffusion 3 模型必须同时考虑文本和图像两种模式。因此，论文作者称这种新架构为 MMDiT，意指其处理多种模态的能力。与之前版本的 Stable Diffusion 一样，作者使用预训练模型来推导合适的文本和图像表征。具体来说，他们使用了三种不同的文本嵌入模型 —— 两种 CLIP 模型和 T5—— 来编码文本表征，并使用改进的自编码模型来编码图像 token。

Stable Diffusion 3论文终于发布，架构细节大揭秘，对复现Sora有帮助？

Stable Diffusion 3 模型架构。

Stable Diffusion 3论文终于发布，架构细节大揭秘，对复现Sora有帮助？

改进的多模态扩散 transformer：MMDiT 块。

SD3 架构基于 Sora 核心研发成员 William Peebles 和纽约大学计算机科学助理教授谢赛宁合作提出的 DiT。由于文本嵌入和图像嵌入在概念上有很大不同，因此 SD3 的作者对两种模态使用两套不同的权重。如上图所示，这相当于为每种模态设置了两个独立的 transformer，但将两种模态的序列结合起来进行注意力运算，从而使两种表征都能在各自的空间内工作，同时也将另一种表征考虑在内。

Stable Diffusion 3论文终于发布，架构细节大揭秘，对复现Sora有帮助？

在训练过程中测量视觉保真度和文本对齐度时，作者提出的 MMDiT 架构优于 UViT 和 DiT 等成熟的文本到图像骨干。

通过这种方法，信息可以在图像和文本 token 之间流动，从而提高模型的整体理解能力，并改善所生成输出的文字排版。正如论文中所讨论的那样，这种架构也很容易扩展到视频等多种模式。

Stable Diffusion 3论文终于发布，架构细节大揭秘，对复现Sora有帮助？

得益于 Stable Diffusion 3 改进的提示遵循能力，新模型有能力制作出聚焦于各种不同主题和质量的图像，同时还能高度灵活地处理图像本身的风格。

Stable Diffusion 3论文终于发布，架构细节大揭秘，对复现Sora有帮助？

通过 re-weighting 改进 Rectified Flow

Stable Diffusion 3 采用 Rectified Flow（RF）公式，在训练过程中，数据和噪声以线性轨迹相连。这使得推理路径更加平直，从而减少了采样步骤。此外，作者还在训练过程中引入了一种新的轨迹采样计划。他们假设，轨迹的中间部分会带来更具挑战性的预测任务，因此该计划给予轨迹中间部分更多权重。他们使用多种数据集、指标和采样器设置进行比较，并将自己提出的方法与 LDM、EDM 和 ADM 等 60 种其他扩散轨迹进行了测试。结果表明，虽然以前的 RF 公式在少步采样情况下性能有所提高，但随着步数的增加，其相对性能会下降。相比之下，作者提出的重新加权 RF 变体能持续提高性能。

Stable Diffusion 3论文终于发布，架构细节大揭秘，对复现Sora有帮助？

扩展 Rectified Flow Transformer 模型

作者利用重新加权的 Rectified Flow 公式和 MMDiT 骨干对文本到图像的合成进行了扩展（scaling）研究。他们训练的模型从带有 450M 个参数的 15 个块到带有 8B 个参数的 38 个块不等，并观察到验证损失随着模型大小和训练步骤的增加而平稳降低（上图的第一行）。为了检验这是否转化为对模型输出的有意义改进，作者还评估了自动图像对齐指标（GenEval）和人类偏好分数（ELO）（上图第二行）。结果表明，这些指标与验证损失之间存在很强的相关性，这表明后者可以很好地预测模型的整体性能。此外，scaling 趋势没有显示出饱和的迹象，这让作者对未来继续提高模型性能持乐观态度。

灵活的文本编码器

通过移除用于推理的内存密集型 4.7B 参数 T5 文本编码器，SD3 的内存需求可显著降低，而性能损失却很小。如图所示，移除该文本编码器不会影响视觉美感（不使用 T5 时的胜率为 50%），只会略微降低文本一致性（胜率为 46%）。不过，作者建议在生成书面文本时加入 T5，以充分发挥 SD3 的性能，因为他们观察到，如果不加入 T5，生成排版的性能下降幅度更大（胜率为 38%），如下图所示：

Stable Diffusion 3论文终于发布，架构细节大揭秘，对复现Sora有帮助？

只有在呈现涉及许多细节或大量书面文本的非常复杂的提示时，移除 T5 进行推理才会导致性能显著下降。上图显示了每个示例的三个随机样本。

模型性能

作者将 Stable Diffusion 3 的输出图像与其他各种开源模型（包括 SDXL、SDXL Turbo、Stable Cascade、Playground v2.5 和 Pixart-α）以及闭源模型（如 DALL-E 3、Midjourney v6 和 Ideogram v1）进行了比较，以便根据人类反馈来评估性能。在这些测试中，人类评估员从每个模型中获得输出示例，并根据模型输出在多大程度上遵循所给提示的上下文（prompt following）、在多大程度上根据提示渲染文本（typography）以及哪幅图像具有更高的美学质量（visual aesthetics）来选择最佳结果。

Stable Diffusion 3论文终于发布，架构细节大揭秘，对复现Sora有帮助？

以 SD3 为基准，这个图表概述了它在基于人类对视觉美学、提示遵循和文字排版的评估中的胜率。

从测试结果来看，作者发现 Stable Diffusion 3 在上述所有方面都与当前最先进的文本到图像生成系统相当，甚至更胜一筹。

在消费级硬件上进行的早期未优化推理测试中，最大的 8B 参数 SD3 模型适合 RTX 4090 的 24GB VRAM，使用 50 个采样步骤生成分辨率为 1024x1024 的图像需要 34 秒。

Stable Diffusion 3论文终于发布，架构细节大揭秘，对复现Sora有帮助？

此外，在最初发布时，Stable Diffusion 3 将有多种变体，从 800m 到 8B 参数模型不等，以进一步消除硬件障碍。

Stable Diffusion 3论文终于发布，架构细节大揭秘，对复现Sora有帮助？

Stable Diffusion 3论文终于发布，架构细节大揭秘，对复现Sora有帮助？

更多细节请参考原论文。

参考链接：https://stability.ai/news/stable-diffusion-3-research-paper

本文转载于：https://www.51cto.com/article/783014.html 如有侵犯，请联系admin@zhengruan.com删除

上一篇：AWS首席信息安全官：GenAI是有限工具，非神奇钥匙

下一篇：OpenAI官方澄清邮件往来 8 年细节，回应马斯克质疑

产品推荐

售后无忧
立即购买>

DAEMON Tools Lite 10【序列号终身授权 + 中文版 + Win】

￥150.00
office旗舰店
售后无忧
立即购买>

DAEMON Tools Ultra 5【序列号终身授权 + 中文版 + Win】

￥198.00
office旗舰店
售后无忧
立即购买>

DAEMON Tools Pro 8【序列号终身授权 + 中文版 + Win】

￥189.00
office旗舰店
售后无忧
立即购买>

CorelDRAW X8 简体中文【标准版 + Win】

￥1788.00
office旗舰店

正版软件

加密数字货币有多少种

截至2023年7月，CoinMarketCap列出了超过21,000种加密数字货币，可分为以下几类：比特币、山寨币、稳定币、实用型代币。此外，还有隐私币、DeFi代币、治理代币和NFT等细分类别，而加密数字货币的种类仍在不断变化和增长。

8分钟前 0
正版软件

upbit登录不上怎么办

无法登录Upbit，请尝试以下步骤：检查网络连接。重启设备。检查Upbit服务器状态。重置密码。清除浏览器缓存和Cookie。尝试其他浏览器。联系Upbit客服。

18分钟前 0
正版软件

三星：生成式 AI 带动服务器固态硬盘销量大增，HBM 需求旺盛致通用内存吃紧

本站4月30日消息，在今日举行的三星电子一季度财报电话会议上，三星表示生成式AI的流行对于其存储业务的多个品类都带来了明显影响。针对NAND、固态硬盘业务而言，生成式AI的需求提升了IT企业对服务器的需求，进而导致各大服务器业者对企业级存储产品的采购力度大幅提升。最终加速固态硬盘市场的增长。三星预估AI热潮将推动其今年企业级固态硬盘销售同比增长80%。这一趋势在性价比更佳的QLC产品上更为明显，下半年相关产品的销售量有望达到上半年的3倍。这波企业级存储热潮也带动了动相联系的产品价格上行：据本站早前报道，三

28分钟前内存固态硬盘三星 HBM 0
正版软件

火币网狗狗币怎么充值交易

如何在火币网充值和交易狗狗币？充值狗狗币：登录火币网账户并选择“充币”，选择“狗狗币（DOGE）”，复制充值地址或扫描二维码，从其他钱包或交易所转账狗狗币。交易狗狗币：找到“狗狗币（DOGE）”交易对，选择“买入”或“卖出”，输入数量和价格，确认订单信息并点击“交易”。

43分钟前 0
正版软件

单卡跑Llama 70B快过双卡，微软硬生生把FP6搞到了A100里 | 开源

FP8和更低的浮点数量化精度，不再是H100的“专利”了！老黄想让大家用INT8/INT4，微软DeepSpeed团队在没有英伟达官方支持的条件下，硬生生在A100上跑起FP6。测试结果表明，新方法TC-FPx在A100上的FP6量化，速度接近甚至偶尔超过INT4，而且拥有比后者更高的精度。在此基础之上，还有端到端的大模型支持，目前已经开源并集成到了DeepSpeed等深度学习推理框架中。这一成果对大模型的加速效果也是立竿见影——在这种框架下用单卡跑Llama，吞吐量比双卡还要高2.65倍。一名机器学习研

58分钟前模型数据开源 0

最新发布

1

阿里追捧的中台，“热度”退了？

1868天前
2

Overture设置踏板标记的方法

1705天前
3

思杰马克丁取得CleanMyMac中国区独家发行授权

1695天前
4

IBM：20万台Mac让公司职工在工作中更快乐更多产

1893天前
5

报道称微软一直在悄然游说反对“维修权”立法！

1859天前
6

美国怀疑华为窃取商业机密华为：身正不怕影子斜

1855天前
7

三星被曝正与联发科接洽 A系列手机有望搭载其5G芯片

1870天前
8

环球墨非完成千万级融资联合企业集团投资

1891天前
9

EasyRecovery恢复移动设备中的数据前需要注意什么

1692天前

相关推荐

热门关注

Xshell 6 简体中文

￥899.00-￥1149.00
DaVinci Resolve Studio 16 简体中文

￥2550.00-￥2550.00
Camtasia 2019 简体中文

￥689.00-￥689.00
Luminar 3 简体中文

￥288.00-￥288.00
Apowersoft 录屏王简体中文

￥129.00-￥339.00

网站备案号：湘ICP备19013367号-1 联系邮箱：admin@zhengruan.com
Copyright ©2018-2020