Sora架构在Stable Diffusion 3技术报告中展示出色表现，生图圈开源挑战Midjourney和DALL·E 3？

　　发布于2024-12-12　阅读（0）

扫一扫，手机访问

Stability AI在发布了Stable Diffusion 3之后，今天公布了详细的技术报告。

论文深入分析了Stable Diffusion 3的核心技术——改进版的Diffusion模型和一个基于DiT的文生图全新架构！

Stable Diffusion 3技术报告流出，Sora构架再立大功！生图圈开源暴打Midjourney和DALL·E 3？

报告地址：

https://stabilityai-public-packages.s3.us-west-2.amazonaws.com/Stable+Diffusion+3+Paper.pdf

通过人类评价测试，Stable Diffusion 3在字体设计和对提示的精准响应方面，超过了DALL·E 3、Midjourney v6和Ideogram v1。

Stability AI最新开发的多模态扩散Transformer（MMDiT）架构，使用了专门针对图像和语言表示的独立权重集。与SD 3的早期版本相比，MMDiT在文本理解和拼写方面取得了显著的提升。

Stable Diffusion 3技术报告流出，Sora构架再立大功！生图圈开源暴打Midjourney和DALL·E 3？

性能评估

在人类反馈的基础之上，技术报告将SD 3于大量开源模型SDXL、SDXL Turbo、Stable Cascade、Playground v2.5 和 Pixart-α，以及闭源模型DALL·E 3、Midjourney v6 和 Ideogram v1进行了详细的对比评估。

评估员根据指定提示的一致性、文本的清晰度和图像的整体美观性来选择每个模型的最佳输出。

Stable Diffusion 3技术报告流出，Sora构架再立大功！生图圈开源暴打Midjourney和DALL·E 3？

测试结果显示，无论是在遵循提示的准确性、文本的清晰呈现还是图像的视觉美感方面，Stable Diffusion 3都达到或超过了当前文生图生成技术的最高水平。

Stable Diffusion 3技术报告流出，Sora构架再立大功！生图圈开源暴打Midjourney和DALL·E 3？

完全没有针对硬件进行过优化的SD 3模型具有8B参数，能够在24GB显存的RTX 4090消费级GPU上运行，并且在使用50个采样步骤的情况下，生成1024x1024分辨率的图像需耗时34秒。

此外，Stable Diffusion 3在发布时将提供多个版本，参数范围从8亿到80亿，从而能以进一步降低使用的硬件门槛。

Stable Diffusion 3技术报告流出，Sora构架再立大功！生图圈开源暴打Midjourney和DALL·E 3？

架构细节曝光

在文生图的过程中，模型需同时处理文本和图像这两种不同的信息。所以作者将这个新框架称之为MMDiT。

在文本到图像生成的过程中，模型需同时处理文本和图像这两种不同的信息类型。这就是作者将这种新技术称为MMDiT（多模态Diffusion Transformer的简称）的原因。

与Stable Diffusion之前的版本一样，SD 3采用了预训练模型来提取适合的文本和图像的表达形式。

具体而言，他们利用了三种不同的文本编码器——两个CLIP模型和一个T5 ——来处理文本信息，同时使用了一个更为先进的自编码模型来处理图像信息。

Stable Diffusion 3技术报告流出，Sora构架再立大功！生图圈开源暴打Midjourney和DALL·E 3？

SD 3的架构是在Diffusion Transformer（DiT）的基础上建立的。由于文本和图像信息的差异，SD 3为这两种信息各自设置了独立的权重。

Stable Diffusion 3技术报告流出，Sora构架再立大功！生图圈开源暴打Midjourney和DALL·E 3？

这种设计相当于为每种信息类型配备了两个独立的Transformer，但在执行注意力机制时，会将两种信息的数据序列合并，这样就可以在各自的领域内独立工作的同时，能保持够相互参考和融合。

Stable Diffusion 3技术报告流出，Sora构架再立大功！生图圈开源暴打Midjourney和DALL·E 3？

通过这种独特的构架，图像和文本信息之间可以相互流动和交互，从而在生成的结果中提高对内容的整体理解和视觉表现。

而且，这种架构未来还可以轻松扩展到其他包括视频在内的多种模态。

Stable Diffusion 3技术报告流出，Sora构架再立大功！生图圈开源暴打Midjourney和DALL·E 3？

得益于SD 3在遵循提示方面的进步，模型能够精确生成集中于多种不同主题和特性的图像，同时在图像风格上也保持了极高的灵活性。

Stable Diffusion 3技术报告流出，Sora构架再立大功！生图圈开源暴打Midjourney和DALL·E 3？

通过重赋权法改进Rectified Flow

除了推出的全新Diffusion Transformer构架之外，SD 3对于Diffusion模型也进行了重大的改进。

SD 3采用了Rectified Flow（RF）策略，将训练数据和噪声沿着直线轨迹连接起来。

这种方法让模型的推理路径更加直接，因此可以通过更少的步骤完成样本的生成。

Stable Diffusion 3技术报告流出，Sora构架再立大功！生图圈开源暴打Midjourney和DALL·E 3？

作者在训练流程中引入了一种创新的轨迹采样计划，特别增加了对轨迹中间部分的权重，这些部分的预测任务更具挑战性。

通过与其他60种扩散轨迹（例如 LDM、EDM 和 ADM）进行比较，作者发现尽管之前的RF方法在少步骤采样中表现更佳，但随着采样步骤增多，性能会慢慢下降。

为了避免这种情况的出现，作者提出的加权RF方法，就能够持续提升模型性能。

扩展RF Transformer模型

Stability AI训练了多个不同规模的模型，从 15 个模块、450M参数到38个模块、8B参数，发现模型大小和训练步骤都能平滑地降低验证损失。

为了验证这是否意味着模型输出有实质性的改进，他们还评估了自动图像对齐指标和人类偏好评分。

结果表明，这些评估指标与验证损失强相关，说明验证损失是衡量模型整体性能的有效指标。

此外，这种扩展趋势没有达到饱和点，让我们对未来能够进一步提升模型性能持乐观态度。

Stable Diffusion 3技术报告流出，Sora构架再立大功！生图圈开源暴打Midjourney和DALL·E 3？

作者在256 *256像素分辨率下，在4096的批大小下，用不同参数数对模型进行了500k步训练。

Stable Diffusion 3技术报告流出，Sora构架再立大功！生图圈开源暴打Midjourney和DALL·E 3？

上图说明了长时间训练较大模型对样本质量的影响。

上表显示了GenEval的结果。当使用作者提出的训练方法并提高训练图像的分辨率时，最大的模型在大多数类别中都表现出色，在总分上超过了 DALL·E 3。

根据作者对不同构架模型的测试对比，MMDiT效果非常好，超过了DiT，Cross DiT，UViT，MM-DiT。

Stable Diffusion 3技术报告流出，Sora构架再立大功！生图圈开源暴打Midjourney和DALL·E 3？

灵活的文本编码器

通过在推理阶段去除占用大量内存的4.7B参数的T5文本编码器，SD 3的内存需求得到了大幅降低，而性能损失微乎其微。

去除这个文本编码器不会影响图像的视觉美感（不使用T5的胜率为 50%），只会略微降低文本的准确遵循能力（胜率为46%）。

然而，为了充分发挥SD 3在生成文字的能力，作者还是建议使用T5编码器。

因为作者发现在没有它的情况下，排版生成文字的性能会有更大的下降（胜率为 38%）。

Stable Diffusion 3技术报告流出，Sora构架再立大功！生图圈开源暴打Midjourney和DALL·E 3？

网友热议

网友们对Stability AI不断撩拨用户但是不让用的行为显得有些不耐烦了，纷纷催促赶快上线让大家使用。

Stable Diffusion 3技术报告流出，Sora构架再立大功！生图圈开源暴打Midjourney和DALL·E 3？

看了技术报考后，网友说看来现在生图圈子要成第一个开源碾压闭源的赛道了！

Stable Diffusion 3技术报告流出，Sora构架再立大功！生图圈开源暴打Midjourney和DALL·E 3？

本文转载于：https://www.51cto.com/article/783030.html 如有侵犯，请联系admin@zhengruan.com删除

上一篇：充实碎片时间：我用它来移动办公，也偶尔玩玩游戏

下一篇：人工智能和自动化的联系和差异是什么？

产品推荐

售后无忧
立即购买>

DAEMON Tools Lite 10【序列号终身授权 + 中文版 + Win】

￥150.00
office旗舰店
售后无忧
立即购买>

DAEMON Tools Ultra 5【序列号终身授权 + 中文版 + Win】

￥198.00
office旗舰店
售后无忧
立即购买>

DAEMON Tools Pro 8【序列号终身授权 + 中文版 + Win】

￥189.00
office旗舰店
售后无忧
立即购买>

CorelDRAW X8 简体中文【标准版 + Win】

￥1788.00
office旗舰店

正版软件

脉脉APP升级大模型技术，拓展职场发展空间

大模型赋能、人才竞争加剧……职场环境正在经历前所未有的变革。作为*的职场社交平台,脉脉始终站在时代前沿,致力于为企业和职场人提供精准、有价值的服务,帮助其在未来职场上获得更好的发展。据了解,基于对职场的洞察和未来的预测,脉脉APP正在升级大模型技术和AI技术,将进一步提升人才精准匹配和挖掘能力,为未来企业和人才发展提供更广阔的空间。根据2023年职场新发岗位的变化,随着新经济行业的迅猛发展,人才供需关系已经发生了深刻变化。过去供不应求的市场格局如今已经转变为供过于求,使得人才竞争愈加激烈。同时,高技术人才

9分钟前升级脉脉APP 0
正版软件

比亚迪海鸥荣耀版在10万元级电动车市场上市，掀起新一轮波澜

比亚迪汽车宣布旗下微型电动车海鸥荣耀版今日正式上市，为消费者带来更多选择。新款海鸥荣耀版的官方指导价定在6.98-8.58万元之间，相较于老款车型的7.38-8.98万元，价格更有竞争力。这款车型的推出将进一步丰富消费者的购车选择，满足不同需求的用户。海鸥荣耀版在设计和性能方面都有所提升，符合现代城市出行的需求。比亚迪汽车一直致力于推动电动车市场的发展，通过不断创新和优化产品，为用户提供更具性价比的出行解决方案在过去一年里，海鸥车型以其卓越的性能和实惠的价格脱颖而出，成为比亚迪备受欢迎的车型之一。新推出的

14分钟前比亚迪 0
正版软件

长安汽车董事长朱华荣预测：2024年汽车市场竞争加剧，新能源车辆将迎来加速发展

长安汽车董事长朱华荣最近接受中国基金报采访时，对2024年中国汽车市场做出了深入分析。他指出未来汽车市场竞争将更加激烈，新能源领域的竞争将进一步加剧，行业将出现更多分化现象。朱华荣表示，随着技术发展和消费者需求变化，汽车行业将迎来前所未有的挑战和机遇。他强调了创新和品质的重要性，指出只有不断创新，提升产品品质，企业才能在激烈的市场竞争中立于不败之地。朱华荣还强调了可持续发展的重要性，表示长安汽车朱华荣指出，随着大宗原材料价格的持续走低，新能源汽车的制造成本有望进一步降低，这为车企提供了更大的降价空间。然而

24分钟前长安汽车 0
正版软件

特斯拉最新款Model 3 Performance通过韩国认证，性能和续航能力均得到提升

3月6日消息，特斯拉近日在韩国通过了其全新Model3Performance焕新版的认证，并披露了部分关键参数。据悉，这款新车型在动力系统上进行了显著升级，采用了前置3D3感应异步电动机与后置4D2永磁同步电动机的全新组合。其中，前置电动机输出马力为215Ps，后置电动机则高达412Ps，虽然实际动力参数不能直接相加，但总体功率预计可达约461kW，而后置4D2电动机的单独功率便约为303kW。据了解，新款Model3Performance在保持重量为1855kg的基础上，配备了LG新能源提供的M3P电池

44分钟前特斯拉 0
正版软件

极柯009车主获得福利：免费升级至ZEEKR AD智能驾驶辅助系统

3月6日消息，极氪汽车近日为极氪009的新老车主送上了一份厚礼。据官方宣布，所有极氪009的车主现在可以零成本升级至ZEEKRAD完全智能驾驶辅助系统，并享受终身免费使用权益。这一消息对于极氪汽车的车主们来说无疑是一大利好，原本该系统的官方定价高达35000元，现在却能够免费获得，这无疑提升了极氪009的性价比和吸引力。极氪汽车在智能驾驶技术方面一直积极投入，并取得了显著的成果。目前，极氪009已经成功开通了NZP高速自主领航辅助功能。据极氪汽车官方介绍，该功能在高速及城市快速路场景下能够实现基于导航路径

54分钟前极氪 0