震撼登场：单图生成全角度3D视频，模型权重开源

　　发布于2024-12-19　阅读（0）

扫一扫，手机访问

Stability AI 的大模型家族来了一位新成员。

昨日，Stability AI 继推出文生图 Stable Diffusion、文生视频 Stable Video Diffusion 之后，又为社区带来了 3D 视频生成大模型「Stable Video 3D」（简称 SV3D）。

该模型是基于 Stable Video Diffusion 构建的，其主要优势在于显著提升了3D生成的质量和多视角一致性。相较于之前的Stability AI推出的Stable Zero123以及联合开源的Zero123-XL，该模型的效果更为出色。

目前，Stable Video 3D 既支持商用，需要加入 Stability AI 会员（Membership）；也支持非商用，用户在 Hugging Face 上下载模型权重即可。

Stable Video 3D震撼登场：单图生成无死角3D视频、模型权重开放

Stability AI 提供了两个模型变体，分别是 SV3D_u 和 SV3D_p。SV3D_u 基于单个图像输入，无需进行相机调整即可生成轨道视频；而 SV3D_p 则进一步扩展了生成能力，通过适配单个图像和轨道视角，允许用户沿指定的相机路径创建 3D 视频。

目前，Stable Video 3D 的研究论文已经放出，核心作者有三位。

Stable Video 3D震撼登场：单图生成无死角3D视频、模型权重开放

论文地址：https://stability.ai/s/SV3D_report.pdf
博客地址：https://stability.ai/news/introducing-stable-video-3d
Huggingface 地址：https://huggingface.co/stabilityai/sv3d

技术概览

Stable Video 3D 在 3D 生成领域实现重大进步，尤其是在新颖视图生成（novel view synthesis，NVS）方面。

以往的方法通常倾向于解决有限视角和输入不一致的问题，而 Stable Video 3D 能够从任何给定角度提供连贯视图，并能够很好地泛化。因此，该模型不仅增加了姿势可控性，还能确保多个视图中对象外观的一致性，进一步改进了影响真实和准确 3D 生成的关键问题。

如下图所示，与 Stable Zero123、Zero-XL 相比，Stable Video 3D 能够生成细节更强、更忠实于输入图像和多视角更一致的新颖多视图。

Stable Video 3D震撼登场：单图生成无死角3D视频、模型权重开放

此外，Stable Video 3D 利用其多视角一致性来优化 3D 神经辐射场（Neural Radiance Fields，NeRF），以提高直接从新视图生成 3D 网格的质量。

为此，Stability AI 设计了掩码分数蒸馏采样损失，进一步增强了预测视图中未见过区域的 3D 质量。同时为了减轻烘焙照明问题，Stable Video 3D 采用了与 3D 形状和纹理共同优化的解耦照明模型。

下图为使用 Stable Video 3D 模型及其输出时，通过 3D 优化改进后的 3D 网格生成示例。

Stable Video 3D震撼登场：单图生成无死角3D视频、模型权重开放

下图为使用 Stable Video 3D 生成的 3D 网格结果与 EscherNet、Stable Zero123 的生成结果比较。

Stable Video 3D震撼登场：单图生成无死角3D视频、模型权重开放

架构细节

Stable Video 3D 模型的架构如下图 2 所示，它基于 Stable Video Diffusion 架构构建而成，包含一个具有多个层的 UNet，其中每一层又包含一个带有 Conv3D 层的残差块序列，以及两个带有注意力层（空间和时间）的 transformer 块。

Stable Video 3D震撼登场：单图生成无死角3D视频、模型权重开放

具体流程如下所示：

(i) 删除「fps id」和「motion bucket id」的矢量条件，原因是它们与 Stable Video 3D 无关；

(ii) 条件图像通过 Stable Video Diffusion 的 VAE 编码器嵌入到潜在空间，然后在通向 UNet 的噪声时间步 t 处连接到噪声潜在状态输入 zt；

(iii) 条件图像的 CLIPembedding 矩阵被提供给每个 transformer 块的交叉注意力层来充当键和值，而查询成为相应层的特征；

(iv) 相机轨迹沿着扩散噪声时间步被馈入到残差块中。相机姿势角度 ei 和 ai 以及噪声时间步 t 首先被嵌入到正弦位置嵌入中，然后将相机姿势嵌入连接在一起进行线性变换并添加到噪声时间步嵌入中，最后被馈入到每个残差块并被添加到该块的输入特征中。

此外，Stability AI 设计了静态轨道和动态轨道来研究相机姿势调整的影响，具体如下图 3 所示。

Stable Video 3D震撼登场：单图生成无死角3D视频、模型权重开放

在静态轨道上，相机采用与条件图像相同的仰角，以等距方位角围绕对象旋转。这样做的缺点是基于调整的仰角，可能无法获得关于对象顶部或底部的任何信息。而在动态轨道上，方位角可以不等距，每个视图的仰角也可以不同。

为了构建动态轨道，Stability AI 对静态轨道采样，向方位角添加小的随机噪声，并向其仰角添加不同频率的正弦曲线的随机加权组合。这样做提供了时间平滑性，并确保相机轨迹沿着与条件图像相同的方位角和仰角循环结束。

实验结果

Stability AI 在未见过的 GSO 和 OmniObject3D 数据集上，评估了静态和动态轨道上的 Stable Video 3D 合成多视图效果。结果如下表 1 至表 4 所示，Stable Video 3D 在新颖多视图合成方面实现了 SOTA 效果。

表 1 和表 3 显示了 Stable Video 3D 与其他模型在静态轨道的结果，表明了即使是无姿势调整的模型 SV3D_u，也比所有先前的方法表现得更好。

消融分析结果表明，SV3D_c 和 SV3D_p 在静态轨道的生成方面优于 SV3D_u，尽管后者专门在静态轨道上进行了训练。

Stable Video 3D震撼登场：单图生成无死角3D视频、模型权重开放

下表 2 和表 4 展示了动态轨道的生成结果，包括姿势调整模型 SV3D_c 和 SV3D_p，后者在所有指标上实现了 SOTA。

Stable Video 3D震撼登场：单图生成无死角3D视频、模型权重开放

下图 6 中的视觉比较结果进一步表明，与以往工作相比，Stable Video 3D 生成的图像细节更强、更忠实于条件图像、多视角更加一致。

Stable Video 3D震撼登场：单图生成无死角3D视频、模型权重开放

更多技术细节和实验结果请参阅原论文。

本文转载于：https://www.51cto.com/article/784176.html 如有侵犯，请联系admin@zhengruan.com删除

上一篇：编写LoRA代码的入门指南

下一篇：小鹏汽车与华为：自动驾驶竞争之路

产品推荐

售后无忧
立即购买>

DAEMON Tools Lite 10【序列号终身授权 + 中文版 + Win】

￥150.00
office旗舰店
售后无忧
立即购买>

DAEMON Tools Ultra 5【序列号终身授权 + 中文版 + Win】

￥198.00
office旗舰店
售后无忧
立即购买>

DAEMON Tools Pro 8【序列号终身授权 + 中文版 + Win】

￥189.00
office旗舰店
售后无忧
立即购买>

CorelDRAW X8 简体中文【标准版 + Win】

￥1788.00
office旗舰店

正版软件

解读大规模语言模型微调的挑战与优化策略

大家好，我是Luga。今天我们将继续探讨人工智能生态领域中的技术，特别是LLMFine-Tuning。本文将继续深入剖析LLMFine-Tuning技术，帮助大家更好地理解其实现机制，以便更好地应用于市场开发和其他领域。LLMs(LargeLanguageModels)正在引领人工智能技术的新浪潮。这种先进的AI通过利用统计模型分析海量数据，学习单词和词组之间的复杂模式，从而模拟人类认知和语言能力。LLMs的强大功能已引起了众多头部企业以及科技爱好者的浓厚兴趣，他们纷纷竞相采用这些由人工智能驱动的创新解决

8分钟前人工智能 AI LLMs 0
正版软件

Cloudera联手NVIDIA，推出多项整合微服务功能，助力企业释放数据潜力，加速AI应用创新

Cloudera亚太区高级副总裁RemusLim强调了NVIDIA在人工智能计算领域的领先地位和Cloudera在数据管理领域的专业积累之间的互补关系。他表示，两者的合作将帮助客户构建能够提供高度精确数据和见解的模型。这些模型将以安全的机器学习（ML）环境运行，得到企业的信任，并能够满足不断变化的需求。Lim强调，他们很高兴能够协助客户加速其人工智能之旅，实现从AI探索和实验阶段到整个组织内的大规模部署的无缝过渡。北京，2024年3月20日——近日，可信的企业人工智能数据公司肯睿Cloudera宣布进一步

13分钟前人工智能 NVIDIA Cloudera 0
正版软件

iPhone 17或许能摆脱划痕问题，苹果投入大笔资金引进新技术

3月20日消息，自iPhone12问世以来，苹果公司在手机屏幕技术上取得了显著的进步。该公司引入了超瓷晶玻璃，一种具有出色抗摔性能的材料，使手机在意外摔落时更不易碎裂。然而，尽管超瓷晶玻璃在防碎方面表现出色，但划痕问题仍然存在，尤其是对于那些经常将手机放入包中的用户来说，划痕可能成为一个令人头疼的问题。据小编了解，针对划痕问题，苹果公司一直在积极寻求解决方案。近日，有博主爆料称，苹果已从日本斥资数十亿购买镀膜设备，并交由中国供应链进行生产。预计在iPhone17系列上，苹果将采用一种全新的外层玻璃设计，即

23分钟前苹果 0
正版软件

Google推出"Vlogger"模型使得一张图片能够生成10秒视频

谷歌发布了一个新的视频框架：只需要一张你的头像、一段讲话录音，就能得到一个本人栩栩如生的演讲视频。视频时长可变，目前看到的示例最高为10s。可以看到，无论是口型还是面部表情，它都非常自然。如果输入图像囊括整个上半身，它也能配合丰富的手势：网友看完就表示：有了它，以后咱开线上视频会议再也不需要整理好发型、穿好衣服再去了。嗯，拍一张肖像，录好演讲音频就可以（手动狗头）用声音控制肖像生成视频这个框架名叫VLOGGER。它主要基于扩散模型，并包含两部分：一个是随机的人体到3D运动（human-to-3d-moti

38分钟前模型训练 0
正版软件

联想与NVIDIA合作发布量身定制的混合AI解决方案，强调生成式AI功能

全球AI盛会GTC（GPUTechnologyConference）2024今天正式开幕，联想集团和NVIDIA宣布他们将合作推出全新的混合人工智能解决方案。这个合作旨在帮助企业和云提供商获得在人工智能时代成功所需的关键加速计算能力，将人工智能从理论概念转变为实际应用。这一消息在会议上引起了广泛关注，吸引了众多与会者的目光。这一合作将为市场带来全新的技术和解决方案，为不同行业带来更广泛的应用可能性。联想集团和NVIDIA的专业知识和技术实力将结合，共同开发出更加强大和高效的人工智能解决方案，为用户提供更多

53分钟前产业 0

震撼登场：单图生成全角度3D视频，模型权重开源

技术概览

实验结果

产品推荐

最新发布

相关推荐

热门关注