商城首页欢迎来到中国正版软件门户

文章教程　|　产品大全　|　软件问答

您的位置：首页 > 业界资讯 >AI视频生成框架：Pika、Gen-2、ModelScope、SEINE……哪个更强？这个测试一下就知道了

AI视频生成框架：Pika、Gen-2、ModelScope、SEINE……哪个更强？这个测试一下就知道了

　　发布于2024-11-22　阅读（0）

扫一扫，手机访问

AI 视频生成，是最近最热门的领域之一。各个高校实验室、互联网巨头 AI Lab、创业公司纷纷加入了 AI 视频生成的赛道。Pika、Gen-2、Show-1、VideoCrafter、ModelScope、SEINE、LaVie、VideoLDM 等视频生成模型的发布，更是让人眼前一亮。v⁽ⁱ⁾

大家肯定对以下几个问题感到好奇：

到底哪个视频生成模型最牛？
每个模型有什么特长？
AI 视频生成领域目前还有哪些值得关注的问题待解决？

为此，我们推出了VBench，一个全面的「视频生成模型的评测框架」，旨在向用户提供关于各种视频模型的优劣和特点。通过VBench，用户可以了解不同视频模型的强项和优势。

Pika、Gen-2、ModelScope、SEINE……AI视频生成哪家强？这个框架一测便知

论文：https://arxiv.org/abs/2311.17982
代码：https://github.com/Vchitect/VBench
网页：https://vchitect.github.io/VBench-project/
论文标题：VBench: Comprehensive Benchmark Suite for Video Generative Models

VBench不仅能全面、细致地评估视频生成效果，还能提供符合人们感官体验的评估，节省时间和精力。

Pika、Gen-2、ModelScope、SEINE……AI视频生成哪家强？这个框架一测便知

VBench 包含 16 个分层和解耦的评测维度
VBench 开源了用于文生视频生成评测的 Prompt List 体系
VBench 每个维度的评测方案与人类的观感与评价对齐
VBench 提供了多视角的洞察，助力未来对于 AI 视频生成的探索

Pika、Gen-2、ModelScope、SEINE……AI视频生成哪家强？这个框架一测便知

“VBench” - 「视频生成模型」的全面基准测试套件

Pika、Gen-2、ModelScope、SEINE……AI视频生成哪家强？这个框架一测便知

AI 视频生成模型 - 评测结果

已开源的 AI 视频生成模型

各个开源的 AI 视频生成模型在 VBench 上的表现如下。

Pika、Gen-2、ModelScope、SEINE……AI视频生成哪家强？这个框架一测便知

各家已开源的 AI 视频生成模型在 VBench 上的表现。在雷达图中，为了更清晰地可视化比较，我们将每个维度的评测结果归一化到了 0.3 与 0.8 之间。

Pika、Gen-2、ModelScope、SEINE……AI视频生成哪家强？这个框架一测便知

各家已开源的 AI 视频生成模型在 VBench 上的表现。

在以上 6 个模型中，可以看到 VideoCrafter-1.0 和 Show-1 在大多数维度都有相对优势。

创业公司的视频生成模型

VBench 目前给出了 Gen-2 和 Pika 这两家创业公司模型的评测结果。

Pika、Gen-2、ModelScope、SEINE……AI视频生成哪家强？这个框架一测便知

Gen-2 和 Pika 在 VBench 上的表现。在雷达图中，为了更清晰地可视化比较，我们加入了 VideoCrafter-1.0 和 Show-1 作为参考，同时将每个维度的评测结果归一化到了 0.3 与 0.8 之间。

Pika、Gen-2、ModelScope、SEINE……AI视频生成哪家强？这个框架一测便知

Gen-2 和 Pika 在 VBench 上的表现。我们加入了 VideoCrafter-1.0 和 Show-1 的数值结果作为参考。

可以看到，Gen-2 和 Pika 在视频质量（Video Quality）上有明显优势，例如时序一致性（Temporal Consistency）和单帧质量（Aesthetic Quality 和 Imaging Quality）相关维度。在与用户输入的 prompt 的语义一致性上（例如 Human Action 和 Appearance Style），部分维度开源模型会更胜一筹。

视频生成模型 VS 图片生成模型

Pika、Gen-2、ModelScope、SEINE……AI视频生成哪家强？这个框架一测便知

视频生成模型 VS 图片生成模型。其中 SD1.4，SD2.1 和 SDXL 是图片生成模型。

视频生成模型在 8 大场景类别上的表现

下面是不同模型在 8 个不同类别上的评测结果。

Pika、Gen-2、ModelScope、SEINE……AI视频生成哪家强？这个框架一测便知

VBench 现已开源，一键即可安装

目前，VBench 已全面开源，且支持一键安装。欢迎大家来玩，测试一下感兴趣的模型，一起推动视频生成社区的发展。

Pika、Gen-2、ModelScope、SEINE……AI视频生成哪家强？这个框架一测便知

Pika、Gen-2、ModelScope、SEINE……AI视频生成哪家强？这个框架一测便知

Pika、Gen-2、ModelScope、SEINE……AI视频生成哪家强？这个框架一测便知

开源地址：https://github.com/Vchitect/VBench

Pika、Gen-2、ModelScope、SEINE……AI视频生成哪家强？这个框架一测便知

我们也开源了一系列 Prompt List：https://github.com/Vchitect/VBench/tree/master/prompts，包含在不同能力维度上用于评测的 Benchmark，以及在不同场景内容上的评测 Benchmark。

Pika、Gen-2、ModelScope、SEINE……AI视频生成哪家强？这个框架一测便知

左边词云展示了我们 Prompt Suites 的高频词分布，右图展示了不同维度和类别的 prompt 数量统计。

VBench 准不准？

针对每个维度，我们计算了 VBench 评测结果与人工评测结果之间的相关度，进而验证我们方法与人类观感的一致性。下图中，横轴代表不同维度的人工评测结果，纵轴则展示了 VBench 方法自动评测的结果，可以看到我们方法在各个维度都与人类感知高度对齐。

Pika、Gen-2、ModelScope、SEINE……AI视频生成哪家强？这个框架一测便知

VBench 带给 AI 视频生成的思考

VBench 不仅可以对现有模型进行评测，更重要的是，还可以发现不同模型中可能存在的各种问题，为未来 AI 视频生成的发展提供有价值的 insights。

「时序连贯性」以及「视频的动态程度」：不要二选一，而应同时提升

我们发现时序连贯性（例如 Subject Consistency、Background Consistency、Motion Smoothness）与视频中运动的幅度（Dynamic Degree）之间有一定的权衡关系。比如说，Show-1 和 VideoCrafter-1.0 在背景一致性和动作流畅度方面表现很好，但在动态程度方面得分较低；这可能是因为生成「没有动起来」的画面更容易显得「在时序上很连贯」。另一方面，VideoCrafter-0.9 在与时序一致性的维度上弱一些，但在 Dynamic Degree 上得分很高。

这说明，同时做好「时序连贯性」和「较高的动态程度」确实挺难的；未来不应只关注其中一方面的提升，而应该同时提升「时序连贯性」以及「视频的动态程度」这两方面，这才是有意义的。

分场景内容进行评测，发掘各家模型潜力

有些模型在不同类别上表现出的性能存在较大差异，比如在美学质量（Aesthetic Quality）上，CogVideo 在「Food」类别上表现不错，而在「LifeStyle」类别得分较低。如果通过训练数据的调整，CogVideo 在「LifeStyle」这些类别上的美学质量是否可以提升上去，进而提升模型整体的视频美学质量？

这也告诉我们，在评估视频生成模型时，需要考虑模型在不同类别或主题下的表现，挖掘模型在某个能力维度的上限，进而针对性地提升「拖后腿」的场景类别。

有复杂运动的类别：时空表现都不佳

在空间上复杂度高的类别，在美学质量维度得分都比较低。例如，「LifeStyle」类别对复杂元素在空间中的布局有比较高的要求，「Human」类别由于铰链式结构的生成带来了挑战。

对于时序复杂的类别，比如「Human」类别通常涉及复杂的动作、「Vehicle」类别会经常出现较快的移动，它们在所有测试的维度上得分都相对较低。这表明当前模型在处理时序建模方面仍然存在一定的不足，时序上的建模局限可能会导致空间上的模糊与扭曲，从而导致视频在时间和空间上的质量都不理想。

难生成的类别：提升数据量收益不大

我们对常用的视频数据集 WebVid-10M 进行了统计，发现其中约有 26% 的数据与「Human」有关，在我们统计的八个类别中占比最高。然而，在评估结果中，「Human」类别却是八个类别中表现最差的之一。

这说明对于「Human」这样复杂的类别，仅仅增加数据量可能不会对性能带来显著的改善。一种潜在的方法是通过引入「Human」相关的先验知识或控制，比如 Skeletons 等，来指导模型的学习。

百万量级的数据集：提升数据质量优先于数据量

「Food」类别虽然在 WebVid-10M 中仅占据 11%，但在评测中几乎总是拥有最高的美学质量分数。于是我们进一步分析了 WebVid-10M 数据集不同类别内容的美学质量表现，发现「Food」类别在 WebVid-10M 中也有最高的美学评分。

这意味着，在百万量级数据的基础上，筛选 / 提升数据质量比增加数据量更有帮助。

待提升的能力：准确生成生成多物体，以及物体间的关系

当前的视频生成模型在「多对象生成」（Multiple Objects）和「空间关系」（Spatial Relationship）方面还是追不上图片生成模型（尤其是 SDXL），这凸显了提升组合能力的重要性。所谓组合能力指的是模型在视频生成中是否能准确展示多个对象，及它们之间的空间及互动关系。

解决这一问题的潜在方法可能包括：

数据打标：构建视频数据集，提供对视频中多个物体的明确描述，以及物体间空间位置关系以及互动关系的描述。
在视频生成过程中添加中间模态 / 模块来辅助控制物体的组合和空间位置关系。
使用更好的文本编码器（Text Encoder）也会对模型的组合生成能力有比较大的影响。
曲线救国：将 T2V 做不好的「物体组合」问题交给 T2I，通过 T2I+I2V 的方式来生成视频。这一做法针对其他很多视频生成中的问题或许也有效。

本文转载于：https://www.51cto.com/article/779938.html 如有侵犯，请联系admin@zhengruan.com删除

上一篇：最常用的九个Python库用于机器学习

下一篇：即将发布的游戏平板震撼亮相：超大尺寸和巨大电池容量

产品推荐

售后无忧
立即购买>

DAEMON Tools Lite 10【序列号终身授权 + 中文版 + Win】

￥150.00
office旗舰店
售后无忧
立即购买>

DAEMON Tools Ultra 5【序列号终身授权 + 中文版 + Win】

￥198.00
office旗舰店
售后无忧
立即购买>

DAEMON Tools Pro 8【序列号终身授权 + 中文版 + Win】

￥189.00
office旗舰店
售后无忧
立即购买>

CorelDRAW X8 简体中文【标准版 + Win】

￥1788.00
office旗舰店

正版软件

Autoliv推出摩托车安全气囊系统以确保驾驶者的安全

6月12日消息，瑞典汽车安全气囊制造商Autoliv最近推出了一款专为摩托车设计的安全气囊系统，旨在提供额外的保护，减轻摩托车驾驶者在碰撞时面临的冲击并降低受伤风险。Autoliv计划将这款安全气囊固定在摩托车的前部，通过车头的传感器和计算机控制系统来确定气囊的启动时机和充气速度。据小编了解，该气囊系统具有较小的体积，并且可以与多种摩托车兼容，使其适用范围更广。为了验证这款安全气囊的性能，Autoliv进行了一系列模拟测试，模拟了摩托车驾驶者在撞击时可能受到的伤害。他们指出，安装了这款安全气囊系统的摩托车

7分钟前摩托车安全气囊制造商 0
正版软件

贾扬清公司效率领先，大型模型推理成本榜发布

「大模型的API是个亏本买卖吗？」随着大语言模型技术的实用化，许多科技公司推出了大模型API，供开发者使用。然而，我们不禁开始怀疑基于大模型的业务能否持续下去，尤其是考虑到OpenAI每天烧掉70万美元的情况。本周四，AI创业公司Martian为我们仔细盘算了一下。排行榜链接：https://leaderboard.withmartian.com/TheLLMInferenceProviderLeaderboardisanopen-sourcerankingofAPIinferenceproductsfo

12分钟前 AI 训练 0
正版软件

混淆矩阵的解释及其影响四种衡量指标：精确度、召回率、准确度和 F-Measure

混淆矩阵是机器学习中有力的预测分析工具，用于总结二元分类任务中分类器的正确和错误预测数量。简单来说，“混淆矩阵是机器学习算法的性能度量”。通过可视化混淆矩阵，我们可以观察对角线值来确定模型准确性，评估准确分类的数量。如果考虑矩阵的结构，矩阵的大小与输出类的数量成正比。混淆矩阵是矩阵形式，列代表预测值，行代表实际值，总结分类模型预测结果。测量混淆矩阵可帮助评估分类模型的准确性和错误类型。混淆矩阵的好处1、提供有关分类器所犯错误和所犯错误类型的信息。2、反映分类模型在进行预测时是如何混乱的。3、有助于克服单独

27分钟前机器学习 0
正版软件

中国成都四川正式开设空中客车全面飞机服务中心

空中客车飞机全生命周期服务中心今日宣布投入运营，将为飞机全生命周期管理提供解决方案。该中心位于中国四川成都。据介绍，作为其首家一站式服务中心，空客飞机全生命周期服务中心将面向各种机型，涵盖业务范围包括从飞机停放、存储到维修、升级、改装、拆解、回收以及拆解后的二手可用航材分销业务。该服务中心已获得欧洲航空安全局（EASA）和中国民用航空局的相关认证，未来规划总占地面积71.7万平方米，规划建设停放125架飞机。从投运到2025年，中心将逐步扩大运营，直接聘用员工150人。空中客车飞机全生命周期服务中心是由空

42分钟前飞机空客空中客车 0
正版软件

奔驰纯电G级四轮电机系统惊艳登场，引发市场震荡

据最新报道，奔驰汽车计划在2024年推出其首款纯电硬派越野车——纯电G级，并将其引入中国市场。届时，消费者将能够选择普通版或AMG高性能版的纯电G级车型。这一举措旨在满足中国市场对电动车的不断增长的需求，并提供更多的选择给消费者。这款备受瞩目的纯电G级越野车标志着奔驰在电动化领域的重要布局。虽然放弃了传统的V8发动机，但纯电G级却采用了一套更强大的四轮电机系统，为车辆提供了更澎湃的动力。这种创新设计不仅增加了车辆的灵活性和控制精度，还进一步提升了驾驶体验。根据小编的了解，纯电G级的四轮电机系统可以独立驱动

57分钟前奔驰 0

最新发布

1

阿里追捧的中台，“热度”退了？

1808天前
2

Overture设置踏板标记的方法

1645天前
3

思杰马克丁取得CleanMyMac中国区独家发行授权

1635天前
4

IBM：20万台Mac让公司职工在工作中更快乐更多产

1833天前
5

报道称微软一直在悄然游说反对“维修权”立法！

1799天前
6

美国怀疑华为窃取商业机密华为：身正不怕影子斜

1795天前
7

三星被曝正与联发科接洽 A系列手机有望搭载其5G芯片

1810天前
8

环球墨非完成千万级融资联合企业集团投资

1831天前
9

EasyRecovery恢复移动设备中的数据前需要注意什么

1632天前

相关推荐

热门关注

Xshell 6 简体中文

￥899.00-￥1149.00
DaVinci Resolve Studio 16 简体中文

￥2550.00-￥2550.00
Camtasia 2019 简体中文

￥689.00-￥689.00
Luminar 3 简体中文

￥288.00-￥288.00
Apowersoft 录屏王简体中文

￥129.00-￥339.00

网站备案号：湘ICP备19013367号-1 联系邮箱：admin@zhengruan.com
Copyright ©2018-2020