微软亚洲研究院推出NUWA-XL超长视频生成模型

站长网2023-04-20 11:16:452阅

你相信吗?只要输入16句简单描述，AI就能生成11分钟的动画了。

近日，微软亚洲研究院推出了NUWA-XL超长视频生成模型，采用创新的Diffusion over Diffusion架构，通过「从粗到细」的生成过程，可以并行生成高质量的超长视频，为多模态大模型提供了新的解题思路。

论文地址:https://arxiv.org/abs/2303.12346

NUWA-XL「从粗到细」的生成方法具有三个优势:

分层结构使模型能够直接在长视频上进行训练，从而消除了训练和推理之间的差距。

模型包含多个局部扩散模型，自然支持并行推理，可以显著提高生成长视频时的推理速度。例如在相同的硬件设置下，当生成1024帧时，NUWA-XL 使平均推理时间从7.55分钟减少到26秒，速度提升了94.26%。

由于视频的长度可以相对于深度 m 呈指数级扩展，因此模型可以很容易地扩展出更长的视频。

目前，长视频生成的多数方法是采用「Autoregressive over X」架构，这种方法存在训练-推理差距的问题，导致不真实的、扭曲的镜头变化。

NUWA-XL的推出填补了长视频生成领域的空白，为人工智能在视频生成方面的应用提供了新的可能性。

微软亚洲研究院首席研究员段楠表示，目前人工智能多模态大模型的研发仍停留在文字生成阶段。即使GPT-4已经在理解方面加入了视觉信息，但仅限于图片，输出依旧是文字或代码。因此，当前和未来的研究方向非常明确，就是将语言和视觉的理解和生成融入到一个基础大模型中，以增强图像、视频和音频的生成。他希望未来可以使用一套结构来融合支持语言和视觉的生成算法，使人工智能模型更加通用。

微软亚洲研究院推出NUWAXL超长视频生成模型

0002

评论列表

共(0)条

相关推荐

站长资讯
假新闻和嘲笑逝者——微软的人工智能新闻聚合出了什么问题？
站长之家(ChinaZ.com)11月6日消息:最新的一篇CNN报道通过一些例子展示了MSNAI模型在新闻聚合方面的问题，如突出显示一则声称美国总统乔·拜登在为毛伊岛野火受害者默哀时打瞌睡的新闻（实际上并没有），或是一则错误地将一名NBA球员描述为「无用」的讣告。
站长网2023-11-06 08:58:32
0001
站长资讯
独立开发变现周刊（第93期）：有意思的迷你砖块，每月赚1.7万美元
目录1、OpenResume:一个开源简历构建器2、chatgpt-bookmarks:ChatGPT管理书签3、ArtQR:人人都可以玩的AI精美二维码4、fashionAI:一键换装5、ai-getting-started:周末就能搞起来的JavascriptAI入门项目6、有意思的迷你砖块，每月赚1.7万美元1、OpenResume:一个开源简历构建器
站长网2023-06-30 19:48:52
0000
站长资讯
交个朋友遭遇月饼李鬼将全部退一赔三：停售启动专项调查
今日，“交个朋友直播间”针对“芬迪卡萨月饼”事件发布了情况说明，并宣布了退一赔三的补偿决定。此前，直播间接到用户投诉，指出所售的“芬迪卡萨FENDICASA月饼伴手礼”涉嫌与著名奢侈品品牌FENDI（包括FENDICASA系列）的品牌关联造假。
站长网2024-09-12 03:53:02
0000
站长资讯
Meta承认使用用户帖子来训练其人工智能
划重点:🔍Meta公司承认使用Facebook和Instagram用户的帖子来训练其新的人工智能助手MetaAI。🔍MetaAI是一个对文本查询进行响应并能够从文本提示生成逼真图像的会话助手。🔍对于隐私和道德问题，一些用户担忧Meta未获得明确同意使用其帖子，并未充分通知他们如何使用其数据。
站长网2023-10-16 23:03:03
0000
站长资讯
瑞幸打假泰国山寨店败诉后泰国瑞幸向中国瑞幸索赔20亿元
据每日经济新闻消息，泰国皇家50R集团于19日上午向法院正式提交诉讼，要求中国瑞幸咖啡赔偿经济损失100亿泰铢（约合人民币20.46亿元），法院对此已立案受理。
站长网2023-12-20 08:48:14
0000