微软亚洲研究院推出NUWA-XL超长视频生成模型
站长网2023-04-20 11:16:450阅
你相信吗?只要输入16句简单描述,AI就能生成11分钟的动画了。
近日,微软亚洲研究院推出了NUWA-XL超长视频生成模型,采用创新的Diffusion over Diffusion架构,通过「从粗到细」的生成过程,可以并行生成高质量的超长视频,为多模态大模型提供了新的解题思路。

论文地址:https://arxiv.org/abs/2303.12346
NUWA-XL「从粗到细」的生成方法具有三个优势:
分层结构使模型能够直接在长视频上进行训练,从而消除了训练和推理之间的差距。
模型包含多个局部扩散模型,自然支持并行推理,可以显著提高生成长视频时的推理速度。例如在相同的硬件设置下,当生成1024帧时,NUWA-XL 使平均推理时间从7.55分钟减少到26秒,速度提升了94.26%。
由于视频的长度可以相对于深度 m 呈指数级扩展,因此模型可以很容易地扩展出更长的视频。

目前,长视频生成的多数方法是采用「Autoregressive over X」架构,这种方法存在训练-推理差距的问题,导致不真实的、扭曲的镜头变化。
NUWA-XL的推出填补了长视频生成领域的空白,为人工智能在视频生成方面的应用提供了新的可能性。
微软亚洲研究院首席研究员段楠表示,目前人工智能多模态大模型的研发仍停留在文字生成阶段。即使GPT-4已经在理解方面加入了视觉信息,但仅限于图片,输出依旧是文字或代码。因此,当前和未来的研究方向非常明确,就是将语言和视觉的理解和生成融入到一个基础大模型中,以增强图像、视频和音频的生成。他希望未来可以使用一套结构来融合支持语言和视觉的生成算法,使人工智能模型更加通用。
0000
评论列表
共(0)条相关推荐
Meta 宣布开源多感官 AI 模型 ImageBind:整合文本、音频、视觉等六种类型数据
Meta宣布推出一个新的开源AI模型,可以连接多种数据流,包括文本、音频、视觉数据、温度和动作读数。图片来自Meta该模型目前仅是一个研究项目,没有立即的消费者或实际应用,但它指向了未来可以创建沉浸式、多感官体验的生成式AI系统,并表明了Meta在对手OpenAI和Google日益注重保密的时候仍在分享AI研究。站长网2023-05-10 09:09:390001瑞幸迎来万店规模,中国“星巴克”来了?
此前,在一季度业绩说明会上,瑞幸咖啡董事长郭谨一曾称,瑞幸“万店计划”将有望在今年上半年实现。果不其然,6月5日,瑞幸咖啡的第1万家门店在厦门中山路正式开业,中国咖啡由此迎来了万店时代。瑞幸咖啡的第一万家门店,也带来了咖啡赛场的新狂欢。对准库迪的9.9元价格战在万店仪式上,瑞幸宣布将全面开启“万店同庆”活动,在全国1万门店长期执行9.9元优惠活动,“让中国咖啡迈入9.9元时代”。站长网2023-06-13 14:24:230000联发科发布天玑 9200+ 移动平台 专为游戏手机而设计
联发科今天下午发布了全新的天玑9200旗舰芯片,专为游戏手机而设计。该芯片是在去年的高端芯片天玑9200的基础上进行升级,提升了性能和效率。图片截自MediaTek站长网2023-05-10 17:27:450000交通管理 AI 平台 NoTraffic 获得 5000 万美元 B 轮融资:利用 AI 技术改善交通
站长之家(ChinaZ.com)7月5日消息:基于人工智能的交通管理平台NoTraffic已获得5000万美元的B轮融资,该平台在美国各城市的发展势头强劲。站长网2023-07-05 18:20:2300005月新规来了!互联网广告新限制:关闭弹出广告不得经两次以上点击
快科技4月29日消息,今天五一假期已经开启,假期中就要正式进入5月份了,同事也有一大批新规即将开始执行。其中最受关注之一就是互联网广告新规,将于5月1日开始实施。市场监管总局发布的《互联网广告管理办法》(以下简称《办法》),进一步明确了广告主、互联网广告经营者和发布者、互联网信息服务提供者的责任;积极回应社会关切,对人民群众反映集中的弹出广告、开屏广告、利用智能设备发布广告等行为作出规范。0002