阿里巴巴推出 AtomoVideo 高保真图生视频框架,兼容多种文生图模型

2025-02-11 来源|AI图库吧

3 月 7 日消息,阿里巴巴研究团队近日推出了 AtomoVideo 高保真图生视频(I2V,Image to Video)框架,旨在从静态图像生成高质量的视频内容,并与各种文生图(T2I)模型兼容。

3 月 7 日消息,阿里巴巴研究团队近日推出了 AtomoVideo 高保真图生视频(I2V,Image to Video)框架,旨在从静态图像生成高质量的视频内容,并与各种文生图(T2I)模型兼容。

总结 AtomoVideo 特性如下:

高保真度:生成的视频与输入图像在细节与风格上保持高度一致性

运动一致性:视频动作流畅,确保时间上的一致性,不会出现突兀的跳转

视频帧预测:通过迭代预测后续帧的方式,支持长视频序列的生成

兼容性:与现有的多种文生图(T2I)模型兼容

高语义可控性:能够根据用户的特定需求生成定制化的视频内容

▲图源 AtomoVIdeo团队论文

AtomoVideo 使用预先训练好的 T2I 模型为基础,在每个空间卷积层和注意力层之后新添加一维时空卷积和注意力模块,T2I 模型参数固定,只训练添加的时空层。由于输入的串联图像信息仅由 VAE 编码,代表的是低层次信息,有助于增强视频相对于输入图像的保真度。同时,团队还以 Cross-Attention 的形式注入高级图像语义,以实现更高的图像语义可控性。

目前,该团队只发布了 AtomoVideo 的论文及演示视频,并未提供在线体验地址。同时官方开设了 GitHub 账户,但仅用作官方网站托管,并未上传任何相关代码。

最新
更多

阿里巴巴推出 AtomoVideo 高保真图生视频框架,兼容多种文生图模型

3 月 7 日消息,阿里巴巴研究团队近日推出了 AtomoVideo 高保真图生视频(I2V,Image to Video)框架,旨在从静态图像生成高质量的视频内容,并与各种文生图(T2I)模型兼容。

“零一万物”宣布开源Yi-9B模型,号称同系列内代码、数学能力最强,能在消费级显卡上轻松部署

“零一万物 01AI”发布消息称,对外开源 Yi-9B 模型,这款大模型的特点是综合数学能力突出,官方称其为 Yi 系列模型中的“理科状元”。

Stable Diffusion 3技术报告公开:基于Sora生成构架,开源图像模型有望超越Midjourney、DALL·E等闭源模型

Stability AI在发布了Stable Diffusion 3之后,公布了详细的技术报告。核心技术——改进版的Diffusion模型和一个基于DiT的文生图全新架构!

马斯克与奥特曼「八年的爱恨情仇」:从兄弟联手创办OpenAI,到理念不合、分道扬镳、相爱相杀、对薄公堂

马斯克与OpenAI、Altman之间,还有一些从未公开的秘密。他们之间究竟经历了什么?华尔街日报一篇长文,讲述了马斯克与Altman的「兄弟情谊」如何走向终结。

OpenAI完成奥特曼被罢免内部调查丨Midjourney将Stability AI拉黑丨马斯克:OpenAI更名CloseAI就撤诉

【AI奇点网2024年3月8日早报】本站每日播报AI业界最新资讯,触摸时代脉搏,掌握未来科技动向。事不宜迟,点击查看今日AI资讯早餐。

二月AI爆炸!除了SORA你还知道哪个AI工具?

二月份以来出了很多AI工具,除了sora,stability AI,stable video,还有很多大模型的新技术!

网站地图