Megrez-3B-Omni – 无问芯穹开源的端侧全模态理解模型
Megrez-3B-Omni是什么 Megrez-3B-Omni是无问芯穹推出的全球首个端侧全模态理解开源模型,能处理图像、音频和文本三种模态数据。Megrez-3B-O…
LayerDiffusion – AI生成具有透明度的图像的框架
LayerDiffusion是什么 LayerDiffusion(现已更名为LayerDiffuse)是由来自斯坦福大学的研究人员 Lvmin Zhang(即Contro…
ID-Animator – 腾讯等推出的个性化人物视频生成框架
ID-Animator是什么 ID-Animator是由来自腾讯光子工作室、中科大和中科院合肥物质科学研究院的研究人员推出的一种零样本(zero-shot)人类视频生成技…
FaceChain – 阿里推出的人物写真和个人形象生成框架
FaceChain是阿里巴巴达摩院推出的一个开源的人物写真和个人数字形象的AI生成框架(类似于免费开源版的妙鸭相机),用户仅需要提供最少一张照片即可生成独属于自己的个人形…
Veo 2 – 谷歌 DeepMind 推出的 AI 视频生成模型,支持高达 4K 分辨率
Veo 2是什么 Veo 2 是 Google DeepMind 推出的 AI 视频生成模型,能根据文本或图像提示生成高质量视频内容。Veo 2支持高达 4K 分辨率的视…
TextDiffuser-2 – 微软等推出的AI图像文本渲染融合框架
TextDiffuser-2是什么 Text-Diffuser 2是由来自微软研究院、香港科技大学和中山大学的研究人员最新推出的一个基于扩散模型的文本渲染方法,旨在解决图…
IDM-VTON – 逼真的开源AI虚拟试穿框架
IDM-VTON是什么 IDM-VTON(Improved Diffusion Models for Virtual Try-ON)是由韩国科学技术院和OMNIOUS.A…
I2VGen-XL:阿里推出的图像到视频生成模型
I2VGen-XL是什么 I2VGen-XL 是阿里巴巴达摩院推出的一款开源的图像到视频的生成模型,通过创新的级联扩散方法,将文本视频数据与视频结构解耦,同时利用静态图像…
RDT – 清华开源的双臂机器人扩散基础模型
RDT是什么 RDT(Robotics Diffusion Transformer)是清华大学AI研究院TSAIL团队推出的全球最大的双臂机器人操作任务扩散基础模型。RD…
UniEdit – 免训练调优的统一视频编辑框架
UniEdit是什么 UniEdit是由浙江大学、微软研究院和北京大学的研究人员推出的一个创新的视频编辑框架,允许用户在不需要进行模型微调的情况下,对视频的运动和外观进行…
VideoGigaGAN – Adobe推出的AI视频分辨率提升模型
VideoGigaGAN是什么 VideoGigaGAN是由Adobe和马里兰大学的研究人员提出的一种新型的生成式视频超分辨率(VSR)模型,最高可将视频分辨率提升8倍,…
MagicVideo-V2:字节跳动推出的AI视频生成模型
MagicVideo-V2是什么 MagicVideo-V2 是字节跳动公司团队开发的一款AI视频生成模型和框架,通过将文本到图像模型、视频运动生成器、参考图像嵌入模块和…
Apollo – Meta 联合斯坦福大学推出的大型多模态模型
Apollo是什么 Apollo是Meta和斯坦福大学合作推出的大型多模态模型(LMMs),专注于视频理解。Apollo基于系统研究,揭示视频理解在LMMs中的关键驱动因…
DUSt3R – 从任意图像集合中重建3D场景的框架
DUSt3R是什么 DUSt3R(Dense and Unconstrained Stereo 3D Reconstruction,密集无约束立体三维重建)是由来自芬兰阿…
Vidu – 生数科技发布的视频大模型,可生成16秒1080P的视频
Vidu是什么 Vidu是生数科技推出的AI视频生成平台,集成Vidu Q2、Vidu Q3等先进模型,支持图生视频、文生视频和参考生视频功能。用户能通过上传图片、输入文…
Motionshop – 阿里推出的AI角色动画项目,可替换视频人物为3D
Motionshop是什么 Motionshop是阿里巴巴智能计算研究院(XR实验室和TIDE三维渲染团队)推出的一个AI角色动画框架,可将视频中的人物角色替换为3D化身…
