Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: MIMO – 阿里智能研究院推出的可控角色AI视频合成框架
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AIGC 资讯 > MIMO – 阿里智能研究院推出的可控角色AI视频合成框架
AIGC 资讯

MIMO – 阿里智能研究院推出的可控角色AI视频合成框架

站外新闻
最近更新: 2026年7月9日 上午7:58
SHARE

MIMO是什么

MIMO是阿里巴巴集团智能计算研究所推出的可控角色视频合成的新型AI框架,基于空间分解建模技术,将2D视频转换为3D空间代码,实现对角色、动作和场景的精确控制。MIMO能处理任意角色的合成,适应新颖的3D动作,并与真实世界场景交互。MIMO的核心在于将视频分解为主要人物、底层场景和浮动遮挡三个部分,然后分别编码为身份代码、运动代码和场景代码,用于合成过程的控制信号。不仅提高了合成视频的真实感,还增强了用户对视频内容的控制能力。

阅读目录
  • MIMO是什么
  • MIMO的主要功能
  • MIMO的技术原理
  • MIMO的项目地址
  • MIMO的应用场景

MIMO

MIMO的主要功能

  • 可控角色合成:用户通过提供简单的输入控制视频中角色的外观。
  • 动作控制:MIMO能根据提供的姿势序列合成角色的动作,包括复杂的3D动作。
  • 场景交互:将角色自然地融入到真实世界的场景中,包括处理遮挡和物体交互。
  • 空间分解建模:将视频分解为不同的空间组件,包括主要人物、底层场景和浮动遮挡。
  • 3D感知合成:基于3D表示提高合成视频的真实感和深度感知。
  • 灵活的用户控制:用户自由组合不同的潜在代码控制视频合成的各个方面。
  • 任意角色的可扩展性:MIMO能合成任意角色,不仅限于训练数据集中的角色。

MIMO的技术原理

  • 3D深度估计:用单目深度估计器将2D视频帧转换成3D空间中的表示。
  • 空间分解:基于估计的3D深度信息,将视频分解为三个主要的空间组件:
    • 主要人物:视频中的核心对象。
    • 底层场景:视频的背景部分。
    • 浮动遮挡:视频中的前景物体,如会遮挡主体的物体。
  • 组件编码:将上述空间组件进一步编码为不同的代码:
    • 身份代码:表示角色的视觉身份。
    • 运动代码:表示角色的动作和姿态。
    • 场景代码:表示视频的背景场景信息。
  • 结构化运动表示:用变形的人体模型(如SMPL)表示和编码人物的动作,允许更精确地捕捉复杂的3D运动。
  • 规范身份表示:将角色转换到一个规范的姿势(如A-pose)解耦身份和动作,使身份表示与动作无关。
  • 场景和遮挡编码:用共享的变分自编码器(VAE)编码场景和遮挡组件,然后重新组织为完整的场景代码。

MIMO的项目地址

  • 项目官网:menyifang.github.io/projects/MIMO/index.html
  • GitHub仓库:https://github.com/menyifang/MIMO
  • arXiv技术论文:https://arxiv.org/pdf/2409.16160

MIMO的应用场景

  • 电影和视频制作:快速生成动画角色的表演,减少特效和动画制作的成本和时间。
  • 游戏开发:为游戏角色创建逼真的动作和交互,提升游戏体验。
  • 虚拟现实(VR):在虚拟环境中创建与用户互动的动态角色,增强沉浸感。
  • 增强现实(AR):在现实世界中叠加虚拟角色和对象,用于教育、娱乐或导航。
  • 社交媒体和娱乐:允许用户创建和分享具有个性化动作和场景的虚拟角色视频。
  • 广告和营销:制作吸引人的动态广告,其中角色根据目标受众进行定制。
  • 教育和培训:创建模拟场景和角色,用于教育目的,如历史重现或语言学习。
Kilo CLI 1.0 正式发布:开源AI命令行工具,支持500+模型,实现跨平台智能体编程
GLM-Z1-32B – 智谱开源的新一代推理模型
YC总裁亲测开源GBrain:打造AI Agent永生记忆,万级文件知识图谱实战解析
AI Youtube Shorts Generator – 开源的AI视频编辑工具,自动分析视频提取精彩片段
Kimi-VL – 月之暗面开源的轻量级多模态视觉语言模型
分享
Email 复制链接 打印
Share
上一篇 INFP – 音频驱动的生成逼真面部表情和头部姿态的AI框架
下一篇 STORM AI – 斯坦福大学推出的开源AI写作工具
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

FeyNoBg – Feyn Labs 开源的自动背景去除模型
AIGC 资讯
Qwen-Audio-3.0-ASR-Flash – 阿里千问推出的语音识别大模型
AIGC 资讯
全息流体渐变通用占位特色图
微软云端隐忧:千亿营收背后的增速换挡与杠杆风险
AIGC 资讯
全息流体渐变通用占位特色图
微信公众号推出 AI”一键排版”:自动分段、生成小标题、匹配配图三步到位
AIGC 资讯

相关推荐

AI 工具AIGC 资讯

腾讯混元开源AngelSlim:全模态大模型压缩工具包,推理加速最高1.9倍

站外新闻
AIGC 大模型压缩 开源工具 推理加速 腾讯混元
AIGC 资讯

Dubbing v2 – ElevenLabs 推出的 AI 配音模型

站外新闻
全息流体渐变通用占位特色图
AIGC 资讯

国产算力新里程碑:美团LongCat-2. 0 大模型正式开源

站外新闻
AIGC 资讯

文心大模型X1 Turbo – 百度推出的最新深度思考型模型

站外新闻
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

AIGC Midjourney prompt AI Agent GPT Image 2 多模态大模型 EvoLink灵感 AI绘画 字节跳动 开源工具 开源模型 早报 具身智能 openai 大语言模型 开源大模型 阿里通义 强化学习 腾讯混元 Anthropic MoE架构 多模态AI 开源框架 AI智能体 教程 AI工具 扩散模型 AI视频生成 chatgpt 大模型
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.