Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: JoyVASA – 京东健康开源的音频驱动的数字人头项目
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AIGC 资讯 > JoyVASA – 京东健康开源的音频驱动的数字人头项目
AIGC 资讯

JoyVASA – 京东健康开源的音频驱动的数字人头项目

站外新闻
最近更新: 2026年7月14日 上午4:48
SHARE

JoyVASA是什么

JoyVASA是京东健康国际公司开源的音频驱动的数字人头项目,基于扩散模型技术,根据音频信号生成与音频同步的面部动态和头部运动。JoyVASA能实现人物的唇形同步和表情控制,还扩展到动物头像的动画生成,在多语种支持和跨物种动画化方面具有广泛的应用潜力。

阅读目录
  • JoyVASA是什么
  • JoyVASA的主要功能
  • JoyVASA的技术原理
  • JoyVASA的项目地址
  • JoyVASA的应用场景

JoyVASA

JoyVASA的主要功能

  • 音频驱动的面部动画:根据输入的音频信号生成与之同步的面部动画,包括嘴唇动作和表情变化。
  • 唇形同步:基于音频与嘴唇动作的精确匹配,实现逼真的对话效果。
  • 表情控制:控制和生成特定的面部表情,增强动画的表现力。
  • 动物面部动画:JoyVASA能生成动物的面部动态,扩展应用范围。
  • 多语言支持:基于在包含中文和英文数据的混合数据集上训练,JoyVASA支持多语言动画生成。
  • 高质量视频生成:项目能生成高分辨率和高质量的动画视频,提升观看体验。

JoyVASA的技术原理

  • 解耦面部表示:JoyVASA用解耦的面部表示框架,将动态面部表情从静态3D面部表示中分离出来,生成更长的视频。
  • 扩散模型:项目用扩散模型(diffusion model)直接从音频提示中生成运动序列,运动序列与角色身份无关。
  • 两阶段训练:
    • 第一阶段:分离静态面部特征和动态运动特征,静态特征捕获面部的身份特征,动态特征编码面部表情、缩放、旋转和平移等动态元素。
    • 第二阶段:训练一个扩散变换器(diffusion transformer),从音频特征中生成运动特征。
  • 音频特征提取:用wav2vec2编码器提取输入语音的音频特征,作为生成运动序列的条件。
  • 运动序列生成:基于扩散模型在滑动窗口中采样音频驱动的运动序列,运动序列包括面部表情和头部运动。

JoyVASA的项目地址

  • 项目官网:jdh-algo.github.io/JoyVASA
  • GitHub仓库:https://github.com/jdh-algo/JoyVASA
  • HuggingFace模型库:https://huggingface.co/jdh-algo/JoyVASA
  • arXiv技术论文:https://arxiv.org/pdf/2411.09209

JoyVASA的应用场景

  • 虚拟助手:在智能家居、客户服务和技术支持中,以为虚拟助手提供逼真的面部动画和表情,提升用户交互体验。
  • 娱乐和媒体:用在生成或增强角色的面部表情和动作,减少传统动作捕捉的需求。为游戏角色提供更自然的面部表情和动画,提升游戏的沉浸感。
  • 社交媒体:用户可以利用JoyVASA生成自己的虚拟形象,用于视频聊天或社交媒体平台上的内容创作。
  • 教育和培训:在在线教育平台中,创建虚拟教师,提供更具吸引力的教学体验。在医疗、军事等领域,模拟人物反应和表情,用于专业训练。
  • 广告和营销:创建吸引人的虚拟代言人,用于广告宣传,提高品牌形象的吸引力。
商汤Seko AI重磅升级:发布Seko Space,以‘创编一体’技术重塑漫短剧工业化生产链路
字节跳动Seed重磅开源:Ouro循环语言模型横空出世,1.4B参数性能超越大型LLM,重新定义AI推理效率
AI训练数据版权争议迎关键判例,印度法院支持模型训练合法性讨论
英伟达发布NitroGen:斯坦福联合打造开源通用游戏AI模型,泛化能力飙升52%
xAI全面升级Grok Voice,新增 21 款多语言旗舰语音
分享
Email 复制链接 打印
Share
上一篇 TIP-I2V – 超170万大规模真实文本和图像提示数据集
下一篇 Halo – 开源的DIY健康追踪项目,构建私人健康检测应用
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

FeyNoBg – Feyn Labs 开源的自动背景去除模型
AIGC 资讯
Qwen-Audio-3.0-ASR-Flash – 阿里千问推出的语音识别大模型
AIGC 资讯
全息流体渐变通用占位特色图
微软云端隐忧:千亿营收背后的增速换挡与杠杆风险
AIGC 资讯
全息流体渐变通用占位特色图
微信公众号推出 AI”一键排版”:自动分段、生成小标题、匹配配图三步到位
AIGC 资讯

相关推荐

AIGC 资讯

LIMO – 上海交大推出的高效推理方法,仅需817条训练样本

站外新闻
AIGC 资讯

Perplexideez – 开源本地AI搜索助手,智能搜索信息来源追溯

站外新闻
AIGC 资讯

DeepSeek-Coder-V2 – DeepSeek开源的代码语言模型,与GPT4-Turbo相媲美

站外新闻
AIGC 资讯

EXAONE 3.0 – LG 推出的开源 AI 模型,专为英语和韩语设计

站外新闻
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

AIGC Midjourney GPT Image 2 prompt AI Agent 写实人像 多模态大模型 EvoLink灵感 AI绘画 字节跳动 时尚大片 杂志排版 开源工具 开源模型 产品设计 商业海报 皮克斯风格 3D动画 色彩分析 AI生图 早报 具身智能 openai 大语言模型 开源大模型 阿里通义 强化学习 腾讯混元 MoE架构 多模态AI
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.