Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: KeySync – 帝国理工联合弗罗茨瓦夫大学推出的口型同步框架
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AIGC 资讯 > KeySync – 帝国理工联合弗罗茨瓦夫大学推出的口型同步框架
AIGC 资讯

KeySync – 帝国理工联合弗罗茨瓦夫大学推出的口型同步框架

站外新闻
最近更新: 2026年6月7日 下午9:44
SHARE

KeySync是什么

KeySync 是帝国理工学院和弗罗茨瓦夫大学推出的用在高分辨率口型同步框架,支持将输入音频与视频中的口型动作对齐。KeySync 基于两阶段框架实现,首先生成关键帧捕捉音频的关键唇部动作,基于插值生成平滑的过渡帧。KeySync 引入新的掩码策略,有效减少输入视频的表情泄露,用视频分割模型自动处理遮挡问题。KeySync 在视觉质量、时间连贯性和唇部同步准确性方面均优于现有方法,适用于自动配音等实际应用。

阅读目录
  • KeySync是什么
  • KeySync的主要功能
  • KeySync的技术原理
  • KeySync的项目地址
  • KeySync的应用场景

KeySync

KeySync的主要功能

  • 高分辨率口型同步:生成与输入音频精确对齐的高清(512×512)视频,适用于实际应用。
  • 减少表情泄露:减少输入视频中的表情泄露,提升同步效果。
  • 遮挡处理:在推理时自动识别、排除遮挡物(如手部、物体等),确保生成视频的自然性。
  • 提升视觉质量:在多个量化指标和用户研究中表现出色,生成的视频具有更高的清晰度和连贯性。

KeySync的技术原理

  • 两阶段生成框架:
    • 关键帧生成:首先生成一组稀疏的关键帧,捕捉音频中的主要唇部动作,确保每个关键帧准确反映音频的语音内容,同时保留人物身份信息。
    • 插值生成:在关键帧之间进行插值,生成平滑、时间连贯的中间帧,实现流畅的唇部动作过渡。
  • 潜扩散模型:潜扩散模型在压缩的低维潜空间中进行去噪操作,提高计算效率。逐步去除噪声,将随机噪声逐步转化为结构化的视频数据。
  • 掩码策略:基于计算面部关键点,设计覆盖下脸区域的掩码,同时保留必要的上下文信息,防止表情泄露。在推理时,结合预训练的视频分割模型(如 SAM²),自动识别、排除遮挡物,确保生成的唇部区域与遮挡物自然融合。
  • 音频与视频对齐:用 HuBERT 音频编码器将原始音频转换为特征表示,基于注意力机制将其嵌入到视频生成模型中,确保生成的唇部动作与音频精确对齐。
  • 损失函数:结合潜空间损失和像素空间损失(L2 损失),优化视频生成质量,确保生成的唇部区域与音频对齐。

KeySync的项目地址

  • 项目官网:https://antonibigata.github.io/KeySync/
  • GitHub仓库:https://github.com/antonibigata/keysync
  • HuggingFace模型库:https://huggingface.co/toninio19/keysync
  • arXiv技术论文:https://arxiv.org/pdf/2505.00497
  • 在线体验Demo:https://huggingface.co/spaces/toninio19/keysync-demo

KeySync的应用场景

  • 自动配音:用于影视、广告等多语言内容制作,提升配音与唇部动作的对齐效果。
  • 虚拟形象:生成虚拟角色的同步唇部动作,增强虚拟形象的真实感。
  • 视频会议:优化远程通信中的唇部同步,提升用户体验。
  • 无障碍内容:帮助听力障碍人群更好地理解视频内容。
  • 内容修复:修复或替换视频中的唇部动作,提升内容质量。
中国移动上线“新消息Claw”应用号,支持短信远程操控电脑端AI智能体
Bark – Suno AI 推出的开源文本到音频模型
OpenClaw 工程师紧急警告:AI 生成代码质量隐患与开发成本危机
智谱AI发布GLM-5-Turbo:专为龙虾Agent优化,深度解决大模型工具调用与长任务失速难题
ACE-Step 1.5:消费级硬件跑出商业级音乐生成!ACE Studio联合StepFun开源模型,4步推理2秒生成4分钟歌曲
分享
Email 复制链接 打印
Share
上一篇 Polar – 英伟达开源的智能体强化学习训练框架
下一篇 PixelHacker – 华中科技联合VIVO推出的图像修复模型
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

FeyNoBg – Feyn Labs 开源的自动背景去除模型
AIGC 资讯
Qwen-Audio-3.0-ASR-Flash – 阿里千问推出的语音识别大模型
AIGC 资讯
全息流体渐变通用占位特色图
微软云端隐忧:千亿营收背后的增速换挡与杠杆风险
AIGC 资讯
全息流体渐变通用占位特色图
微信公众号推出 AI”一键排版”:自动分段、生成小标题、匹配配图三步到位
AIGC 资讯

相关推荐

AIGC 资讯

Florence-2 – 微软 Azure AI 团队推出的多功能视觉语言模型

站外新闻
AI 工具AIGC 资讯

GPT-5.3 Codex发布:OpenAI最强编程AI模型,性能飙升25%并重新定义软件工程

站外新闻
GPT-5.3 Codex openai SWE-Bench 编程AI模型 软件工程
AI 工具AIGC 资讯

快手KAT-Coder-Pro V2重磅发布:SWE-Bench追平GPT-5,前端美学生成断层领先,国产AI编程模型新标杆

站外新闻
Agentic Coding AI编程模型 KAT-Coder-Pro V2 SWE-Bench 快手KwaiKAT
AIGC 资讯

Qwen-Audio-3.0-TTS – 阿里通义千问推出的语音合成模型

站外新闻
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

AIGC Midjourney prompt AI Agent GPT Image 2 多模态大模型 EvoLink灵感 AI绘画 字节跳动 开源工具 开源模型 早报 具身智能 openai 大语言模型 开源大模型 阿里通义 强化学习 腾讯混元 Anthropic MoE架构 多模态AI 开源框架 AI智能体 教程 AI工具 扩散模型 AI视频生成 chatgpt 大模型
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.