Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: Hallo2 – 复旦、百度和南大共同推出的音频驱动视频生成模型
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AIGC 资讯 > Hallo2 – 复旦、百度和南大共同推出的音频驱动视频生成模型
AIGC 资讯

Hallo2 – 复旦、百度和南大共同推出的音频驱动视频生成模型

站外新闻
最近更新: 2026年7月8日 下午9:35
SHARE

Hallo2是什么

Hallo2是复旦大学、百度公司和南京大学共同推出的音频驱动视频生成模型。能将单张参考图片和持续几分钟的音频输入结合起来,基于可选的文本提示调节肖像表情,生成与音频同步的高分辨率4K视频。Hallo2基于先进的数据增强技术,如补丁下降和高斯噪声,增强视频的长期视觉一致性和时间连贯性。Hallo2实现潜在代码的矢量量化和时间对齐技术,生成4K分辨率的视频,引入语义文本标签作为条件输入,提高动画的可控性和多样性。Hallo2在多个公开数据集上进行广泛的实验,展示在生成长时间、高分辨率、丰富且可控内容方面的能力。

阅读目录
  • Hallo2是什么
  • Hallo2的主要功能
  • Hallo2的技术原理
  • Hallo2的项目地址
  • Hallo2的应用场景

Hallo2

Hallo2的主要功能

  • 长时视频生成:能生成长达一小时的视频生成,解决外观漂移和时间伪影的问题。
  • 高分辨率输出:实现4K分辨率的肖像视频生成,提供清晰的视觉细节。
  • 音频驱动动画:基于音频输入驱动肖像图像动画,实现口型和表情的同步。
  • 文本提示调节:引入文本提示调节和细化肖像的表情,增加动画的多样性和表现力。
  • 数据增强技术:基于补丁下降和高斯噪声增强技术,提高视频的长期视觉一致性和时间连贯性。

Hallo2的技术原理

  • 补丁下降技术(Patch-Drop Augmentation):基于在条件帧中随机丢弃部分图像块(补丁),减少前一帧对后续帧外观的影响,保持长时间视频生成中的视觉一致性。
  • 高斯噪声增强:在补丁下降的基础上加入高斯噪声,进一步提高模型对参考图像外观的依赖,保留运动信息,减少累积的伪影和失真。
  • 向量量化生成对抗网络(VQGAN):基于向量量化潜在代码和应用时间对齐技术,Hallo2能在时间维度上维持连贯性,生成4K分辨率的高质量视频。
  • 语义文本标签:Hallo2引入可调整的语义文本标签作为条件输入,支持模型根据文本提示生成特定的表情和动作,提高生成内容的可控性。
  • 跨注意力机制(Cross-Attention Mechanism):模型能在去噪过程中有效地整合运动条件,如音频特征和文本嵌入,生成与条件输入相一致的图像。

Hallo2的项目地址

  • 项目官网:fudan-generative-vision.github.io/hallo2
  • GitHub仓库:https://github.com/fudan-generative-vision/hallo2
  • HuggingFace模型库:https://huggingface.co/fudan-generative-ai/hallo2
  • arXiv技术论文:https://arxiv.org/pdf/2410.07718v1
  • Hallo3肖像动画生成框架:https://ai-bot.cn/hallo3/

Hallo2的应用场景

  • 电影和视频制作:在电影制作中,Hallo2生成或增强角色的面部表情和口型,用在需要大量虚拟角色或特效的科幻和动画电影中。
  • 虚拟助手和数字人:在客服、教育、娱乐等领域,Hallo2能创建逼真的虚拟助手或数字人,提供更加自然和吸引人的交互体验。
  • 游戏开发:游戏开发者基于Hallo2生成具有高度真实感的角色动画,提高游戏的沉浸感和玩家的游戏体验。
  • 社交媒体和内容创作:内容创作者用Hallo2创建动态肖像视频,用在社交媒体平台,增加内容的吸引力和互动性。
  • 新闻和广播:Hallo2能生成新闻主播的动画形象,在需要多语言播报的情况下,快速生成不同语言的口型和表情。
谷歌重磅开源!Computer Use Preview:用自然语言指挥AI操控浏览器,零代码实现网页自动化
HippoRAG 2 – 俄亥俄州立大学推出的检索增强生成框架
Anthropic发布Claude Opus 4.8:代码缺陷率暴跌75%,速度提升2.5倍碾压GPT-5.5
Self Forcing: Adobe与德克萨斯大学联合推出实时视频生成模型,单GPU实现17FPS,告别传统AI视频生成延迟
VoiceCraft – 开源的语音编辑和文本转语音模型
分享
Email 复制链接 打印
Share
上一篇 HouseCrafter – 东北大学和 Stability AI推出2D转换3D室内场景的技术
下一篇 书生·物华2.0(3DTopia 2.0)- 上海AI实验室联合南洋理工推出三维物体生成大模型
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

Fresh Burst Sprite Ad Poster
AI 生图 Prompt
Taco Supreme Extreme Poster
AI 生图 Prompt
Toy Figure Character Transformation
AI 生图 Prompt
Chibi Eraser Product Photography
AI 生图 Prompt

相关推荐

AI 工具AIGC 资讯最新趋势

Time-R1: 3B参数小模型登顶时间推理,三阶段强化学习如何击败671B巨无霸?

站外新闻
AIGC Time-R1 强化学习 时间推理模型
AIGC 资讯

HumanVid – 专为人类图像动画生成而设计的高质量数据集

站外新闻
AI 工具AIGC 资讯

Qwen3-Max:阿里通义超万亿参数模型发布,性能超越GPT-5,AI Agent与推理能力全面解析

站外新闻
AI Agent AIGC Qwen3-Max 阿里通义
AI 工具AIGC 资讯

Cursor发布Composer 2.5:自研Agentic编程模型,性能比肩Opus 4.7、成本仅1/10

站外新闻
Agentic编程模型 AI编程工具 Composer 2.5 Cursor SWE-Bench
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

AIGC Midjourney prompt AI Agent GPT Image 2 多模态大模型 EvoLink灵感 AI绘画 字节跳动 开源工具 开源模型 早报 具身智能 openai 大语言模型 开源大模型 阿里通义 强化学习 腾讯混元 写实人像 Anthropic MoE架构 多模态AI 开源框架 AI智能体 教程 AI工具 扩散模型 AI视频生成 chatgpt
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.