Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • 强化 AI 学习
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • 社区
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: HumanDiT – 浙大联合字节推出的姿态引导人体视频生成框架
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • 强化 AI 学习
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • 社区
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AIGC 资讯 > HumanDiT – 浙大联合字节推出的姿态引导人体视频生成框架
AIGC 资讯

HumanDiT – 浙大联合字节推出的姿态引导人体视频生成框架

站外新闻
最近更新: 2026年6月8日 下午5:59
SHARE

HumanDiT是什么

HumanDiT 是浙江大学和字节跳动联合提出的姿态引导的高保真人体视频生成框架。基于扩散变换器(Diffusion Transformer,DiT),能在大规模数据集上训练,生成具有精细身体渲染的长序列人体运动视频。HumanDiT 的核心优势在于姿态引导机制,通过关键点扩散变换器(Keypoint-DiT)生成后续姿态序列,保证视频中人体动作的连贯性和自然性。引入了前缀潜在参考策略,在长序列中保持个性化特征。 HumanDiT 支持多种视频分辨率和可变序列长度,适合长序列视频生成。基于姿态适配器实现给定序列的姿态转移,进一步提升了姿态对齐的准确性。

阅读目录
  • HumanDiT是什么
  • HumanDiT的主要功能
  • HumanDiT的技术原理
  • HumanDiT的项目地址
  • HumanDiT的应用场景

HumanDiT

HumanDiT的主要功能

  • 姿态引导的视频生成:HumanDiT 基于关键点扩散变换器(Keypoint-DiT)生成后续姿态序列,确保视频中人体动作的连贯性和自然性。
  • 长序列视频生成:支持多种视频分辨率和可变序列长度,适合生成长序列的高质量视频。
  • 个性化特征保持:通过前缀潜在参考策略,在长序列中保持个性化特征。
  • 灵活的输入与输出:能从静态图像或现有视频中继续生成视频,适用于多种应用场景。
  • 姿态适配与细化:基于姿态适配器实现给定序列的姿态转移,通过姿态细化模块增强面部和手部特征与参考图像的对齐效果。

HumanDiT的技术原理

  • 姿态引导与扩散变换器:HumanDiT 通过姿态引导的方式生成视频,基于关键点扩散变换器(Keypoint-DiT)在推理阶段生成后续的姿态序列。确保了视频中人体动作的连贯性和自然性,同时扩散变换器能够处理不同分辨率和序列长度的视频。
  • 前缀潜在参考策略:为了在长序列视频生成中保持个性化特征,HumanDiT 引入了前缀潜在参考策略。策略通过将视频的第一帧作为无噪声的前缀潜在向量,供模型在生成过程中参考,保持视觉一致性。
  • 姿态适配器与姿态细化模块:HumanDiT 使用姿态适配器来实现给定序列的姿态转移,通过姿态细化模块进一步优化生成的姿态序列。有助于提高面部和手部等细节部位的生成质量,确保与参考图像的对齐效果。
  • 大规模数据集训练:HumanDiT 在包含 14000 小时高质量视频的大型数据集上进行训练,数据通过结构化的数据处理流程收集,涵盖了多种人类动作场景。使模型能学习到丰富的运动先验,在推理过程中表现出强大的泛化能力。

HumanDiT的项目地址

  • 项目官网:https://agnjason.github.io/HumanDiT-page/
  • arXiv技术论文:https://arxiv.org/pdf/2502.04847

HumanDiT的应用场景

  • 虚拟人:HumanDiT 可以用于生成虚拟人的动态视频,动作更加自然流畅。在虚拟客服场景中,虚拟人可以根据用户的提问实时生成相应的动作和表情,提供更加生动、逼真的交互体验。
  • 动画电影:HumanDiT 能生成高质量、长序列的人体运动视频,可以用于生成动画角色的动作序列,帮助动画师快速生成高质量的动作片段,提高制作效率。
  • 沉浸式体验:HumanDiT 可以用于构建沉浸式体验中的虚拟角色和动作。在沉浸式 VR 体验中,HumanDiT 可以生成与场景匹配的人物动作和表情,让参与者感受到更加真实和生动的体验。
  • 视频生成与续写:可以从单张图像生成视频,或者从现有视频中继续生成后续内容。
WorldMem – 南洋理工联合北大和上海 AI Lab 推出的世界生成模型
GPT‑5.4 – OpenAI推出面向专业工作的旗舰AI模型
Dubbing v2 – ElevenLabs 推出的 AI 配音模型
GigaTok – 港大联合字节推出用于自回归图像生成的视觉分词器
NBA中国携手阿里巴巴上线首个官方大模型“NBA Chat”
分享
Email 复制链接 打印
Share
上一篇 ReasonIR-8B – Meta AI 推出专为推理密集型检索任务设计的模型
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

ReasonIR-8B – Meta AI 推出专为推理密集型检索任务设计的模型
AIGC 资讯
ReasonGraph – 开源可视化与分析LLMs推理过程的AI工具
AIGC 资讯
Satori – 开源的大语言推理模型,具备自回归搜索和自我纠错能力
AIGC 资讯
Miracle F1 – 美图 WHEE 推出的 AI 图像生成模型
AIGC 资讯

相关推荐

全息流体渐变通用占位特色图
AIGC 资讯

汽车行业AI新坐标!长安“天枢大模型”正式通过国家生成式AI备案

站外新闻
AIGC 资讯

DeepSeek-R1T-Chimera – TNG开源的语言模型

站外新闻
AIGC 资讯

SpatialVLA – 上海 AI Lab 联合上科大等推出的空间具身通用操作模型

站外新闻
AIGC 资讯

ICEdit – 浙江大学联合哈佛大学推出的指令式图像编辑框架

站外新闻
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

Agent AGI AI AI Agent AIGC AI商业化 AI大模型 AI安全 AI工具 AI搜索 AI智能体 AI生成内容 AI监管 AI绘画 AI编程 AI编程工具 AI编程智能体 AI芯片 AI视频 AI视频生成 AI设计 Anthropic chatgpt Claude Claude Code Claude Mythos Claude Opus 4.8 DeepSeek DuckDuckGo Gemini GPT-5.5 MCP协议 meta Midjourney MiniMax MoE MoE架构 NVIDIA openai OpenRouter Pika prompt SpaceX stable diffusion SWE-Bench xAI 世界模型 丛林 人工智能 人物 企业级AI 具身智能 命令行工具 图像生成模型 多模态 多模态大模型 大模型 大模型API 大模型应用 大语言模型 字节跳动 家居 小米 展台 建筑 开源 开源大模型 开源工具 开源框架 开源模型 强化学习 微软 教程 早报 智能体 智能体编程 智谱AI 月之暗面 本地AI 海报设计 生成式AI 科大讯飞 科幻 端侧AI 端侧大模型 网络安全 联想 腾讯混元 英伟达 苹果 视频生成模型 语音合成 谷歌 谷歌AI 赛博朋克 长上下文 阶跃星辰 阿里通义 阿里通义千问 风景
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.