Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: Wan-Dancer – 阿里通义开源的人像舞蹈视频生成模型
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AIGC 资讯 > Wan-Dancer – 阿里通义开源的人像舞蹈视频生成模型
AIGC 资讯

Wan-Dancer – 阿里通义开源的人像舞蹈视频生成模型

站外新闻
最近更新: 2026年7月14日 下午7:12
SHARE

Wan-Dancer是什么

Wan-Dancer 是阿里通义万相开源的音乐驱动人像舞蹈视频生成模型。输入一张人物照片与一段音乐,可生成节奏精准、动作流畅、风格鲜明的高质量舞蹈视频。模型首次突破分钟级时序瓶颈,支持 15 秒至 3 分钟的 720p/30fps 超长连贯输出,覆盖中国古典舞、韩舞、街舞、踢踏舞、拉丁舞五种舞种,支持通过 LoRA 进行个性化舞蹈定制。

阅读目录
  • Wan-Dancer是什么
  • Wan-Dancer的主要功能
  • Wan-Dancer的技术原理
  • 如何使用Wan-Dancer
  • Wan-Dancer的核心优势
  • Wan-Dancer的项目地址
  • Wan-Dancer的同类竞品对比
  • Wan-Dancer的应用场景

Wan-Dancer

Wan-Dancer的主要功能

  • 音乐驱动舞蹈生成:输入人物照片与音乐,自动生成与节拍精准对齐的舞蹈视频。
  • 分钟级长视频生成:突破传统 20 秒限制,稳定生成 15 秒至 3 分钟的连贯高清视频。
  • 多风格舞蹈覆盖:支持中国古典舞、K-Pop、街舞、踢踏舞、拉丁舞五种差异显著的风格。
  • LoRA 个性化定制:仅需少量特定舞蹈数据即可训练专属动作风格,实现同款舞蹈复刻。
  • 关键帧二次编辑:全局阶段生成的关键帧支持手动修改,实现换装与动作精细控制。

Wan-Dancer的技术原理

  • 全局关键帧规划(Global DiT):基于完整音乐结构生成长时一致性关键帧,规划舞蹈动作骨架与关键姿态,确保全局时间尺度连贯。
  • 局部时序细化(Local DiT):在全局关键帧基础上细化动作细节与帧间过渡,解决动作单一重复问题,提升复杂动作表现力。
  • 动态帧率适配:引入 RoPE 映射绝对时间信息,实现不同时长音乐与舞蹈动作的精确时序对齐,消除长序列漂移。
  • 光流运动连续性:基于光流的损失函数优化帧间过渡,在快速旋转、复杂步法场景中保持自然连贯。

挖挖GitHub

微信关注回复“开源”,加入AI开源项目交流群

如何使用Wan-Dancer

  • 在线体验:访问魔搭创空间https://www.modelscope.cn/studios/Wan-AI/Wan-Dancer,上传 9:16 竖屏单人正面照片与 10–30 秒音乐,选择舞种后点击生成。
  • 本地部署:克隆 GitHub 仓库,安装依赖环境,通过 ModelScope 下载 14B 权重,分别运行全局关键帧推理与局部时序细化脚本。
  • Diffsynth-Studio 推理:安装 DiffSynth-Studio 后,调用 WanVideoPipeline 加载全局/局部模型配置,设置参考图、音乐路径、关键帧掩码等参数进行生成。

Wan-Dancer的核心优势

  • 分层解耦架构:全局 DiT 规划长时一致性关键帧,局部 DiT 细化动作细节与帧间过渡,解决时序漂移与动作重复问题。
  • 动态帧率适配:引入 RoPE 映射绝对时间信息,确保不同时长音乐与舞蹈动作精确同步。
  • 运动连续性增强:基于光流的损失函数优化,在快速旋转、复杂步法等场景中保持自然连贯。
  • 身份高保真:参考图人物身份特征在长序列中保持稳定,避免角色畸变。

Wan-Dancer的项目地址

  • 项目官网:https://humanaigc.github.io/wan-dancer-project/
  • GitHub仓库:https://github.com/Wan-Video/Wan-Dancer
  • HuggingFace模型库:https://huggingface.co/Wan-AI/Wan-Dancer-14B
  • arXiv技术论文:https://arxiv.org/pdf/2607.09581

Wan-Dancer的同类竞品对比

对比维度 Wan-Dancer MuseDance
研发机构 阿里通义万相 石溪大学 + 字节跳动 + 苹果
核心架构 分层解耦双 DiT(全局关键帧规划 + 局部时序细化) 端到端 U-Net 扩散,基于 Stable Diffusion v1.5
训练策略 全局与局部模型分别训练、分别推理 两阶段训练:第一阶段外观预训练,第二阶段冻结空间注意力并注入音乐/节拍/运动模块
音乐理解 专用 Music Encoder + RoPE 时间映射 AST(Audio Spectrogram Transformer)提取音乐嵌入,通过交叉注意力注入
节拍对齐 RoPE 动态帧率适配,将绝对时间映射到生成过程 Librosa 提取节拍位置,one-hot 编码后通过交叉注意力显式对齐
运动控制 光流损失优化帧间过渡 + Prompt 速度标注 运动对齐模块:利用历史生成帧的隐状态做时序自注意力
身份保持 参考图像经 VAE 编码 + 全局关键帧锚定约束 第一阶段学习外观 + 冻结空间注意力 + ReferenceNet 特征融合
生成时长 分钟级(15 秒–3 分钟) 短视频片段(实验设置 4 秒 @ 12fps)
分辨率/帧率 720p / 30fps 640×640 / 12fps(实验配置)

Wan-Dancer的应用场景

  • 短视频内容创作:为抖音、快手、小红书等平台快速生成个性化舞蹈视频,无需真人出镜即可实现风格多样的舞蹈内容量产。
  • 虚拟偶像与数字人表演:为直播、虚拟演唱会及数字人账号定制特定舞种的连贯表演素材,降低虚拟角色舞蹈动作的制作成本。
  • 舞蹈教学与编舞辅助:借助音乐节拍对齐与关键帧预览功能,辅助舞蹈教师拆解动作节奏、设计编舞方案,并生成标准化教学演示视频。
  • 广告与影视预演:低成本生成分镜级别的舞蹈镜头预览,帮助导演与创意团队在拍摄前快速验证舞蹈编排与视觉风格,加速决策流程。
Cartesia Sonic-3 实时语音模型深度解析:延迟低于100ms,支持42种语言,如何引领语音交互新革命?
商汤Seko AI重磅升级:发布Seko Space,以‘创编一体’技术重塑漫短剧工业化生产链路
Sa2VA – 字节跳动等机构开源的多模态大语言模型
V-JEPA:Meta推出的视觉模型,可以通过观看视频来学习理解物理世界
DemoFusion – 免费开源的图像分辨率超清增强框架
分享
Email 复制链接 打印
Share
上一篇 AnySearch – 专为 AI Agent 推出的实时结构化搜索引擎
下一篇 StepAmoo – 阶跃星辰推出的新一代个人智能体
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

FeyNoBg – Feyn Labs 开源的自动背景去除模型
AIGC 资讯
Qwen-Audio-3.0-ASR-Flash – 阿里千问推出的语音识别大模型
AIGC 资讯
全息流体渐变通用占位特色图
微软云端隐忧:千亿营收背后的增速换挡与杠杆风险
AIGC 资讯
全息流体渐变通用占位特色图
微信公众号推出 AI”一键排版”:自动分段、生成小标题、匹配配图三步到位
AIGC 资讯

相关推荐

AIGC 资讯

T2A-01-HD – 海螺AI海外版推出新的语音模型

站外新闻
AIGC 资讯

抖音电商将豆包纳入抖店结算序列,GEO全面进入成交归因时代

站外新闻
AIGC 资讯

HoloPart – 港大联合 VAST 开源生成完整可编辑部件的 3D 模型

站外新闻
AIGC 资讯

清华×腾讯混元夺MLSys2026 MoE推理挑战赛冠军,NPU推理提速4.1倍突破万亿参数瓶颈

站外新闻
MLSys2026 MoE模型 NPU推理 清华大学 腾讯混元
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

AIGC Midjourney prompt AI Agent GPT Image 2 多模态大模型 EvoLink灵感 AI绘画 字节跳动 开源工具 开源模型 早报 具身智能 openai 大语言模型 开源大模型 阿里通义 强化学习 腾讯混元 Anthropic MoE架构 多模态AI 开源框架 AI智能体 教程 AI工具 扩散模型 AI视频生成 chatgpt 大模型
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.