Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: VideoMaker – 浙大联合腾讯和华为推出的零样本定制视频生成框架
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AIGC 资讯 > VideoMaker – 浙大联合腾讯和华为推出的零样本定制视频生成框架
AIGC 资讯

VideoMaker – 浙大联合腾讯和华为推出的零样本定制视频生成框架

站外新闻
最近更新: 2026年6月9日 下午5:37
SHARE

VideoMaker是什么

VideoMaker是浙江大学、腾讯和华为诺亚方舟实验室共同开发的创新项目,基于视频扩散模型(VDM)的零样本定制视频生成框架。与传统方法不同,VideoMaker无需额外模型即可直接从参考图片中提取和注入主题特征,实现个性化视频内容的一键生成。框架基于VDM的内在能力进行细粒度特征提取,通过空间自注意力机制实现特征注入,保证了视频生成的多样性和主题一致性。VideoMaker在保持视频多样性的同时,确保了与参考图片中的主题特征高度契合,为个性化视频创作带来了极大的便捷性和灵活性。

阅读目录
  • VideoMaker是什么
  • VideoMaker的主要功能
  • VideoMaker的技术原理
  • VideoMaker的项目地址
  • VideoMaker的应用场景

VideoMaker的主要功能

  • 细粒度特征提取:VideoMaker能够直接利用视频扩散模型(VDM)的内在能力,从提供的参考图片中提取细节丰富的主题特征。
  • 特征注入:通过VDM的空间自注意力机制,VideoMaker能在视频生成过程中将提取的主题特征有效地注入到每一帧视频中,确保视频内容与参考图片保持高度一致性。
  • 视频内容生成:在保持与参考图片中主题外观一致的同时,VideoMaker还能保证生成视频的多样性和动态性,避免内容单调和重复。
  • 无需额外训练:VideoMaker不需要对VDM进行复杂的再训练或参数调整,只需简单微调即可激活模型的内在力量,实现定制视频生成。
  • 高保真度:VideoMaker生成的视频能够保持高保真度,无论是人物还是物体,都能在视频中准确呈现其外观和动态特征。

VideoMaker的技术原理

  • 视频扩散模型(VDM):VDM是VideoMaker的核心,通过逐步去噪的方式学习视频数据分布,生成视频。
  • 特征提取:VideoMaker将参考图像直接输入到VDM中,利用VDM的预训练知识进行细粒度的特征提取,这些特征与VDM的知识体系高度契合。
  • 空间自注意力机制:VideoMaker通过修改VDM中的空间自注意力计算,实现特征注入。这种机制允许模型在生成每一帧视频时,将主题特征与生成内容进行双向交互,确保主题特征的准确呈现。
  • 引导信息识别损失:为了在训练过程中区分参考信息和生成内容,VideoMaker设计了一种损失函数,帮助模型更准确地识别和处理参考信息。
  • 训练与推理范式:在训练阶段,VideoMaker通过微调VDM的空间自注意力层和运动块参数,实现主题信息的有效注入。在推理时,直接丢弃与参考信息对应的输出,确保生成的视频不受噪声干扰。

VideoMaker的项目地址

  • 项目官网:https://wutao-cs.github.io/VideoMaker/
  • arXiv技术论文:https://arxiv.org/pdf/2412.19645

VideoMaker的应用场景

  • 影视制作:在电影或电视剧的前期制作中,VideoMaker可以用于生成特定的场景和动作,帮助导演和制片人预览和规划。
  • 虚拟偶像:为虚拟偶像生成多样化的视频内容,增强其与粉丝的互动和影响力。
  • 产品展示:企业可以利用VideoMaker展示产品在不同环境下的效果,如家具在不同装修风格中的效果,汽车在不同路况下的表现。
  • 定制广告:根据目标客户群体定制个性化的广告视频,提高广告的吸引力和营销效果。
  • 教学视频:教师可以制作生动的教学视频,如物理力学原理的演示、化学实验现象的展示,以及历史事件的重现,提升学习体验。
  • 动画游戏设计:游戏设计师可以通过输入角色草图和动作设计概念图,快速生成初步的角色动画视频,评估角色动作的流畅性和视觉效果。
MiroMind开源MiroThinker v1.5:30B参数级搜索Agent,以交互式扩展技术挑战大模型性能极限
Qwen3.6-Max-Preview深度评测:六大编程基准登顶,Agent编程能力超越Claude 4.5 Opus
英伟达重磅押注:新加坡AI实验室剑指具身智能,重塑制造业未来
Agent Mail – 腾讯QQ邮箱推出的AI Agent专属邮箱服务
15个月营收暴涨三倍!企业级AI搜索独角兽Glean凭’上下文图谱’破局巨头围剿
分享
Email 复制链接 打印
Share
上一篇 CodeElo – 阿里 Qwen 团队推出评估 LLM 编程能力的基准测试
下一篇 EdgeClaw:面壁智能联合清华开源AI智能体框架,首创三层数据安全协议,实现端云协同与本地隐私守护
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

GPT‑5.3‑Codex‑Spark – OpenAI推出的轻量级编程模型
AIGC 资讯
Ming‑Flash‑Omni 2.0 – 蚂蚁开源的全模态大模型
AIGC 资讯
GPT‑5.3 Instant – OpenAI 推出的轻量级对话模型
AIGC 资讯
GPT‑5.3‑Codex‑Spark – OpenAI推出的轻量级编程模型
AIGC 资讯

相关推荐

AIGC 资讯

VidTok – 微软开源的视频分词器,支持连续和离散分词化

站外新闻
AI 工具AIGC 资讯

OpenAI发布GPT-5.3-Codex-Spark:1000+ tokens/s实时编程模型,速度提升80%的开发神器

站外新闻
AI编程助手 Cerebras WSE-3 GPT-5.3-Codex-Spark openai 实时编程
AIGC 资讯

MT-Color – 上海交大联合哔哩哔哩推出的可控图像着色框架

站外新闻
AI 工具AIGC 资讯

智谱AI开源GLM-OCR:0.9B参数登顶SOTA,轻量级多模态OCR模型革新文档解析

站外新闻
GLM-OCR 多模态OCR 文档解析 智谱AI 轻量级模型
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

Agent AI AI Agent AIGC AI大模型 AI安全 AI工具 AI智能体 AI模型 AI绘画 AI编程 AI编程助手 AI编程工具 AI视频生成 AI音乐生成 Anthropic Cerebras WSE-3 chatgpt Claude Claude Code DeepSeek Gemini GPT-5.3 Instant GPT-5.3-Codex-Spark GPT-5.4 MCP协议 meta Midjourney MiniMax Mistral AI MoE架构 openai prompt Qwen3 RAG SWE-Bench xAI 上海人工智能实验室 世界模型 人工智能 人物 代码生成 企业级AI 全模态大模型 具身智能 图像生成 图像生成模型 多智能体 多模态 多模态AI 多模态大模型 多模态模型 大模型 大模型应用 大语言模型 字节跳动 小红书 展台 开源 开源AI 开源AI工具 开源大模型 开源工具 开源框架 开源模型 开源项目 强化学习 微软 扩散模型 推理模型 教程 数字人 文本转语音 早报 昆仑万维 智谱AI 月之暗面 本地部署 清华大学 生成式AI 知识管理 美团 腾讯混元 自然语言处理 英伟达 蚂蚁集团 视觉语言模型 视频生成 视频生成模型 语音合成 谷歌 谷歌AI 谷歌DeepMind 轻量级模型 通义千问 阶跃星辰 阿里巴巴 阿里通义 面壁智能 香港大学
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.