Goku – 港大和字节联合推出的最新视频生成模型

Goku是什么

Goku是香港大学和字节跳动联合发布的最新视频生成模型，专为图像和视频的联合生成设计。基于先进的rectified flow Transformer框架，支持文生视频、图生视频及文生图等多种模式。Goku的核心优势包括高质量的视频生成能力、极低的广告视频制作成本（比传统方法低100倍）。Goku基于大规模高质量的数据集和高效的训练设施。研究人员构建了包含约3600万视频和1.6亿图像的数据集，采用多模态大语言模型生成语境一致的框架。Goku采用了先进的并行策略和容错机制，确保训练过程的高效性和稳定性。

阅读目录

Goku是什么
Goku的主要功能
Goku的技术原理
Goku的项目地址
Goku的应用场景

Goku+是基于Goku模型推出的扩展版本，专注于广告视频创作，能快速生成高质量的广告视频，支持20秒以上的视频生成，具备稳定的手部动作和丰富的面部及身体表情。Goku+可将产品图片转化为吸引人的视频，支持虚拟数字人与产品互动，增强广告吸引力。适用于电商、品牌宣传、短视频广告和产品展示等多种场景，能显著降低广告制作成本，提升创作效率。

Goku

Goku的主要功能

文本到图像（Text-to-Image）：根据文本描述生成高质量图像，能生成细节丰富且与文本描述高度一致的图像。
文本到视频（Text-to-Video）：根据文本描述生成连贯的视频，生成的视频具有流畅的动作和高质量的画面。
图像到视频（Image-to-Video）：以图像为基础生成视频，保持图像的视觉风格和语义一致性，能从静态图像生成动态视频，适用于动画和视频内容创作。
广告视频生成（Goku+）：生成高质量的广告视频，支持人物与产品的自然互动。可以将广告视频的制作成本降低100倍，生成的视频具有稳定的手部动作和丰富的面部表情。
虚拟数字人视频生成：生成虚拟数字人的视频，具有高度的逼真感和自然的动作，适用于虚拟主播、虚拟客服等场景。
多模态生成：支持多种模态的生成任务，包括图像、视频和文本的联合生成。通过共享潜在空间和全注意力机制，Goku能无缝处理图像和视频的复杂时空依赖关系。

Goku的技术原理

图像-视频联合VAE：Goku采用3D联合图像-视频变分自编码器（VAE），将图像和视频输入压缩到共享的潜在空间。使模型能处理多种媒体格式，包括图像和视频，在统一框架内进行表示。
Transformer架构：Goku模型家族包含2B和8B参数的Transformer架构。架构基于全注意力机制，能有效处理图像和视频的复杂时空依赖关系，实现高质量、连贯的输出。
校正流公式：基于Rectified Flow（RF）算法，Goku通过线性插值在先验分布和目标数据分布之间进行训练。相比传统的扩散模型，展现出更快的收敛速度和更强的理论性质。
多阶段训练策略：Goku采用多阶段训练策略，包括图文语义对齐预训练、图像-视频联合训练，以及针对不同模态的微调。逐步提升模型的生成能力，确保在大规模数据集上的高效训练。
大规模高质量数据集：研究人员构建了约3600万视频和1.6亿图像的大规模数据集，采用多种数据过滤和增强技术来提高数据质量。数据集为模型训练提供了丰富的素材。
高效的训练基础设施：Goku的训练基础设施包括并行策略、细粒度激活检查点技术、容错机制以及ByteCheckpoint技术。显著提升了训练效率和稳定性。

Goku的项目地址

项目官网：https://saiyan-world.github.io/goku/
Github仓库：https://github.com/Saiyan-World/goku
HuggingFace模型库：https://huggingface.co/datasets/saiyan-world/Goku
arXiv技术论文：https://arxiv.org/pdf/2502.04896

Goku的应用场景

广告视频制作：Goku+能根据文本描述生成高质量的广告视频，支持从文本直接生成视频、从产品图片生成人物互动视频，以及生成产品展示视频。
虚拟数字人视频生成：Goku+可以将文本转换为超现实的人类视频，生成超过20秒的视频，具有稳定的手部动作和极具表现力的面部及身体动作。
内容创作：Goku能生成包括动画、自然风光、动物行为等多种场景的视频。可以生成一位时尚女性在东京街头漫步的视频，或者数只巨型猛犸象在雪地上行走的场景。为艺术创作者提供了丰富的灵感和创作素材。
教育与培训：Goku可以用于制作教育视频和培训课程，通过生成生动的视频内容，提高教育培训的效果和趣味性。
娱乐产业：在电影、电视剧、动画等娱乐产业中，Goku可用于内容制作和特效生成。能生成高质量的视频内容，为创作者提供更多可能性。

Goku – 港大和字节联合推出的最新视频生成模型

Goku是什么

Goku的主要功能

Goku的技术原理

Goku的项目地址

Goku的应用场景

发表评价取消回复

最近更新

MiniCPM-V – 面壁智能推出的开源多模态大模型

VideoDoodles – Adobe推出的AI视频编辑框架

CharacterFactory – 大连理工推出的AI角色创作工具

UniBench – Meta推出的视觉语言模型(VLM)评估框架

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

Support

Goku是什么

Goku的主要功能

Goku的技术原理

Goku的项目地址

Goku的应用场景

发表评价 取消回复

最近更新

相关推荐

发表评价取消回复