Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: Freestyler – 西工大联合微软和香港大学推出的说唱乐生成模型
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AIGC 资讯 > Freestyler – 西工大联合微软和香港大学推出的说唱乐生成模型
AIGC 资讯

Freestyler – 西工大联合微软和香港大学推出的说唱乐生成模型

站外新闻
最近更新: 2026年7月10日 上午4:18
SHARE

Freestyler是什么

Freestyler是西北工业大学计算机科学学院音频、语音与语言处理小组(ASLP@NPU)、微软及香港中文大学深圳研究院大数据研究所共同推出的说唱乐生成模型,能直接根据歌词和伴奏创作出说唱音乐。Freestyler基于语言模型生成语义标记,再基于条件流匹配模型产生频谱图,最后用神经声码器转换成音频。Freestyler推出RapBank数据集,支持训练和模型开发,能实现零样本的音色控制,让用户生成具有特定音色的说唱声乐。

阅读目录
  • Freestyler是什么
  • Freestyler的主要功能
  • Freestyler的技术原理
  • Freestyler的项目地址
  • Freestyler的应用场景

Freestyler

Freestyler的主要功能

  • 说唱声乐生成:直接从歌词和伴奏输入生成说唱声乐,无需用户具备音乐知识。
  • 零样本音色控制:基于3秒的参考音频,Freestyler能适应任何说话者的音色,实现零样本的音色控制。
  • 数据集创建:为解决说唱数据的稀缺问题,团队创建RapBank数据集,并提供数据处理流程。
  • 风格和节奏对齐:生成的说唱声音与伴奏的风格和节奏高度对齐,包含在风格上和节奏上。
  • 高质量音频输出:基于先进的声码器技术,生成自然且高质量的说唱音频。

Freestyler的技术原理

  • 歌词到语义(Lyrics-to-Semantic):
    • 用语言模型(如LLaMA)预测基于歌词和伴奏特征的离散语义标记。
    • 基于Wav2Vec XLS-R等自监督学习(SSL)模型提取特征,用K-means聚类得到语义标记。
  • 语义到频谱图(Semantic-to-Spectrogram):
    • 应用条件流匹配(CFM)技术将离散语义标记转换为连续的mel频谱图。
    • 参考音频被纳入CFM模型,补充语义标记中缺失的音色信息。
  • 频谱图到音频(Spectrogram-to-Audio):
    • 用预训练的声码器(如BigVGAN-V2)从频谱图中重建音频。
    • 声码器能处理多种类型的音频数据,包括不同语言的语音、歌唱和环境声音。
  • 数据集和处理流程:
    • RapBank数据集包含从互联网收集的大量说唱歌曲,经过自动爬取、源分离、分割、歌词识别和质量过滤等步骤处理。
    • 数据集处理包括音乐源分离、语音活动检测(VAD)分割、自动语音识别(ASR)歌词识别和质量相关指标计算。
  • 零样本控制:参考编码器从参考音频中提取全局说话者嵌入,用在控制生成声音的音色。

Freestyler的项目地址

  • GitHub仓库:https://github.com/NZqian/RapBank
  • arXiv技术论文:https://arxiv.org/pdf/2408.15474

Freestyler的应用场景

  • 音乐创作:为音乐制作人和作曲家提供灵感,快速生成说唱歌词和声乐,创作新的音乐作品。
  • 现场表演:在音乐会或DJ表演中,实时生成伴随音乐的说唱声乐,为现场观众提供动态的音乐体验。
  • 游戏音效:在视频游戏中,生成角色的说唱音效,增强游戏的沉浸感和互动性。
  • 教育与培训:在音乐教育中,帮助学生学习说唱技巧和音乐创作,用生成示范音频提高学习效果。
  • 社交媒体内容创作:内容创作者生成独特的说唱音频,丰富其社交媒体平台上的视频或音频内容,吸引更多观众。
3DIS-FLUX – 浙大联合哈佛推出的多实例生成框架
英伟达联手韩国Naver豪掷 10 亿美元,打造 200 兆瓦AI算力工厂
苹果WWDC2026前瞻:库克卸任前谢幕秀,Siri将引入Google Gemini全面重构
Qwen2 – 阿里云开源的新一代通义千问大模型
VideoChat-Flash – 上海 AI Lab 等机构推出针对长视频建模的多模态大模型
分享
Email 复制链接 打印
Share
上一篇 StarCoder 2 – BigCode推出的第二代开源代码大模型
下一篇 Animate Anyone – 阿里推出的图像到视频角色动画合成的框架
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

全息流体渐变通用占位特色图
扎克伯格断言:五年内数十亿人将拥有专属AI助手,Meta砸重金豪赌未来
AIGC 资讯
全息流体渐变通用占位特色图
字节跳动重组AI业务版图:大模型ARR达 40 亿美元,协同办公与核心大模型深度融合
AIGC 资讯
Faceless Anime Neon City Night
AI 生图 Prompt
Anime Character Sheet
AI 生图 Prompt

相关推荐

AIGC 资讯

AgiBot World – 智元机器人开源的百万真机数据集

站外新闻
AIGC 资讯

Cooragent – 清华 LeapLab 开源的 AI Agent 协作框架

站外新闻
AIGC 资讯

SimpleAR – 复旦大学联合字节 Seed 团队推出的图像生成模型

站外新闻
AI 工具AIGC 资讯

LG EXAONE 4.0混合推理大模型发布:32B专业版+1.2B端侧版,数学编程能力登顶MMLU-Pro

站外新闻
AI Agent LG EXAONE 4.0 MCP接口 混合推理大模型 端侧大模型
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

AIGC Midjourney prompt GPT Image 2 AI Agent 多模态大模型 EvoLink灵感 AI绘画 字节跳动 写实人像 开源工具 开源模型 早报 具身智能 openai 大语言模型 开源大模型 阿里通义 强化学习 时尚大片 杂志排版 产品设计 商业海报 皮克斯风格 3D动画 色彩分析 AI生图 腾讯混元 MoE架构 多模态AI
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.