Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: MuScriptor – Kyutai 联合 Mirelo 开源的多乐器音乐转录模型
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AIGC 资讯 > MuScriptor – Kyutai 联合 Mirelo 开源的多乐器音乐转录模型
AIGC 资讯

MuScriptor – Kyutai 联合 Mirelo 开源的多乐器音乐转录模型

站外新闻
最近更新: 2026年7月20日 上午1:33
SHARE

MuScriptor是什么

MuScriptor 是 Kyutai 与 Mirelo 联合推出的开源多乐器音乐转录模型,可将真实世界多种流派的音乐音频自动转录为 MIDI。MuScriptor是首个在涵盖 17 万首歌曲的大规模真实数据集上训练的同类模型,采用纯解码器 Transformer 架构,提供 60M 至 1.4B 四种参数规模,支持乐器条件控制,代码以 MIT 协议开源。

阅读目录
  • MuScriptor是什么
  • MuScriptor的主要功能
  • MuScriptor的技术原理
  • 如何使用MuScriptor
  • MuScriptor的核心优势
  • MuScriptor的项目地址
  • MuScriptor的同类竞品对比
  • MuScriptor的应用场景

MuScriptor

MuScriptor的主要功能

  • 多乐器音频转录:将包含多种乐器的真实世界音乐音频自动转换为标准 MIDI 格式,支持钢琴、吉他、鼓、贝斯等 36 类乐器。
  • 多流派音乐支持:覆盖流行、古典、摇滚、重金属等多种音乐流派,适配复杂的真实混音场景。
  • 乐器条件控制:支持用户指定需要转录的目标乐器集合,实现定制化输出并稳定跨片段的乐器识别一致性。
  • 多规格模型选择:提供 60M、103M、307M 及 1.4B 四种参数规模,兼顾轻量部署与高精度需求。
  • 端到端自动处理:用5 秒音频切片为单位输入,模型自动完成分帧、特征提取、音符检测与 MIDI 生成全流程。

MuScriptor的技术原理

  • 纯解码器 Transformer 架构:模型用 5 秒音频切片为输入,将 16kHz 单声道音频转换为 mel-spectrogram,通过自回归方式预测 MIDI-like token 序列,实现端到端的多乐器转录。
  • 三阶段训练策略:模型首先在 150 万合成 MIDI 数据上进行预训练,随后在 17 万首真实音乐上微调,最后用 300 首高质量标注数据通过 GRPO 风格的强化学习进行后训练,对齐高质量输出。
  • 乐器条件控制:模型支持通过前缀嵌入指定目标乐器集合,用户可自定义需要转录的乐器种类,同时用 classifier-free guidance 稳定跨片段的乐器分配一致性。
  • 数据合成与增强管线:预训练阶段采用动态合成流程,对 MIDI 进行音高偏移、速度变化、乐器随机化等符号级增强,用 250 多种 soundfont 合成音频,加入随机失谐提升泛化能力。

挖挖GitHub微信关注回复“开源”,加入AI开源项目交流群

如何使用MuScriptor

  • 环境准备:克隆 GitHub 仓库并安装依赖,确保系统支持 Python 及 PyTorch 等深度学习框架。
  • 下载权重:从官方渠道获取对应参数规模(103M、307M 或 1.4B)的模型权重文件。
  • 加载模型:用提供的推理代码初始化模型,可选择是否启用乐器条件控制。
  • 输入音频:将待转录的音频文件(支持多种格式)输入模型,模型自动切分为 5 秒片段进行处理。
  • 获取 MIDI:模型输出标准 MIDI 文件,可直接导入 DAW 或乐谱软件进行后续编辑。

MuScriptor的核心优势

  • 真实世界泛化能力最强:相比依赖合成数据训练的模型(如 MT3),MuScriptor 在 17 万首真实多乐器音乐上训练,在复杂真实混音场景下错误率显著降低,官方称其为迄今最佳开源多乐器转录模型。
  • 强化学习对齐高质量输出:通过后训练阶段的 GRPO 风格强化学习,模型在音符 onset、offset 和 frame 级别的 F1 分数均获得进一步提升,减少漏检和误检。
  • 灵活的乐器条件控制:用户可指定需要转录的乐器种类,能精简输出,也能跨音频片段保持乐器识别的一致性,避免片段间乐器分配波动。
  • 多规格开源:提供从 60M 到 1.4B 的四种模型规模,兼顾边缘设备部署与高精度需求,代码 MIT 开源,权重 CC BY-NC 4.0 可获取。

MuScriptor的项目地址

  • GitHub仓库:https://github.com/muscriptor/muscriptor
  • HuggingFace模型库:https://huggingface.co/MuScriptor
  • arXiv技术论文:https://arxiv.org/pdf/2607.08168v1

MuScriptor的同类竞品对比

对比维度 MuScriptor YourMT3+
发布方 Kyutai / Mirelo 学术研究团队
架构 纯解码器 Transformer 分层注意力 Transformer + MoE
训练数据 150万合成 MIDI + 17万真实音乐 + 300首 RL 数据 小规模合成数据 + 有限真实数据
核心策略 真实数据微调 + 强化学习后训练 架构改进 + 跨数据集增强
乐器控制 支持显式乐器条件控制 不支持
开源协议 代码 MIT / 权重 CC BY-NC 4.0 部分开源
真实音频表现 Multi F1 约 41.6,显著领先 作为 baseline 被超越
力度信息 分词器暂不支持 视具体实现而定

MuScriptor的应用场景

  • 音乐制作辅助:制作人可将无 MIDI 的现有音频快速转换为可编辑的 MIDI 轨道,用于重新编曲、混音或采样。
  • 乐谱自动生成:音乐教育机构和出版方可将录音自动转换为乐谱,降低人工扒谱成本。
  • 音乐信息检索:为和弦识别、调性分析、风格分类等下游任务提供高质量的符号化输入。
  • 生成式音乐建模:为音乐生成模型提供大规模、高质量的 MIDI 训练数据,推动符号音乐生成研究。
  • 音乐考古与存档:将历史录音、现场演出等非结构化音频转化为结构化 MIDI 数据,便于数字化保存与分析。
Qwen-Audio-3.0-Realtime – 阿里推出的实时语音交互模型
Agents – AIWaves公司推出的AI Agent开发工具
Mahilo – AI多智能体框架,支持创建与人类互动的多智能体系统
英伟达开源Polar框架发布:Codex性能暴涨近600%,GRPO训练法引爆智能体革命
AI有了“办公神器”:开源OfficeCLI让智能体自主驾驭文档
分享
Email 复制链接 打印
Share
上一篇 Diffree – OpenGVLab推出的AI贴图框架
下一篇 MindSearch – 上海人工智能实验室推出的AI搜索框架
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

FeyNoBg – Feyn Labs 开源的自动背景去除模型
AIGC 资讯
Qwen-Audio-3.0-ASR-Flash – 阿里千问推出的语音识别大模型
AIGC 资讯
全息流体渐变通用占位特色图
微软云端隐忧:千亿营收背后的增速换挡与杠杆风险
AIGC 资讯
全息流体渐变通用占位特色图
微信公众号推出 AI”一键排版”:自动分段、生成小标题、匹配配图三步到位
AIGC 资讯

相关推荐

AIGC 资讯

Omages – 开源的3D模型生成项目

站外新闻
AIGC 资讯

首token延迟砍掉3. 25 倍:小红书联手北大、上交提出HYPIC,给混合注意力大模型装上”位置无关缓存”

站外新闻
AIGC 资讯

Oliva – 开源语音RAG助手,实时语音搜索向量数据库

站外新闻
AIGC 资讯

VidSketch – 浙江大学推出的视频动画生成框架

站外新闻
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

AIGC Midjourney prompt AI Agent GPT Image 2 多模态大模型 EvoLink灵感 AI绘画 字节跳动 开源工具 开源模型 早报 具身智能 openai 大语言模型 开源大模型 阿里通义 强化学习 腾讯混元 Anthropic MoE架构 多模态AI 开源框架 AI智能体 教程 AI工具 扩散模型 AI视频生成 chatgpt 大模型
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.