Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: MuScriptor – Kyutai 联合 Mirelo 开源的多乐器音乐转录模型
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AIGC 资讯 > MuScriptor – Kyutai 联合 Mirelo 开源的多乐器音乐转录模型
AIGC 资讯

MuScriptor – Kyutai 联合 Mirelo 开源的多乐器音乐转录模型

站外新闻
最近更新: 2026年7月20日 上午1:33
SHARE

MuScriptor是什么

MuScriptor 是 Kyutai 与 Mirelo 联合推出的开源多乐器音乐转录模型,可将真实世界多种流派的音乐音频自动转录为 MIDI。MuScriptor是首个在涵盖 17 万首歌曲的大规模真实数据集上训练的同类模型,采用纯解码器 Transformer 架构,提供 60M 至 1.4B 四种参数规模,支持乐器条件控制,代码以 MIT 协议开源。

阅读目录
  • MuScriptor是什么
  • MuScriptor的主要功能
  • MuScriptor的技术原理
  • 如何使用MuScriptor
  • MuScriptor的核心优势
  • MuScriptor的项目地址
  • MuScriptor的同类竞品对比
  • MuScriptor的应用场景

MuScriptor

MuScriptor的主要功能

  • 多乐器音频转录:将包含多种乐器的真实世界音乐音频自动转换为标准 MIDI 格式,支持钢琴、吉他、鼓、贝斯等 36 类乐器。
  • 多流派音乐支持:覆盖流行、古典、摇滚、重金属等多种音乐流派,适配复杂的真实混音场景。
  • 乐器条件控制:支持用户指定需要转录的目标乐器集合,实现定制化输出并稳定跨片段的乐器识别一致性。
  • 多规格模型选择:提供 60M、103M、307M 及 1.4B 四种参数规模,兼顾轻量部署与高精度需求。
  • 端到端自动处理:用5 秒音频切片为单位输入,模型自动完成分帧、特征提取、音符检测与 MIDI 生成全流程。

MuScriptor的技术原理

  • 纯解码器 Transformer 架构:模型用 5 秒音频切片为输入,将 16kHz 单声道音频转换为 mel-spectrogram,通过自回归方式预测 MIDI-like token 序列,实现端到端的多乐器转录。
  • 三阶段训练策略:模型首先在 150 万合成 MIDI 数据上进行预训练,随后在 17 万首真实音乐上微调,最后用 300 首高质量标注数据通过 GRPO 风格的强化学习进行后训练,对齐高质量输出。
  • 乐器条件控制:模型支持通过前缀嵌入指定目标乐器集合,用户可自定义需要转录的乐器种类,同时用 classifier-free guidance 稳定跨片段的乐器分配一致性。
  • 数据合成与增强管线:预训练阶段采用动态合成流程,对 MIDI 进行音高偏移、速度变化、乐器随机化等符号级增强,用 250 多种 soundfont 合成音频,加入随机失谐提升泛化能力。

挖挖GitHub微信关注回复“开源”,加入AI开源项目交流群

如何使用MuScriptor

  • 环境准备:克隆 GitHub 仓库并安装依赖,确保系统支持 Python 及 PyTorch 等深度学习框架。
  • 下载权重:从官方渠道获取对应参数规模(103M、307M 或 1.4B)的模型权重文件。
  • 加载模型:用提供的推理代码初始化模型,可选择是否启用乐器条件控制。
  • 输入音频:将待转录的音频文件(支持多种格式)输入模型,模型自动切分为 5 秒片段进行处理。
  • 获取 MIDI:模型输出标准 MIDI 文件,可直接导入 DAW 或乐谱软件进行后续编辑。

MuScriptor的核心优势

  • 真实世界泛化能力最强:相比依赖合成数据训练的模型(如 MT3),MuScriptor 在 17 万首真实多乐器音乐上训练,在复杂真实混音场景下错误率显著降低,官方称其为迄今最佳开源多乐器转录模型。
  • 强化学习对齐高质量输出:通过后训练阶段的 GRPO 风格强化学习,模型在音符 onset、offset 和 frame 级别的 F1 分数均获得进一步提升,减少漏检和误检。
  • 灵活的乐器条件控制:用户可指定需要转录的乐器种类,能精简输出,也能跨音频片段保持乐器识别的一致性,避免片段间乐器分配波动。
  • 多规格开源:提供从 60M 到 1.4B 的四种模型规模,兼顾边缘设备部署与高精度需求,代码 MIT 开源,权重 CC BY-NC 4.0 可获取。

MuScriptor的项目地址

  • GitHub仓库:https://github.com/muscriptor/muscriptor
  • HuggingFace模型库:https://huggingface.co/MuScriptor
  • arXiv技术论文:https://arxiv.org/pdf/2607.08168v1

MuScriptor的同类竞品对比

对比维度 MuScriptor YourMT3+
发布方 Kyutai / Mirelo 学术研究团队
架构 纯解码器 Transformer 分层注意力 Transformer + MoE
训练数据 150万合成 MIDI + 17万真实音乐 + 300首 RL 数据 小规模合成数据 + 有限真实数据
核心策略 真实数据微调 + 强化学习后训练 架构改进 + 跨数据集增强
乐器控制 支持显式乐器条件控制 不支持
开源协议 代码 MIT / 权重 CC BY-NC 4.0 部分开源
真实音频表现 Multi F1 约 41.6,显著领先 作为 baseline 被超越
力度信息 分词器暂不支持 视具体实现而定

MuScriptor的应用场景

  • 音乐制作辅助:制作人可将无 MIDI 的现有音频快速转换为可编辑的 MIDI 轨道,用于重新编曲、混音或采样。
  • 乐谱自动生成:音乐教育机构和出版方可将录音自动转换为乐谱,降低人工扒谱成本。
  • 音乐信息检索:为和弦识别、调性分析、风格分类等下游任务提供高质量的符号化输入。
  • 生成式音乐建模:为音乐生成模型提供大规模、高质量的 MIDI 训练数据,推动符号音乐生成研究。
  • 音乐考古与存档:将历史录音、现场演出等非结构化音频转化为结构化 MIDI 数据,便于数字化保存与分析。
Top five Romantic Vacation Destinations
Genmoai-smol – 对单GPU设备优化的开源AI视频生成模型
Speech-02 – MiniMax 推出的新一代文本转语音模型
英伟达开源Polar框架发布:Codex性能暴涨近600%,GRPO训练法引爆智能体革命
字节跳动重磅开源MineContext:主动式AI上下文感知工具,5秒屏幕挖掘重塑数字生产力
分享
Email 复制链接 打印
Share
上一篇 Diffree – OpenGVLab推出的AI贴图框架
下一篇 MindSearch – 上海人工智能实验室推出的AI搜索框架
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

Ming‑Flash‑Omni 2.0 – 蚂蚁开源的全模态大模型
AIGC 资讯
全息流体渐变通用占位特色图
Gartner最新预测:全球AI模型与平台市场高速增长, 2026 年规模将达 640 亿美元
AIGC 资讯
全息流体渐变通用占位特色图
千问甩出语音合成大模型Qwen-Audio-3.0-TTS:自然语言直接指挥,实时版首包延迟压进 300 毫秒
AIGC 资讯
全息流体渐变通用占位特色图
算力飙升 10 倍!谷歌秘密研发Frozen芯片,Gemini大模型硬核升级
AIGC 资讯

相关推荐

AI 工具AIGC 资讯

Lynx:字节跳动重磅开源模型,一张照片即刻生成身份一致的个性化视频,全面解析与商用指南

站外新闻
AIGC Lynx 个性化视频生成 字节跳动 数字人
AI 工具AIGC 资讯

谷歌重磅开源!Computer Use Preview:用自然语言指挥AI操控浏览器,零代码实现网页自动化

站外新闻
AI工具 Computer Use Gemini 开源 浏览器自动化
AIGC 资讯

MSQA – 大规模多模态3D情境推理数据集

站外新闻
AI 工具AIGC 资讯

OpenAI GPT‑5.3 Instant 全面解析:免费、更低幻觉、更自然的轻量级AI对话模型

站外新闻
AI对话模型 GPT-5.3 Instant openai 幻觉率降低 轻量级大模型
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

AIGC Midjourney prompt AI Agent openai 多模态大模型 AI绘画 字节跳动 开源模型 开源工具 早报 具身智能 大语言模型 MoE架构 开源大模型 强化学习 阿里通义 Anthropic 腾讯混元 多模态AI 大模型 开源框架 AI智能体 教程 chatgpt AI工具 扩散模型 AI视频生成 蚂蚁集团 开源
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.