热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >MuScriptor - Kyutai 联合 Mirelo 开源的多乐器音乐转录模型

MuScriptor - Kyutai 联合 Mirelo 开源的多乐器音乐转录模型

来源:互联网 更新时间:2026-07-20 14:01

MuScriptor是什么

直接说重点:MuScriptor是Kyutai和Mirelo联手搞出来的一个开源多乐器音乐转录模型,它能把你手机里录的、或者网上下载的各种真实音乐音频,自动转换成标准MIDI文件。如果说之前这类模型大多只能在“合成数据”上表现良好,那么MuScriptor的突破就在于——它是在17万首真实歌曲上训练出来的,而且首次实现了端到端的纯解码器Transformer架构。目前提供60M、103M、307M、1.4B四种参数规模,代码是MIT协议开源,支持乐器条件控制,也就是说你可以指定让模型只转录吉他、或者只转录鼓,其他乐器不要。

MuScriptor的主要功能

  • 多乐器音频转录

    :把包含多种乐器的真实音乐音频,自动转成标准MIDI,支持钢琴、吉他、鼓、贝斯等36类乐器。
  • 多流派音乐支持

    :流行、古典、摇滚、重金属……各种风格都能处理,混音场景复杂一点也没问题。
  • 乐器条件控制

    :你可以指定模型只转录哪些乐器,比如只要钢琴和鼓,别的自动忽略,而且在跨片段时乐器识别一致性非常稳定。
  • 多规格模型选择

    :60M、103M、307M、1.4B四种参数规模,你想在边缘设备上跑还是想追求高精度,都有得选。
  • 端到端自动处理

    :输入音频,模型自动切分成5秒的切片,然后一路做分帧、特征提取、音符检测,最后直接输出MIDI,全程不用你操心。

MuScriptor的技术原理

  • 纯解码器Transformer架构

    :整个模型走的是纯解码器Transformer路线,输入是5秒音频切片,16kHz单声道,先转成mel-spectrogram,然后通过自回归方式一步步预测出MIDI-like token序列,端到端搞定多乐器转录。
  • 三阶段训练策略

    :先拿150万首合成MIDI数据做预训练,再用17万首真实音乐做微调,最后用300首高质量标注数据通过GRPO风格的强化学习做后训练,这样出来的输出质量对得起“对齐”这个词。
  • 乐器条件控制

    :通过前缀嵌入来指定目标乐器集合,同时用classifier-free guidance来稳定跨片段的乐器分配,不会出现这个片段说是吉他、下个片段又说是钢琴的尴尬。
  • 数据合成与增强管线

    :预训练阶段用了动态合成流程,对MIDI做音高偏移、速度变化、乐器随机化等符号级增强,用250多种soundfont合成音频,还加入了随机失谐,泛化能力自然就上去了。

如何使用MuScriptor

  • 环境准备

    :先克隆GitHub仓库,装好依赖,确保Python和PyTorch这些深度学习框架就位。
  • 下载权重

    :从官方渠道拿到对应参数规模的模型权重文件,103M、307M或者1.4B,看你需要。
  • 加载模型

    :用官方提供的推理代码初始化模型,想启用乐器条件控制的话,在这里设置就行。
  • 输入音频

    :把你要转录的音频文件丢进去,模型会自动切成5秒的片段来处理。
  • 获取MIDI

    :模型输出标准MIDI文件,可以直接导入DAW或者乐谱软件做后续编辑。

MuScriptor的核心优势

  • 真实世界泛化能力最强

    :相比那些主要靠合成数据训练的模型(比如MT3),MuScriptor在17万首真实多乐器音乐上训练过,在复杂真实混音场景下错误率明显降低,官方自己说这是迄今最好的开源多乐器转录模型,不是没有道理。
  • 强化学习对齐高质量输出

    :通过后训练阶段的GRPO风格强化学习,在音符onset、offset和frame级别的F1分数上都有提升,漏检和误检的情况少了很多。
  • 灵活的乐器条件控制

    :你可以指定要转录哪些乐器,输出更精简,而且在跨音频片段时乐器识别一致性很好,不会出现前后不统一的问题。
  • 多规格开源

    :从60M到1.4B四种模型规模,边缘设备还是高精度需求都能满足,代码MIT开源,权重CC BY-NC 4.0可获取。

MuScriptor的项目地址

  • GitHub仓库

    :https://github.com/muscriptor/muscriptor
  • HuggingFace模型库

    :https://huggingface.co/MuScriptor
  • arXiv技术论文

    :https://arxiv.org/pdf/2607.08168v1

MuScriptor的同类竞品对比

这里拿MuScriptor和YourMT3+做个对比,直观一点:

  • 发布方

    :MuScriptor是Kyutai和Mirelo联合出品,YourMT3+来自学术研究团队。
  • 架构

    :MuScriptor走纯解码器Transformer,YourMT3+用的是分层注意力Transformer加MoE。
  • 训练数据

    :MuScriptor有150万合成MIDI加17万真实音乐再加300首RL数据,YourMT3+是小规模合成数据加有限真实数据。
  • 核心策略

    :MuScriptor靠真实数据微调和强化学习后训练,YourMT3+靠架构改进和跨数据集增强。
  • 乐器控制

    :MuScriptor支持显式乐器条件控制,YourMT3+不支持。
  • 开源协议

    :MuScriptor代码MIT、权重CC BY-NC 4.0,YourMT3+部分开源。
  • 真实音频表现

    :MuScriptor的Multi F1约41.6,显著领先,YourMT3+作为baseline已经被超越。
  • 力度信息

    :MuScriptor分词器暂不支持,YourMT3+视具体实现而定。

MuScriptor的应用场景

  • 音乐制作辅助

    :制作人可以把没有MIDI的现有音频快速转成可编辑的MIDI轨道,用来重新编曲、混音或采样。
  • 乐谱自动生成

    :音乐教育机构和出版方可以把录音自动转成乐谱,省掉大量人工扒谱的成本。
  • 音乐信息检索

    :为和弦识别、调性分析、风格分类这些下游任务提供高质量的符号化输入。
  • 生成式音乐建模

    :为音乐生成模型提供大规模、高质量的MIDI训练数据,推动符号音乐生成研究。
  • 音乐考古与存档

    :把历史录音、现场演出这些非结构化音频转成结构化MIDI数据,便于数字化保存和分析。

热门手游

相关攻略

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc