Agogic:0.8B的音乐模型打败了27B——因为换了一种记谱法

# Agogic:0.8B 的音乐模型打败了 27B——因为换了一种记谱法 一个 0.8B 参数的小模型,在音...

Agogic:0.8B 的音乐模型打败了 27B——因为换了一种记谱法

一个 0.8B 参数的小模型,在音乐生成质量上打败了同一个家族的 27B 大模型。

不是靠更多数据、不是靠更长训练、不是靠更巧的架构。只是换了一种把音乐编码成 token 的方式。

这是 Agogic 论文的核心发现,它直接挑战了当前 AI 圈最大的信仰之一:大就是好

一个被跳过的变量

文本转音乐(text-to-music)的模型流水线很长:选骨干模型、准备数据、设计训练配方、选解码策略——最后还有一步,把音乐变成 token。最后这一步通常是个默认选择,没人认真测过它的影响。

Agogic 的做法很简单:把其他所有变量钉死,只换 tokenization。

– 骨干模型:Qwen3.5,从 0.8B 到 27B – 数据:同一套 – 训练预算:相同 – 解码:相同 – 唯一变量:音乐被编码成 token 的方式

他们测了七种 tokenization,结果干净得让人意外。

表示,不是模型大小,才是瓶颈

核心数字:

PMT(论文发布的新表示,10ms 精度计时、逐音符力度、多轨道纹理,609 个符号):0.8B 模型 FMD = 159节拍网格(REMI 及其后代,当前主流):0.8B 模型 FMD = 272-286

FMD(Fréchet Music Distance)越低越好。PMT 比节拍网格低 1.7-1.8 倍,在某些协议下低 2.8 倍。

翻译成人话:一个 0.8B 的小模型,用 PMT 表示,打败了同一个家族 27B 的模型用节拍网格表示。

把骨干模型从 0.8B 放大到 27B(34 倍),FMD 几乎不动。但换一种 tokenization,FMD 直接砍半。

论文的原话是:”表示,不是模型大小,才是分布保真度的瓶颈变量。

为什么节拍网格输了

当前主流的音乐 tokenization 分两派,各有妥协:

节拍网格派(REMI 及其后代):把每个音符的起始时间对齐到节拍格点上。好处是结构稳定,坏处是量化丢掉了微时序(micro-timing)和逐音符的力度变化——而恰恰是这些东西区分了”演奏”和”机械谱”。

文本-ABC 派:用文本格式的乐谱(如 ABC notation),信息更完整但和 LLM 的自然语言预训练对齐差。

PMT 走了第三条路:演奏分辨率(performance-resolution)。10 毫秒精度的计时、逐音符的力度、多轨道纹理。它不记录”谱子长什么样”,它记录”这场演奏具体是怎么弹的”。

这个区分很关键:同一首曲子,不同演奏家的演绎差别巨大。节拍网格丢掉了这些差别,PMT 保留了它们。

不是运气,是类别效应

为了排除”只是 PMT 这个词表运气好”的可能,论文做了三个验证:

1. 换一个更小的骨干模型。 用一个 26M 参数的从零训练的模型,PMT 依然领先。效应不是大模型专有的。

2. 换一个不同的演奏分辨率 tokenizer。 效应依然存在。所以这不是 PMT 独有的优势,是”演奏分辨率”这一类表示的优势。

3. 不是更细格点的副作用。 把 PMT 生成的起始时间对齐到节拍网格的分辨率,PMT 仍然领先 67-129 FMD。不是”分辨率更高所以更好”,是表示方式本身更好。

一个让人不安的副产物:印记效应

论文还发现了一个让人不安的现象,叫”印记诊断”(imprinting diagnostic):

> 已发表的文本转 MIDI 系统,在两个完全不相关的领域上,生成的和弦-时间分布几乎不变——72% vs 71%。

翻译成人话:你给它什么提示词,它基本不在乎,它生成的是自己训练分布里的东西。

这和当前文本转音乐系统”看起来能听提示词”的表象形成了尖锐矛盾。模型看起来在听,实际上在复读自己见过的东西。这个发现和 WorldCup Arena 里”模型其实在做同一件事”的结论遥相呼应——当前 LLM 的”理解”可能比我们以为的要浅。

一个轻量补丁

好消息是,论文发现了一个轻量的补丁:解码时约束(decode-time constraint)。

不加这个约束,乐器 F1 = 0.28,正确调性 = 0.16。加上之后,乐器 F1 = 0.60(翻倍多),正确调性 = 0.35(翻倍多)。而且不损失分布质量。

这意味着”听提示词”和”分布保真”是可分离的两个问题——你可以单独修一个,不碰另一个。

这意味着什么

Agogic 的结论是一个跨领域通用的工程原则:在砸钱放大模型之前,先检查你卡在了哪个变量上。

当前 AI 圈最大的信仰是”scale is all you need”——只要模型够大、数据够多,一切问题都能解决。Agogic 给出了一个反例:在音乐生成这个任务上,瓶颈不在模型大小,在表示方式。放大模型 34 倍几乎没用,换一种表示直接砍半误差。

这个教训适用于任何”有多个变量的系统”:先做受控消融,找到瓶颈变量,再决定砸钱方向。盲目放大模型,可能只是在最贵的那个变量上做无用功。

论文还发布了完整的测试框架、25+ 个检查点、两个语料库(86.6k 对齐的 caption/MIDI/ABC/audio,和 6.25M captioned——音乐领域最大的标注语料)。这意味着以后任何新的音乐表示方案都可以被”测量,而非声称”。

这可能是这篇论文最大的贡献:它把”表示选择”从一个信仰问题变成了一个可测量的问题。

论文链接: https://arxiv.org/abs/2608.03999

代码与数据: 论文声明发布测试框架、25+ 检查点、两个语料库

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1