无词表(Tokenizer-Free)LLM 架构
Byte Latent Transformer(BLT)
不立词表、直餐字节——熵驱动动态补丁化如何革 tokenizer 之命?一份覆盖机制、实测、争议与产业前景的完整研究。
§0摘要(TL;DR)
BLT(Byte Latent Transformer,字节潜在 Transformer)是 Meta FAIR 于 2024 年 12 月提出的无词表大语言模型架构——不依赖分词器与固定词表,直接以 UTF-8 原始字节为输入,通过「熵驱动动态补丁化(entropy-based dynamic patching)」把字节聚合成变长 patch 作为计算单元。核心论断:Patches Scale Better Than Tokens。
首次完成字节级模型 8B 参数 / 4T 训练字节 的 FLOP 受控缩放研究(论文口径,GitHub 载 8T)。
推理 FLOPs 最多可省 ~50%,但未计入熵模型成本——第三方审稿质疑后或接近持平(见 §5)。
噪声 HellaSwag 较同数据 Llama 3 高 8 点,与多训 16 倍数据的 Llama 3.1 持平;CUTE 字符级 +26.6 点。
BLT 出自 Meta FAIR(ACL 2025 Outstanding Paper)。「字节」指 byte,非 ByteDance。字节的 Seed 团队未做 BLT。
目录
§1考据:BLT 之「字节」何指
1.1 论文出处:Meta FAIR,非字节跳动
| 项目 | 内容 |
|---|---|
| 论文 | Byte Latent Transformer: Patches Scale Better Than Tokens · arXiv:2412.09871 |
| 作者 | Artidoro Pagnoni 等 14 人(Meta FAIR + UW + UChicago) |
| 提交 / 荣誉 | 2024-12-13 · ACL 2025 Outstanding Paper |
| 官方代码 | github.com/facebookresearch/blt(2.1k★ · CC-BY-NC-4.0) |
| 权重发布 | facebook/blt-1b · blt-7b · blt-entropy(2025-04-18,门控,FAIR 非商用许可;无 8B checkpoint) |
| 生态接入 | HuggingFace Transformers 2025-09-19 原生支持(BltModel) |
| 训练字节数 | 口径不一arXiv 摘要 4T,GitHub README/模型卡 8T |
1.2 字节跳动与 BLT:查无实据(四重验证)
| 验证途径 | 结果 |
|---|---|
github.com/ByteDance-Seed/BLT | 404 不存在 |
| GitHub org 检索(org:ByteDance-Seed) | 仅 3 仓库,无一与 BLT 相关 |
| HF ByteDance-Seed 组织(59 模型) | 无 BLT;Seed-OSS / Seed-Coder 皆 Qwen2 架构传统词表模型 |
| seed.bytedance.com 站内检索 | 零 BLT 内容 |
ByteDance Seed 的无词表探索实为 Cola DLM(连续潜空间扩散)——与 BLT 的离散字节 patch 路线异路;更反讽的是,字节在词表方向的真实研究走完全相反的路——Over-Tokenized Transformer(ICML 2025)把输入词表扩至 12.8M 条目(过分词化),而非去词表化。
§2核心机制:无词表如何运作
2.1 为什么不要 tokenizer?
| 缺陷 | 具体表现 | 影响 |
|---|---|---|
| 跨语言不公平 | 英语 1 token ≈ 4 字节,中文/日语每词 2-3 token | 语言间「token 税」差异巨大 |
| 固定词表刚性 | OOV、新词、罕见拼写无法处理 | 长尾泛化差 |
| 字符级盲区 | 拼写、回文、字母计数、错别字任务劣势 | 字符级理解近零 |
| 噪声脆弱 | 大小写翻转、字符删改即超出词表分布 | 鲁棒性差 |
| 多模态障碍 | 图像/音频/代码各需专属词表 | 统一建模困难 |
| 压缩偏见 | 词表由训练语料统计决定 | 隐性语种/地域偏见 |
BLT 的回答:全部去掉——直接吃 UTF-8 字节,一切由模型自己学。
2.2 Patchification:按「难度」聚块
核心洞见:并非所有字节都同样难预测。「the 」几乎可确定,乱码/专名则难以预测。BLT 用一个 100M 参数的小型熵模型(patcher)逐字节预测下一字节熵:低熵(可预测)→ 长 patch 省算力;高熵(难预测)→ 短 patch 多给算力。
2.3 三层架构:局部-全局-局部
| 组件 | 职责 | 参数量级 | 特点 |
|---|---|---|---|
| 熵模型 / patcher | 预测字节熵,决定 patch 边界 | ~100M | 独立小模型,推理时逐字节运行 |
| 局部编码器 ε | 字节 → patch 表征 | 轻量(1-2 层) | 交叉注意力池化 + 哈希 n-gram 嵌入 |
| 全局 Transformer G | patch 序列自回归 | 主力(数百 M~数 B) | 块因果注意力 |
| 局部解码器 D | patch 表征 → 字节预测 | 轻量(1-2 层) | 交叉注意力展开回字节级 |
2.4 「无词表」怎么实现?
- 输入侧:文本 → UTF-8 → 每字节映射 260 维 ID(0-255 + 特殊符)——无学习词表;
- 计算侧:字节经局部编码器聚成 patch,全局模型只处理 patch 序列(长度约为字节的 1/4~1/8);
- 输出侧:逐字节自回归生成。
由此「双模型架构」成立:熵模型负责切块,主模型负责生成,二者独立训练(端到端联合训练为论文所列未来工作)。
§3性能实测:与 Llama 3 正面交锋
3.1 主评测矩阵(Table 1 · 8B · 1T tokens · FLOP 匹配)
| 任务 | Llama 3 (BPE) | BLT-Space (6T B) | BLT-Entropy (4.5T B) |
|---|---|---|---|
| Arc-E (0-shot) | 77.6 | 75.4 | 79.6 |
| Arc-C (0-shot) | 53.3 | 49.8 | 52.1 |
| HellaSwag (0-shot) | 79.1 | 79.6 | 80.6 |
| PIQA (0-shot) | 80.7 | 81.1 | 80.6 |
| MMLU (5-shot) | 58.1 | 54.8 | 57.4 |
| MBPP (3-shot) | 40.2 | 37.6 | 41.8 |
| HumanEval (0-shot) | 31.1 | 27.4 | 35.4 |
| 平均 | 60.0 | 58.0 | 61.1 |
| 平均 patch/字节 | 4.4 B/token | 6.1 B | 4.5 B |
BLT-Entropy 在 7 项中 4 项胜出(Arc-E、HellaSwag、MBPP、HumanEval),平均 +1.1 分;代码任务(HumanEval +4.3、MBPP +1.6)优势明显。BLT-Space 平均略低但 patch 更大(6.1 字节)——揭示「patch 大小 ↔ 质量」权衡轴。
3.2 推理效率(含争议)
- 论文声称:固定推理成本下,patch size=8 时推理 FLOPs 较 BPE 基线节省接近 50%;
- 机制:BPE 平均 token ≈ 4.4 字节,BLT 用 8 字节 patch → 推理步数约减半;
- ⚠ 争议Pith Review 指出算式未计入熵模型推理成本(每生成一字节都要跑一次 100M 熵模型)——8B 规模优势缩至持平,~550M 规模或反超为负。见 §5.1。
3.3 鲁棒性:BLT 的主场
| 模型 | HellaSwag 原版 | 噪声平均 | CUTE 字符级 | 音系 G2P |
|---|---|---|---|---|
| Llama 3 (1T tok) | 79.1 | 56.9 | 27.5 | 11.8 |
| Llama 3.1 (16T tok) | 80.7 | 64.3 | 20.0 | 18.9 |
| BLT (1T tok) | 80.6 | 64.3 | 54.1 | 13.0 |
- Noisy HellaSwag:BLT 噪声下较同数据 Llama 3 高 8 点,与多训 16 倍数据的 Llama 3.1 持平——鲁棒性是字节级建模的「白赚」收益;
- CUTE 字符级:BLT 54.1 vs Llama 3 27.5(+26.6),拼写类近完美(Spelling 99.9);
- 音系 G2P:同数据胜出(13.0 vs 11.8),不及 16T 数据的 Llama 3.1(18.9)。
3.4 低资源语言翻译(FLORES-101)
| 方向(21 低资源) | Llama 3 | BLT | 差值 |
|---|---|---|---|
| → English | 12.1 | 14.0 | +2.0 |
| English → | 5.9 | 6.4 | +0.5 |
典型增益:亚美尼亚语 →EN 1.7→6.3;孟加拉语 →EN 4.7→12.7;格鲁吉亚语 →EN 1.7→7.4。常用语言持平或略优。字节建模对长尾/低资源语言泛化显著提升——恰是 tokenizer 税最重的领域。
§4关键数据速查
| 维度 | 数值 | 备注 |
|---|---|---|
| 最大规模实验 | 8B 参数 / 4T~8T 训练字节 | 首次字节级 FLOP 受控缩放(官方口径 4T/8T 不一) |
| 开源权重 | blt-1b / blt-7b(无 8B) | 2025-04-18 发布,门控 + FAIR 非商用许可 |
| 平均 patch 长度 | 4.5~6.1 字节 | 熵模式 4.5,Space 模式 6.1 |
| BPE 平均 token | 3.7 (Llama 2) / 4.4 (Llama 3) 字节 | 对比基准 |
| 推理 FLOP 节省 | 最高 ~50% 存疑 | patch=8,未计熵模型 |
| 噪声 HellaSwag | 64.3 | vs Llama 3 56.9(+8 点) |
| CUTE 字符级 | 54.1 | vs Llama 3 27.5(+26.6 点) |
| 熵模型参数 | ~100M · 14 层 · hidden 512 | 512 字节滑窗 |
| 开源代码 | facebookresearch/blt(2.1k★) | Meta 官方 · CC-BY-NC-4.0 |
| HF 生态 | Transformers 原生支持(2025-09) | BltModel / BltForCausalLM |
| 第三方复现 | 未见独立大规模复现 | 未能核实 |
§5争议与批评:魔鬼代言人的三问
5.1 第一问:50% 推理节省是真的吗?(重炮)
- 100M 熵模型缓存前向 ≈ 0.2 GFLOP/byte;8B/patch=8 时约占主模型 1/10(尚可),~550M 规模则可与整个字节级模型相当甚至更大;
- 摘要「up to 50% fewer flops」与 Figure 1 固定推理缩放曲线基于不完整核算;Table 2 标「equal inference flops」的模型实际不相等;
- 主编裁定:有条件接受——缩放结果新颖可信、实验扎实,但效率头条必须重做核算才可引用。
5.2 第二问:wall-clock 真的快吗?
- FLOPs 是理论量,实际墙钟时间未必同比例缩短——字节级生成逐字节解码,内存带宽瓶颈更突出;
- Hacker News / Reddit 讨论普遍关注:*「FLOP 省了,但显存带宽和逐字节生成的延迟呢?」*;
- 2026-05 的 Fast BLT 论文正是为此而生(见 §7)。
5.3 第三问:工程可行性与推广性?
| 批评点 | 说明 |
|---|---|
| 动态 patch 难批处理 | 变长 patch 破坏固定形状 batch,服务端复杂化 |
| 仅验证到 8B | 更大规模(70B+)是否仍占优未证 |
| 无指令微调/RLHF 版本 | 生产可用性未验证 |
| 熵模型非端到端 | 切块与生成解耦;H-Net 团队批评「并非真正端到端」 |
| 长上下文适配难题 | 字节级序列长度膨胀,注意力成本高 |
| 数据混合未公开 | BLT-1T 精确配比未发布,复现困难 |
| 单跑无方差估计 | 核心对比疑似单次运行 |
反方声量观察:未检索到否定 BLT 方向本身的系统性反方文章;舆论整体偏建设性(「方向对,工程待补」)——这本身即一个发现。同行新锐亦有狙击:H-Net(CMU)批「非端到端」;Bolmo(AI2/UW)声称其 byteification 超越此前所有字节级 LM。
§6无词表路线谱系:从 ByT 到 BLT
| 年份 | 工作 | 机构 | 核心思想 |
|---|---|---|---|
| 2021 | ByT5 | 纯字节 Transformer,逐字节自回归,太慢 | |
| 2023 | MegaByte | Meta | 局部+全局双级,固定 patch |
| 2023 | MambaByte | Rush 团队 | SSM 路线处理字节,无注意力 |
| 2024 | BLT ★ | Meta FAIR | 动态熵 patch + 三层架构,8B 首次追平 tokenizer |
| 2025 | Bolmo | AI2 / UW | byteification:现成词表模型转字节级 |
| 2026 | ByteFlow | ICLR 2026 | 压缩驱动分割(coding rate),自适应字节分组 |
| 2026 | Fast BLT | Meta / Stanford | 扩散/自推测解码,解决生成慢 |
BLT 三点独创(vs 前代):① 动态 patch(MegaByte 为固定);② 熵驱动边界(小模型预测难度而非规则);③ 规模化验证(首次 8B/4T 级别,前代止步小模型)。
并行路线对比
| 路线 | 代表 | 核心思想 | 与 BLT 关系 |
|---|---|---|---|
| 字节动态 patch | BLT | 熵驱动变长 patch | 本文主角 |
| SSM 字节级 | MambaByte | 状态空间处理长字节序列 | 互补而非冲突 |
| 现成模型字节化 | Bolmo | 蒸馏转写,避免从头训练 | 实用主义旁支 |
| 压缩驱动分割 | ByteFlow | 潜在表征编码率决定边界 | 2026 新进竞争者 |
| 连续潜空间扩散 | Cola DLM(字节 Seed) | 连续空间扩散 LM | 异路;字节走此方向 |
tokenizer 会消失吗?正反方并存:正方——tokenizer 是「语言学殖民税」与工程包袱,多模态时代必死;反方——无免费午餐,字节级序列更长,省下的词表换来带宽/延迟代价,修补派(更大词表、动态 token)更现实。
§7产业前景与后继工作
7.1 后继研究(2025-2026)
| 工作 | 机构 | 核心贡献 | 状态 |
|---|---|---|---|
| Fast BLT | Meta + Stanford + UW | BLT-D(块扩散)/ BLT-S(自推测)/ BLT-DV;3B 模型带宽减少 >50%(BLT-D-16 达 87-92%) | arXiv:2605.08044 · 2026-05 |
| ByteFlow | — | 压缩驱动分割(coding rate),Top-K 静态计算图 | ICLR 2026 |
| Bolmo | AI2 / UW / Cambridge | byteification:冻结主干蒸馏 + 端到端微调 | arXiv:2512.15586 |
| H-Net | Albert Gu (CMU) | 混合 tokenizer-free 架构 | 学术 |
Fast BLT 的意义:直击 BLT 最大短板(逐字节生成慢)。BLT-D-4 以不到一半带宽近乎追平 BLT 质量——无词表路线的「最后一公里」正在被攻克。
7.2 产业采用:仅 Meta 一家开花
- 公开检索未见其他大厂将 BLT 投入生产模型(OpenAI/Google/Anthropic 均未采用);
- Meta 已接入 HuggingFace 生态(Transformers 原生支持 + 权重开放);
- 字节跳动(Seed)未采用 BLT——词表研究反而走反方向(Over-Tokenized Transformer,ICML 2025,词表扩至 12.8M)。
7.3 适用场景判断(工程决策)
| 场景 | 推荐度 | 理由 |
|---|---|---|
| 多语言/低资源翻译 | ★★★★★ | 低资源翻译 +2 BLEU,无 token 税 |
| 字符级任务(拼写/回文/OCR) | ★★★★★ | CUTE +26.6 点 |
| 噪声/对抗输入 | ★★★★☆ | noisy HellaSwag +8 点 |
| 多模态统一底座 | ★★★★☆ | 字节为通用单元(有待验证) |
| 生产级高速推理 | ★★☆☆☆ | 逐字节解码慢,工程不成熟 |
| 大厂主力模型 | ★★☆☆☆ | 生态/工具链远逊 tokenizer 范式 |
§8结论与启示
首次证明「无词表字节级 LLM 可在 8B 规模追平乃至超越 tokenizer 模型」——范式级事实,ACL 2025 Outstanding Paper 名副其实。
「推理省 50%」未计入熵模型成本,8B 上接近持平、小模型或反超——引用时务必注明「论文声称,核算存疑」。
字符级 +26.6 点、噪声 +8 点、低资源翻译 +2 BLEU,且不需额外数据——字节级建模的天然红利。
动态 patch 批处理、逐字节解码带宽瓶颈、指令微调缺失——Fast BLT 已指明解药。
2026 年中仍无第二家大厂投产,tokenizer 退场论为时过早;但作为「多模态统一 + 长尾泛化」储备路线,BLT 已站稳脚跟。
「字节的 BLT」系命名巧合。字节 Seed 无词表探索在 Cola DLM,词表研究反而反向扩表(Over-Tokenized 12.8M)。
§9来源清单(17 项,全部可核实)
| # | 来源 | 用途 |
|---|---|---|
| 1 | arXiv:2412.09871(BLT 原论文) | 核心机制、Table 1、鲁棒性、缩放研究 |
| 2 | arXiv HTML 版(arxiv.org/html/2412.09871v1) | 精确表格数据提取 |
| 3 | github.com/facebookresearch/blt | 开源实现、权重说明、许可证 |
| 4 | huggingface.co/ByteDance-Seed/models | 字节无 BLT 模型之证 |
| 5 | huggingface.co/docs/transformers/model_doc/blt | HF 生态接入、BltConfig 细节 |
| 6 | github.com/ByteDance-Seed(组织主页) | 字节 Seed 团队概况 |
| 7 | pith.science/p/2412.09871(Pith Review) | 熵模型 FLOP 核算批评(3 major/4 minor) |
| 8 | paperswithcode.com/paper/2412.09871 | 第三方评测聚合(MMLU 57.4 等) |
| 9 | arXiv:2605.08044(Fast BLT) | 后继工作:扩散/自推测解码 |
| 10 | arXiv:2603.03583(ByteFlow, ICLR 2026) | 压缩驱动分割新路线 |
| 11 | arXiv:2512.15586(Bolmo) | byteification 方法 |
| 12 | hub.baai.ac.cn/view/41963(机器之心/Datawhale) | 中文社区解读、Hacker News 反响 |
| 13 | ossaihub.com/glossary/byte-latent-transformer | 技术要义综述 |
| 14 | juejin.cn/post/7638825467915321396 | 「Token 会消失吗」行业讨论 |
| 15 | openreview.net/forum?id=a399nF2880 | 论文 OpenReview 页 |
| 16 | github.com/ByteDance-Seed/seed-oss | 字节开源模型(Qwen2 架构)对照 |
| 17 | ICML 2025 Over-Tokenized Transformer | 字节词表研究反方向证据(12.8M 词表) |
方法:13-Agent 流水线 · 4 路并行检索 · 证据分级 · 三审修订
AI 辅助披露:本报告由 AI 研究工具辅助完成,关键事实均附来源;未经核实信息一律剔除或标注。
