无词表(Tokenizer-Free)LLM 架构 Byte Latent Transformer(BLT)

无词表 LLM 深度研究:BLT 字节潜在 Transformer :root { --bg: #0f1115...

无词表 LLM 深度研究:BLT 字节潜在 Transformer :root { –bg: #0f1115; –bg2: #161a22; –card: #1b212c; –card2: #212836; –border: #2c3546; –text: #e8ecf3; –text2: #a8b3c7; –text3: #6b7689; –accent: #6ea8fe; –accent2: #8b7cf6; –red: #ff7b72; –green: #7ee787; –yellow: #f0c674; –pink: #ff9bd2; –teal: #5bd6d0; –mono: ‘JetBrains Mono’, ‘Cascadia Code’, Consolas, monospace; –sans: ‘PingFang SC’, ‘Microsoft YaHei’, -apple-system, sans-serif; –serif: ‘Songti SC’, ‘SimSun’, serif; } * { margin: 0; padding: 0; box-sizing: border-box; } body { background: var(–bg); color: var(–text); font-family: var(–sans); line-height: 1.75; padding: 0 0 80px; } .wrap { max-width: 960px; margin: 0 auto; padding: 0 28px; } /* ===== Header ===== */ header { padding: 72px 0 40px; border-bottom: 1px solid var(–border); margin-bottom: 48px; background: radial-gradient(ellipse 80% 120% at 50% -20%, rgba(110,168,254,0.10), transparent 60%); } .kicker { font-family: var(–mono); font-size: 12px; letter-spacing: 3px; color: var(–accent); text-transform: uppercase; margin-bottom: 16px; } h1 { font-size: 38px; font-weight: 800; letter-spacing: 0.5px; line-height: 1.3; margin-bottom: 14px; } h1 .en { color: var(–accent); } .subtitle { font-size: 16px; color: var(–text2); max-width: 720px; } .meta-row { display: flex; flex-wrap: wrap; gap: 10px 24px; margin-top: 24px; font-family: var(–mono); font-size: 12.5px; color: var(–text3); } .meta-row b { color: var(–text2); font-weight: 600; } /* ===== Typography ===== */ h2 { font-size: 24px; font-weight: 700; margin: 56px 0 20px; padding-left: 14px; border-left: 4px solid var(–accent); letter-spacing: 0.3px; } h2 .sec-no { color: var(–text3); font-family: var(–mono); font-size: 15px; margin-right: 8px; } h3 { font-size: 17px; font-weight: 600; margin: 30px 0 12px; color: var(–text); } p { margin: 10px 0; color: var(–text2); } p strong { color: var(–text); } ul, ol { margin: 10px 0 10px 22px; color: var(–text2); } li { margin: 5px 0; } a { color: var(–accent); text-decoration: none; border-bottom: 1px dotted rgba(110,168,254,0.4); } a:hover { color: var(–teal); } .quote { font-family: var(–serif); font-size: 15px; color: var(–text2); background: var(–card); border-left: 3px solid var(–yellow); padding: 14px 18px; border-radius: 0 8px 8px 0; margin: 16px 0; font-style: italic; } .golden { font-family: var(–serif); font-size: 17px; text-align: center; color: var(–yellow); background: linear-gradient(135deg, rgba(240,198,116,0.08), rgba(240,198,116,0.02)); border: 1px solid rgba(240,198,116,0.25); border-radius: 10px; padding: 18px 24px; margin: 28px 0; letter-spacing: 0.5px; } /* ===== Cards & Alerts ===== */ .alert { border-radius: 10px; padding: 14px 18px; margin: 16px 0; font-size: 14.5px; border: 1px solid; } .alert.warn { background: rgba(240,198,116,0.07); border-color: rgba(240,198,116,0.3); color: #f5d78e; } .alert.danger { background: rgba(255,123,114,0.07); border-color: rgba(255,123,114,0.3); color: #ffb3ae; } .alert.info { background: rgba(110,168,254,0.07); border-color: rgba(110,168,254,0.3); color: #a9c9ff; } .alert b { color: inherit; } .badge { display: inline-block; padding: 2px 10px; border-radius: 20px; font-size: 12px; font-weight: 600; margin-right: 6px; vertical-align: 1px; } .badge.red { background: rgba(255,123,114,0.15); color: var(–red); } .badge.green { background: rgba(126,231,135,0.15); color: var(–green); } .badge.yellow { background: rgba(240,198,116,0.15); color: var(–yellow); } .badge.purple { background: rgba(139,124,246,0.18); color: var(–accent2); } .badge.blue { background: rgba(110,168,254,0.15); color: var(–accent); } /* ===== Tables ===== */ .tbl-wrap { overflow-x: auto; margin: 18px 0; border-radius: 10px; border: 1px solid var(–border); } table { width: 100%; border-collapse: collapse; font-size: 13.5px; min-width: 560px; } thead th { background: var(–card2); color: var(–text); font-weight: 600; padding: 11px 14px; text-align: left; white-space: nowrap; border-bottom: 1px solid var(–border); font-size: 13px; } tbody td { padding: 10px 14px; border-bottom: 1px solid rgba(44,53,70,0.5); color: var(–text2); vertical-align: top; } tbody tr:last-child td { border-bottom: none; } tbody tr:hover td { background: rgba(110,168,254,0.03); } td.num { font-family: var(–mono); text-align: right; } td.hl { color: var(–green); font-weight: 700; } td.bad { color: var(–red); font-weight: 700; } td.dim { color: var(–text3); } .tag { font-size: 11px; font-family: var(–mono); color: var(–text3); } /* ===== Architecture SVG ===== */ .arch-wrap { background: var(–card); border: 1px solid var(–border); border-radius: 12px; padding: 20px; margin: 20px 0; } .arch-wrap .caption { font-size: 12.5px; color: var(–text3); text-align: center; margin-top: 10px; font-family: var(–mono); } svg text { font-family: var(–sans); } /* ===== TOC ===== */ .toc { background: var(–card); border: 1px solid var(–border); border-radius: 12px; padding: 22px 26px; margin: 30px 0; } .toc h3 { margin: 0 0 12px; color: var(–text); font-size: 15px; letter-spacing: 1px; } .toc ol { margin-left: 20px; } .toc a { border: none; color: var(–text2); font-size: 14px; } .toc a:hover { color: var(–accent); } /* ===== Conclusion cards ===== */ .grid2 { display: grid; grid-template-columns: 1fr 1fr; gap: 14px; margin: 18px 0; } @media (max-width: 720px) { .grid2 { grid-template-columns: 1fr; } } .card { background: var(–card); border: 1px solid var(–border); border-radius: 10px; padding: 16px 18px; } .card .t { font-weight: 700; font-size: 14.5px; margin-bottom: 6px; display: flex; align-items: center; gap: 8px; } .card p { font-size: 13.5px; color: var(–text2); margin: 0; } footer { margin-top: 60px; padding-top: 24px; border-top: 1px solid var(–border); font-size: 12.5px; color: var(–text3); font-family: var(–mono); } .flow { font-family: var(–serif); color: var(–text2); } @media (max-width: 640px) { h1 { font-size: 28px; } header { padding: 48px 0 30px; } h2 { font-size: 20px; } }
Deep Research · 深度研究报告

无词表(Tokenizer-Free)LLM 架构
Byte Latent Transformer(BLT)

不立词表、直餐字节——熵驱动动态补丁化如何革 tokenizer 之命?一份覆盖机制、实测、争议与产业前景的完整研究。

日期 2026-08-23 模式 full · 6 阶段流水线 检索 4 路并行 证据分级 已执行 三审 主编 / 魔鬼代言人 / 伦理

§0摘要(TL;DR)

BLT(Byte Latent Transformer,字节潜在 Transformer)是 Meta FAIR 于 2024 年 12 月提出的无词表大语言模型架构——不依赖分词器与固定词表,直接以 UTF-8 原始字节为输入,通过「熵驱动动态补丁化(entropy-based dynamic patching)」把字节聚合成变长 patch 作为计算单元。核心论断:Patches Scale Better Than Tokens

关键数字8B / 4T

首次完成字节级模型 8B 参数 / 4T 训练字节 的 FLOP 受控缩放研究(论文口径,GitHub 载 8T)。

存疑推理省 ~50%

推理 FLOPs 最多可省 ~50%,但未计入熵模型成本——第三方审稿质疑后或接近持平(见 §5)。

白赚鲁棒性 +8 点

噪声 HellaSwag 较同数据 Llama 3 高 8 点,与多训 16 倍数据的 Llama 3.1 持平;CUTE 字符级 +26.6 点。

考据非字节跳动

BLT 出自 Meta FAIR(ACL 2025 Outstanding Paper)。「字节」指 byte,非 ByteDance。字节的 Seed 团队未做 BLT。

⚠️ 首要考据更正:BLT 论文出自 Meta FAIR(facebookresearch/blt 官方开源,2.1k★),并非字节跳动。「字节」乃计算机 byte(字节级建模)之意,非 ByteDance 之「字节」。四重验证见 §1。

§1考据:BLT 之「字节」何指

1.1 论文出处:Meta FAIR,非字节跳动

项目内容
论文Byte Latent Transformer: Patches Scale Better Than Tokens · arXiv:2412.09871
作者Artidoro Pagnoni 等 14 人(Meta FAIR + UW + UChicago)
提交 / 荣誉2024-12-13 · ACL 2025 Outstanding Paper
官方代码github.com/facebookresearch/blt(2.1k★ · CC-BY-NC-4.0)
权重发布facebook/blt-1b · blt-7b · blt-entropy(2025-04-18,门控,FAIR 非商用许可;无 8B checkpoint
生态接入HuggingFace Transformers 2025-09-19 原生支持(BltModel
训练字节数口径不一arXiv 摘要 4T,GitHub README/模型卡 8T

1.2 字节跳动与 BLT:查无实据(四重验证)

验证途径结果
github.com/ByteDance-Seed/BLT404 不存在
GitHub org 检索(org:ByteDance-Seed)仅 3 仓库,无一与 BLT 相关
HF ByteDance-Seed 组织(59 模型)无 BLT;Seed-OSS / Seed-Coder 皆 Qwen2 架构传统词表模型
seed.bytedance.com 站内检索零 BLT 内容

ByteDance Seed 的无词表探索实为 Cola DLM(连续潜空间扩散)——与 BLT 的离散字节 patch 路线异路;更反讽的是,字节在词表方向的真实研究走完全相反的路——Over-Tokenized Transformer(ICML 2025)把输入词表扩至 12.8M 条目(过分词化),而非去词表化。

「字节的 BLT」当解为「字节级(byte-level)的 BLT」——BLT 之 Byte 是计算机字节,非 ByteDance 之「字节」。字节不仅没做 BLT,其词表研究反而背道而驰。

§2核心机制:无词表如何运作

2.1 为什么不要 tokenizer?

缺陷具体表现影响
跨语言不公平英语 1 token ≈ 4 字节,中文/日语每词 2-3 token语言间「token 税」差异巨大
固定词表刚性OOV、新词、罕见拼写无法处理长尾泛化差
字符级盲区拼写、回文、字母计数、错别字任务劣势字符级理解近零
噪声脆弱大小写翻转、字符删改即超出词表分布鲁棒性差
多模态障碍图像/音频/代码各需专属词表统一建模困难
压缩偏见词表由训练语料统计决定隐性语种/地域偏见

BLT 的回答:全部去掉——直接吃 UTF-8 字节,一切由模型自己学。

2.2 Patchification:按「难度」聚块

核心洞见:并非所有字节都同样难预测。「the 」几乎可确定,乱码/专名则难以预测。BLT 用一个 100M 参数的小型熵模型(patcher)逐字节预测下一字节熵:低熵(可预测)→ 长 patch 省算力;高熵(难预测)→ 短 patch 多给算力。

费曼式类比:「聪明的读者跳着读,生词才停下来查字典——BLT 让模型自己决定哪里该慢下来。」

2.3 三层架构:局部-全局-局部

原始字节流 b b b … ! b b b … ? b b b … b 熵模型 / Patcher(~100M) 逐字节预测熵 → 决定 patch 边界(低熵长块 · 高熵短块) patch(低熵·长) patch(高熵·短) patch(低熵·长) 局部编码器 ε 字节→patch 表征(轻量) 局部编码器 ε 字节→patch 表征(轻量) 局部编码器 ε 字节→patch 表征(轻量) 全局 Transformer G(主力算力) patch 序列自回归 · 块因果注意力
BLT 前向流程:字节 → 熵模型切块 → 局部编码器池化 → 全局 Transformer 在 patch 序列上自回归(解码端对称,局部解码器逐字节展开预测)
组件职责参数量级特点
熵模型 / patcher预测字节熵,决定 patch 边界~100M独立小模型,推理时逐字节运行
局部编码器 ε字节 → patch 表征轻量(1-2 层)交叉注意力池化 + 哈希 n-gram 嵌入
全局 Transformer Gpatch 序列自回归主力(数百 M~数 B)块因果注意力
局部解码器 Dpatch 表征 → 字节预测轻量(1-2 层)交叉注意力展开回字节级

2.4 「无词表」怎么实现?

  • 输入侧:文本 → UTF-8 → 每字节映射 260 维 ID(0-255 + 特殊符)——无学习词表
  • 计算侧:字节经局部编码器聚成 patch,全局模型只处理 patch 序列(长度约为字节的 1/4~1/8);
  • 输出侧:逐字节自回归生成。

由此「双模型架构」成立:熵模型负责切块,主模型负责生成,二者独立训练(端到端联合训练为论文所列未来工作)。

§3性能实测:与 Llama 3 正面交锋

3.1 主评测矩阵(Table 1 · 8B · 1T tokens · FLOP 匹配)

任务Llama 3 (BPE)BLT-Space (6T B)BLT-Entropy (4.5T B)
Arc-E (0-shot)77.675.479.6
Arc-C (0-shot)53.349.852.1
HellaSwag (0-shot)79.179.680.6
PIQA (0-shot)80.781.180.6
MMLU (5-shot)58.154.857.4
MBPP (3-shot)40.237.641.8
HumanEval (0-shot)31.127.435.4
平均60.058.061.1
平均 patch/字节4.4 B/token6.1 B4.5 B

BLT-Entropy 在 7 项中 4 项胜出(Arc-E、HellaSwag、MBPP、HumanEval),平均 +1.1 分;代码任务(HumanEval +4.3、MBPP +1.6)优势明显。BLT-Space 平均略低但 patch 更大(6.1 字节)——揭示「patch 大小 ↔ 质量」权衡轴。

3.2 推理效率(含争议)

  • 论文声称:固定推理成本下,patch size=8 时推理 FLOPs 较 BPE 基线节省接近 50%
  • 机制:BPE 平均 token ≈ 4.4 字节,BLT 用 8 字节 patch → 推理步数约减半;
  • ⚠ 争议Pith Review 指出算式未计入熵模型推理成本(每生成一字节都要跑一次 100M 熵模型)——8B 规模优势缩至持平,~550M 规模或反超为负。见 §5.1。

3.3 鲁棒性:BLT 的主场

模型HellaSwag 原版噪声平均CUTE 字符级音系 G2P
Llama 3 (1T tok)79.156.927.511.8
Llama 3.1 (16T tok)80.764.320.018.9
BLT (1T tok)80.664.354.113.0
  • Noisy HellaSwag:BLT 噪声下较同数据 Llama 3 高 8 点,与多训 16 倍数据的 Llama 3.1 持平——鲁棒性是字节级建模的「白赚」收益;
  • CUTE 字符级:BLT 54.1 vs Llama 3 27.5(+26.6),拼写类近完美(Spelling 99.9);
  • 音系 G2P:同数据胜出(13.0 vs 11.8),不及 16T 数据的 Llama 3.1(18.9)。

3.4 低资源语言翻译(FLORES-101)

方向(21 低资源)Llama 3BLT差值
→ English12.114.0+2.0
English →5.96.4+0.5

典型增益:亚美尼亚语 →EN 1.7→6.3;孟加拉语 →EN 4.7→12.7;格鲁吉亚语 →EN 1.7→7.4。常用语言持平或略优。字节建模对长尾/低资源语言泛化显著提升——恰是 tokenizer 税最重的领域。

§4关键数据速查

维度数值备注
最大规模实验8B 参数 / 4T~8T 训练字节首次字节级 FLOP 受控缩放(官方口径 4T/8T 不一)
开源权重blt-1b / blt-7b(无 8B)2025-04-18 发布,门控 + FAIR 非商用许可
平均 patch 长度4.5~6.1 字节熵模式 4.5,Space 模式 6.1
BPE 平均 token3.7 (Llama 2) / 4.4 (Llama 3) 字节对比基准
推理 FLOP 节省最高 ~50% 存疑patch=8,未计熵模型
噪声 HellaSwag64.3vs Llama 3 56.9(+8 点)
CUTE 字符级54.1vs Llama 3 27.5(+26.6 点)
熵模型参数~100M · 14 层 · hidden 512512 字节滑窗
开源代码facebookresearch/blt(2.1k★)Meta 官方 · CC-BY-NC-4.0
HF 生态Transformers 原生支持(2025-09)BltModel / BltForCausalLM
第三方复现未见独立大规模复现未能核实

§5争议与批评:魔鬼代言人的三问

5.1 第一问:50% 推理节省是真的吗?(重炮)

Pith Review(2026-08-11 · 3 major / 4 minor)核心攻击:论文 §4.5 的 FLOP 公式只算了局部编码器、全局 Transformer、局部解码器与交叉注意力,唯独漏了熵模型——而推理时每生成一个字节都必须运行这个 100M 熵模型来决定边界,无法摊销。
  • 100M 熵模型缓存前向 ≈ 0.2 GFLOP/byte;8B/patch=8 时约占主模型 1/10(尚可),~550M 规模则可与整个字节级模型相当甚至更大
  • 摘要「up to 50% fewer flops」与 Figure 1 固定推理缩放曲线基于不完整核算;Table 2 标「equal inference flops」的模型实际不相等
  • 主编裁定:有条件接受——缩放结果新颖可信、实验扎实,但效率头条必须重做核算才可引用。
本文立场:50% 宜表述为「论文声称、上界且未全核算、存疑待考」,不得作为事实引用。

5.2 第二问:wall-clock 真的快吗?

  • FLOPs 是理论量,实际墙钟时间未必同比例缩短——字节级生成逐字节解码,内存带宽瓶颈更突出;
  • Hacker News / Reddit 讨论普遍关注:*「FLOP 省了,但显存带宽和逐字节生成的延迟呢?」*;
  • 2026-05 的 Fast BLT 论文正是为此而生(见 §7)。

5.3 第三问:工程可行性与推广性?

批评点说明
动态 patch 难批处理变长 patch 破坏固定形状 batch,服务端复杂化
仅验证到 8B更大规模(70B+)是否仍占优未证
无指令微调/RLHF 版本生产可用性未验证
熵模型非端到端切块与生成解耦;H-Net 团队批评「并非真正端到端」
长上下文适配难题字节级序列长度膨胀,注意力成本高
数据混合未公开BLT-1T 精确配比未发布,复现困难
单跑无方差估计核心对比疑似单次运行

反方声量观察:未检索到否定 BLT 方向本身的系统性反方文章;舆论整体偏建设性(「方向对,工程待补」)——这本身即一个发现。同行新锐亦有狙击:H-Net(CMU)批「非端到端」;Bolmo(AI2/UW)声称其 byteification 超越此前所有字节级 LM

§6无词表路线谱系:从 ByT 到 BLT

年份工作机构核心思想
2021ByT5Google纯字节 Transformer,逐字节自回归,太慢
2023MegaByteMeta局部+全局双级,固定 patch
2023MambaByteRush 团队SSM 路线处理字节,无注意力
2024BLTMeta FAIR动态熵 patch + 三层架构,8B 首次追平 tokenizer
2025BolmoAI2 / UWbyteification:现成词表模型转字节级
2026ByteFlowICLR 2026压缩驱动分割(coding rate),自适应字节分组
2026Fast BLTMeta / Stanford扩散/自推测解码,解决生成慢

BLT 三点独创(vs 前代):① 动态 patch(MegaByte 为固定);② 熵驱动边界(小模型预测难度而非规则);③ 规模化验证(首次 8B/4T 级别,前代止步小模型)。

并行路线对比

路线代表核心思想与 BLT 关系
字节动态 patchBLT熵驱动变长 patch本文主角
SSM 字节级MambaByte状态空间处理长字节序列互补而非冲突
现成模型字节化Bolmo蒸馏转写,避免从头训练实用主义旁支
压缩驱动分割ByteFlow潜在表征编码率决定边界2026 新进竞争者
连续潜空间扩散Cola DLM(字节 Seed)连续空间扩散 LM异路;字节走此方向

tokenizer 会消失吗?正反方并存:正方——tokenizer 是「语言学殖民税」与工程包袱,多模态时代必死;反方——无免费午餐,字节级序列更长,省下的词表换来带宽/延迟代价,修补派(更大词表、动态 token)更现实。

§7产业前景与后继工作

7.1 后继研究(2025-2026)

工作机构核心贡献状态
Fast BLTMeta + Stanford + UWBLT-D(块扩散)/ BLT-S(自推测)/ BLT-DV;3B 模型带宽减少 >50%(BLT-D-16 达 87-92%)arXiv:2605.08044 · 2026-05
ByteFlow压缩驱动分割(coding rate),Top-K 静态计算图ICLR 2026
BolmoAI2 / UW / Cambridgebyteification:冻结主干蒸馏 + 端到端微调arXiv:2512.15586
H-NetAlbert Gu (CMU)混合 tokenizer-free 架构学术

Fast BLT 的意义:直击 BLT 最大短板(逐字节生成慢)。BLT-D-4 以不到一半带宽近乎追平 BLT 质量——无词表路线的「最后一公里」正在被攻克

7.2 产业采用:仅 Meta 一家开花

  • 公开检索未见其他大厂将 BLT 投入生产模型(OpenAI/Google/Anthropic 均未采用);
  • Meta 已接入 HuggingFace 生态(Transformers 原生支持 + 权重开放);
  • 字节跳动(Seed)未采用 BLT——词表研究反而走反方向(Over-Tokenized Transformer,ICML 2025,词表扩至 12.8M)。

7.3 适用场景判断(工程决策)

场景推荐度理由
多语言/低资源翻译★★★★★低资源翻译 +2 BLEU,无 token 税
字符级任务(拼写/回文/OCR)★★★★★CUTE +26.6 点
噪声/对抗输入★★★★☆noisy HellaSwag +8 点
多模态统一底座★★★★☆字节为通用单元(有待验证)
生产级高速推理★★☆☆☆逐字节解码慢,工程不成熟
大厂主力模型★★☆☆☆生态/工具链远逊 tokenizer 范式

§8结论与启示

确认学术价值

首次证明「无词表字节级 LLM 可在 8B 规模追平乃至超越 tokenizer 模型」——范式级事实,ACL 2025 Outstanding Paper 名副其实。

存疑效率主张

「推理省 50%」未计入熵模型成本,8B 上接近持平、小模型或反超——引用时务必注明「论文声称,核算存疑」。

白赚鲁棒性

字符级 +26.6 点、噪声 +8 点、低资源翻译 +2 BLEU,且不需额外数据——字节级建模的天然红利。

待补工程化

动态 patch 批处理、逐字节解码带宽瓶颈、指令微调缺失——Fast BLT 已指明解药。

冷静产业格局

2026 年中仍无第二家大厂投产,tokenizer 退场论为时过早;但作为「多模态统一 + 长尾泛化」储备路线,BLT 已站稳脚跟。

延伸对字节的误读

「字节的 BLT」系命名巧合。字节 Seed 无词表探索在 Cola DLM,词表研究反而反向扩表(Over-Tokenized 12.8M)。

「Token 是字典,字节是空气——字典让人省力,空气让人自由。BLT 赌的是:省力的代价终将超过自由的风险。」

§9来源清单(17 项,全部可核实)

#来源用途
1arXiv:2412.09871(BLT 原论文)核心机制、Table 1、鲁棒性、缩放研究
2arXiv HTML 版(arxiv.org/html/2412.09871v1)精确表格数据提取
3github.com/facebookresearch/blt开源实现、权重说明、许可证
4huggingface.co/ByteDance-Seed/models字节无 BLT 模型之证
5huggingface.co/docs/transformers/model_doc/bltHF 生态接入、BltConfig 细节
6github.com/ByteDance-Seed(组织主页)字节 Seed 团队概况
7pith.science/p/2412.09871(Pith Review)熵模型 FLOP 核算批评(3 major/4 minor)
8paperswithcode.com/paper/2412.09871第三方评测聚合(MMLU 57.4 等)
9arXiv:2605.08044(Fast BLT)后继工作:扩散/自推测解码
10arXiv:2603.03583(ByteFlow, ICLR 2026)压缩驱动分割新路线
11arXiv:2512.15586(Bolmo)byteification 方法
12hub.baai.ac.cn/view/41963(机器之心/Datawhale)中文社区解读、Hacker News 反响
13ossaihub.com/glossary/byte-latent-transformer技术要义综述
14juejin.cn/post/7638825467915321396「Token 会消失吗」行业讨论
15openreview.net/forum?id=a399nF2880论文 OpenReview 页
16github.com/ByteDance-Seed/seed-oss字节开源模型(Qwen2 架构)对照
17ICML 2025 Over-Tokenized Transformer字节词表研究反方向证据(12.8M 词表)
深度研究报告 · BLT(Byte Latent Transformer)· 2026-08-23
方法:13-Agent 流水线 · 4 路并行检索 · 证据分级 · 三审修订
AI 辅助披露:本报告由 AI 研究工具辅助完成,关键事实均附来源;未经核实信息一律剔除或标注。

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1