> 论文: DC-Leap: Training-Free Acceleration of dLLMs via Draft-Guided Contiguous Leaping Decoding > 作者: Yanhua Jiao, Tianyi Wu, Xiaoxi Sun, Yulin Li, HuiLing Zhen, Libo Qin, Baotian Hu, Zhuotao Tian, Min Zhang (Harbin Institute of Technology, Shenzhen; Huawei Noah’s Ark Lab) > arXiv: 2607.20467 > 会议: ICML 2026 > 代码: https://github.com/ffh-wyls/DC-Leap
—
🚀 引子:从一笔一画到一挥而就
想象你正在写一篇长文章。传统的方法是一笔一画地写——写完第一个字,才能确定第二个字;写完第一句,才能推进到第二句。这就是”自回归”(Autoregressive, AR)模型的工作方式:像一条单向行驶的列车,只能向前,不能回头。
但人类写作真的是这样的吗?
其实不然。当你构思一篇文章时,你的大脑会在全局上同时考虑多个段落。你可能先想到一个精彩的结尾,然后倒推中间的发展,最后才确定开头。写作是一个迭代的过程——你会反复修改、调整、重构,直到整篇文章达到你满意的程度。
扩散大语言模型(Diffusion LLMs, dLLMs) 正是试图模仿这种人类写作方式的AI架构。它们不一个个字地生成,而是从一片”空白”(全是[MASK])开始,通过多轮”去噪”迭代,逐渐”显影”出完整的文本。
但这里有一个问题:这种”全局显影”的方式虽然质量高,却慢得惊人。就像冲洗一张照片需要反复浸泡在不同的药水中,dLLM需要迭代多轮才能完成生成——每轮都要处理整个序列,计算成本高昂。
深圳哈工大和华为诺亚方舟实验室的团队问了一个大胆的问题:我们能不能让扩散模型学会”抄近路”——在保持质量的同时,大幅加速生成过程?
他们的答案是:DC-Leap——一个无需训练的加速框架,在MBPP长序列生成任务上实现了53.19倍加速,结合KV-Cache后更是达到了惊人的105.02倍。
—
🎨 第一章:扩散模型是如何”画画”的
在深入DC-Leap之前,我们需要先理解dLLM的基本工作原理。
传统的自回归模型(如GPT)就像一个 接龙游戏:给定前面的词,预测下一个词。它只能看到左边的上下文,右边的词对它来说是完全未知的。这种”因果掩码”(causal masking)确保了生成的一致性,但也限制了模型的全局视野。
dLLM则采用了完全不同的范式,灵感来自图像生成中的扩散模型(如Stable Diffusion)。它的核心思想可以概括为:
1. 从噪音开始:初始状态是一串全是[MASK]的序列 2. 逐步去噪:每一轮迭代,模型同时预测所有[MASK]位置的词 3. 选择性揭示:根据置信度,选择一部分预测结果”固定”下来,其余继续作为[MASK] 4. 迭代直至完成:经过T轮迭代,所有位置都被确定
用一个更直观的比喻:想象你在做一个 填字游戏,但所有的格子一开始都是空的。你不是从左到右逐个填,而是每轮同时猜测所有格子的内容。对于那些你”非常确定”的格子,你用笔把它们固定下来;对于那些”还不太确定”的,你留到下一轮再猜。经过几轮迭代,整个填字游戏就被完成了。
这种”全局并行”的方式有一个巨大的优势:模型在预测每个位置时,可以利用整个序列的上下文,而不仅仅是左边的部分。 这就像是你在写一篇文章时,可以随时回头看已经写好的内容,也可以预判后面将要写的内容——真正的全局写作。
但代价也很明显:需要多轮迭代。而每一轮都要对整个序列做一次完整的前向传播(forward pass),计算成本极高。
—
⚡ 第二章:并行解码的诱惑与陷阱
既然dLLM的慢主要来自于”需要多轮迭代”,一个很自然的想法是:能不能每轮多确定一些token? 如果能每轮确定10个token而不是1个,那速度不就提升10倍了吗?
这就是 并行解码(Parallel Decoding) 的核心思想。
但这里有一个微妙的技术障碍,论文中称为 JPDE(Joint Probability Dependence Error,联合概率依赖误差)。
让我们用一个生活化的例子来理解JPDE:
想象你在组织一场晚宴的座位安排。有10个客人,你需要为每个人安排座位。如果你”并行”地同时决定所有人的座位,可能会出现问题:你把A安排在B旁边,因为他们在同一个行业;但同时你又把C安排在B的另一边,因为C和B是校友。但A和C之间有过节——这个信息在你”并行”决策时被忽略了,因为你在决定A的位置时还没考虑到C的位置。
在dLLM中,类似的问题发生在token之间。自然语言是有强烈顺序依赖的:”我喜欢吃苹果”中的”苹果”,其语义合理性依赖于前面的”喜欢吃”。如果在并行解码中,模型同时确定了”吃”和”苹果”,但它对”苹果”的预测可能基于一个尚未最终确定的”吃”——这就引入了JPDE。
现有的并行解码策略为了应对JPDE,采用了一个 过于保守的解决方案:设定一个很高的置信度阈值。只有当模型对某个token的预测置信度超过这个阈值时,才把它”固定”下来。这种保守策略虽然减少了错误,但也大大降低了每轮能确定的token数量——很多时候,模型其实”知道”答案,只是不够”自信”而已。
—
🦘 第三章:DC-Leap的核心思想——”跳跃”与”验证”
DC-Leap提出了两个精妙的机制来打破这个困境:
🎯 机制一:动态连续验证(Dynamic Contiguous Verification, DCV)
DCV的核心洞察是:我们不需要对所有token都同等保守。如果一串token是”连续”的(即位置相邻),我们可以利用语言本身的因果结构来验证它们。
具体来说,DCV引入了一个 严格有序的因果约束:
想象你在一条单行道上开车。DCV的规则是:你可以同时加速多辆车,但每辆车只能看到它前面的车。如果你前面的车确定了位置,你就可以根据它的位置来决定你的位置。这种”有序验证”确保了即使我们降低了置信度阈值(允许更多token被接受),也不会引入JPDE——因为每个token的验证都严格遵循从左到右的因果顺序。
技术上,DCV维护一个”已解码前缀”。对于每一个新候选的token窗口,它确保token之间的依赖关系被逐步验证:第一个token基于已解码前缀验证,第二个token基于已解码前缀+第一个token验证,以此类推。这种”级联验证”使得模型可以在保持因果一致性的前提下,接受更多中等置信度的token。
🚀 机制二:草稿引导解码(Draft-Guided Decoding)
这是DC-Leap最聪明的部分。
传统的并行解码就像是在黑暗中摸索——每轮你都在当前的”已知区域”边缘小心翼翼地试探。DC-Leap问了一个大胆的问题:如果我们能”看到”更远的地方呢?
草稿引导解码的机制是这样的: 1. 模型在当前窗口之外(右侧),先生成一个”草稿”序列——这是对后续内容的一个快速预测 2. 这个草稿虽然可能不完全准确,但它提供了宝贵的”前瞻信息” 3. 当模型解码当前窗口时,它可以利用草稿中的信息来做出更好的决策
用一个比喻:想象你在爬山。传统的方法是你只能看到你当前所在位置周围几米的地形。DC-Leap的方法则是:派出一个”侦察兵”(草稿),快速跑到前面去看看地形,然后回来报告。虽然侦察兵的报告可能不完全精确(毕竟他是快速跑过去的),但有了这些前瞻信息,你在规划路线时可以做出更好的决策。
更妙的是,草稿中的高置信度token可以作为 语义锚点——即使它们最终会被修改,它们提供的上下文信息已经帮助当前窗口的解码做出了更好的选择。
—
📈 第四章:实验结果——数字不会说谎
DC-Leap的实验结果令人印象深刻。让我们看看几个关键数字:
基准测试设置: – 模型:LLaDA-8B-Instruct, LLaDA-1.5, Dream-v0-7B-Instruct – 任务:MBPP(代码生成,长序列)、GSM8K(数学推理)、HumanEval等
核心结果:
| 配置 | 加速比 | 备注 |
|---|---|---|
| DC-Leap (MBPP, 1024 tokens) | 53.19× | 长序列生成 |
| DC-Leap + KV-Cache | 105.02× | 与缓存优化正交叠加 |
| 平均文本推理加速 | 显著 | 保持可比的性能分数 |
关键发现:
1. 长序列收益更大:DC-Leap的优势在需要生成较长文本的任务中最为明显。这是因为在长序列中,”抄近路”的空间更大——模型可以更大胆地跳跃前进。
2. 与KV-Cache正交:DC-Leap的加速可以与dLLM专用的KV-Cache优化(如dLLM-Cache)叠加使用,两者从不同的角度解决效率问题——DC-Leap减少迭代轮数,KV-Cache减少每轮计算量。
3. 质量保持:在实现巨大加速的同时,DC-Leap保持了与基线相当的任务性能。这不是用质量换速度的权宜之计,而是一个”鱼与熊掌兼得”的方案。
—
🔧 第五章:为什么DC-Leap是”训练无关”的?
DC-Leap的另一个重要特性是:训练无关(Training-Free)。
这是什么意思?很多dLLM加速方法需要修改模型架构或进行额外的训练——比如训练一个专门的”草稿模型”来生成草稿。这不仅增加了开发成本,还限制了方法的通用性(不同模型需要重新训练)。
DC-Leap完全不需要这些。它通过 纯推理阶段的策略调整 实现加速: – 不需要修改模型权重 – 不需要额外的训练数据 – 可以即插即用到任何现有的dLLM上
这使得DC-Leap具有极强的实用性和通用性。研究团队已经验证了它与LLaDA、Dream等主流dLLM的兼容性。
—
🌉 第六章:技术细节——DCV如何实现”安全的大胆”
让我们更深入地理解DCV的工作原理。
在传统的并行解码中,每个位置独立地根据置信度决定是否接受预测结果。但DCV引入了一个 序列级别的验证机制:
假设当前已解码前缀是”The cat sat on the”,下一个窗口有4个位置。模型对这4个位置的预测分别是: – 位置1: “mat” (置信度0.92) – 位置2: “and” (置信度0.85) – 位置3: “looked” (置信度0.78) – 位置4: “out” (置信度0.81)
传统方法可能会接受位置1和2(如果阈值是0.9),拒绝3和4。但DCV会做一个额外的检查:即使位置3的置信度只有0.78,如果它在前面的”mat”和”and”确定后的条件概率实际上是合理的,它也可能被接受——前提是验证过程确保了因果依赖没有被破坏。
具体来说,DCV维护一个严格从左到右的验证顺序: 1. 验证位置1:基于已解码前缀 2. 验证位置2:基于已解码前缀 + 验证后的位置1 3. 验证位置3:基于已解码前缀 + 验证后的位置1-2 4. 以此类推
这种”渐进式验证”使得即使单个token的置信度不高,只要在因果链中是自洽的,就可以被接受。这大大增加了每轮可接受的token数量,从而实现了加速。
—
🎭 第七章:草稿引导的精妙之处
草稿引导解码是DC-Leap的”秘密武器”。
传统的解码过程是”局部”的——模型只能基于已经确定的token来做决策。但草稿引导打破了这种局限:
1. 草稿生成:使用一个快速的、低成本的机制(比如单次前向传播,或一个轻量级模型)生成对后续序列的初步预测 2. 上下文扩展:将草稿中的token作为额外的上下文信息,融入到当前窗口的解码中 3. 双向注意力的保留:dLLM的一个核心优势是双向注意力——在预测每个token时,可以利用左右两边的上下文。草稿引导进一步强化了这一优势,让模型可以”看到”比当前窗口更远的内容
草稿的质量不需要完美。即使草稿中只有60%的token是准确的,它提供的上下文信息已经足以帮助当前窗口的解码做出更好的选择。这是一种”用粗略的全局信息来指导精确的局部决策”的策略。
更有趣的是,草稿中的高置信度token可以直接作为”锚点”——这些锚点不仅为当前解码提供了上下文,还可能在后续轮次中被直接接受,进一步减少所需的迭代次数。
—
🏆 第八章:DC-Leap的意义——扩散模型的实用化里程碑
DC-Leap的出现,标志着dLLM从一个”有趣但太慢”的研究方向,向实际应用迈出了关键一步。
历史背景: – 2024-2025:dLLM概念兴起,展示了质量上的潜力,但推理速度是最大瓶颈 – 2025:Fast-dLLM、LocalLeap等工作开始探索加速策略 – 2026:DC-Leap以50-100倍的加速比,将dLLM推向了实用化的临界点
为什么这很重要?
自回归模型(如GPT)已经主导了LLM领域多年,但它们的根本限制——只能从左到右生成——始终存在。dLLM提供了一种根本不同的生成范式,具有理论上的优势: – 全局上下文:生成每个token时可以利用完整上下文 – 迭代精炼:可以像人类写作一样反复修改 – 更好的可控性:可以在生成过程中进行干预和调整
但这些优势之前被”太慢”这个致命缺点所掩盖。DC-Leap通过将推理速度提升1-2个数量级,使得dLLM的这些理论优势终于可以转化为实际价值。
—
🔮 结语:当AI学会”走一步看三步”
DC-Leap的哲学,本质上是在教AI学会”走一步看三步”——在确定当前步骤的同时,利用前瞻信息来做出更好的决策。
这与人类认知有着有趣的平行。当你阅读这句话时,你的眼睛实际上已经看到了后面的几个词。这种”预览”能力帮助你更流畅地理解文本。DC-Leap的草稿引导机制,正是在模仿这种人类阅读的预览效应。
而DCV的渐进式验证,则像是在走钢丝时的安全网——它允许你更大胆地迈出步伐,因为你知道有一个严格的顺序验证机制在保护你不会坠落。
50倍的加速不是一个渐进式改进,而是一个数量级的飞跃。它可能标志着dLLM从实验室走向生产环境的关键转折点。当扩散模型终于可以与自回归模型在速度上一较高下时,我们或许会看到一个全新的LLM生态——一个不再被”从左到右”所束缚的、更自由、更灵活的生成范式。
毕竟,人类从不一笔一画地思考。为什么AI要呢?
—
📚 参考文献
1. Jiao, Y., Wu, T., Sun, X., et al. (2026). DC-Leap: Training-Free Acceleration of dLLMs via Draft-Guided Contiguous Leaping Decoding. arXiv:2607.20467. ICML 2026.
2. Nie, S., et al. (2025). Large Language Diffusion Models. ICLR.
3. Kong, X., et al. (2025). LocalLeap: Accelerating dLLMs via Locality-Aware Parallel Decoding.
4. Ma, X., et al. (2025). dLLM-Cache: Efficient Key-Value Cache for Diffusion Language Models.
5. Chen, Y., et al. (2026). STDec: Spatio-Temporal Stability Guided Decoding for dLLMs. arXiv:2604.06330.
—
#论文 #扩散模型 #dLLM #推理加速 #ICML2026 #小凯
