跳转至

03 Feature head、MTP 与并行块草稿

方向最密集的主线:从 Medusa / EAGLE feature heads 到 DFlash 并行块,再到 Domino、DSpark、PCTree 对候选内因果性与生产调度的修复。

20 篇核心论文 336 页核读 更新至 2026

读完这一类,应能回答

  • parallel marginals 为什么不是一个合法的 joint proposal?
  • 怎样用低成本 Markov / RNN / tree conditioning 修复 block 内依赖?
  • proposal 质量、draft latency 与 verification capacity 应如何联合优化?

推荐阅读路线

  1. MEDUSA: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads — ICML 2024,2024。
  2. EAGLE: Speculative Sampling Requires Rethinking Feature Uncertainty — ICML 2024,2024。
  3. DFlash: Block Diffusion for Flash Speculative Decoding — ICML 2026,2026。
  4. Domino: Decoupling Causal Modeling from Autoregressive Drafting in Speculative Decoding — arXiv preprint,2026。
  5. DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation — arXiv preprint,2026。
  6. From Chains to Trees: Parent-Conditioned Drafting for Semi-Autoregressive Speculative Decoding — arXiv preprint,2026。

全部精读

年份 论文 Venue 核读页码
2024 EAGLE-2: Faster Inference of Language Models with Dynamic Draft Trees EMNLP 2024 1-12
2024 EAGLE: Speculative Sampling Requires Rethinking Feature Uncertainty ICML 2024 1-14
2024 Hydra: Sequentially-Dependent Draft Heads for Medusa Decoding COLM 2024 1-17
2024 MEDUSA: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads ICML 2024 1-27
2024 Recurrent Drafter for Fast Speculative Decoding in Large Language Models arXiv preprint 1-14
2025 EAGLE-3: Scaling up Inference Acceleration of Large Language Models via Training-Time Test NeurIPS 2025 1-20
2025 PARD: Accelerating LLM Inference with Low-Cost Parallel Draft Model Adaptation arXiv preprint 1-18
2026 AngelSpec: Towards Real-World High Performance Inference with Speculative Decoding arXiv preprint 1-26
2026 CURE: Local Uncertainty Repair for Block-Parallel Speculative Decoding arXiv preprint 1-9
2026 DBLast: Dependent Block Drafting for Stochastic Speculative Decoding arXiv preprint 1-12
2026 DeLS-Spec: Decoupled Long-Short Contexts for Parallel Speculative Drafting arXiv preprint 1-17
2026 DFLARE: Scaling Up Draft Capacity for Block Diffusion Speculative Decoding arXiv preprint 1-12
2026 DFlash: Block Diffusion for Flash Speculative Decoding ICML 2026 1-13
2026 Domino: Decoupling Causal Modeling from Autoregressive Drafting in Speculative Decoding arXiv preprint 1-11
2026 DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation arXiv preprint 1-33
2026 From Chains to Trees: Parent-Conditioned Drafting for Semi-Autoregressive Speculative Decoding arXiv preprint 1-18
2026 JetSpec: Breaking the Scaling Ceiling of Speculative Decoding with Parallel Tree Drafting arXiv preprint 1-21
2026 P-EAGLE: Parallel-Drafting EAGLE with Scalable Training arXiv preprint 1-13
2026 TreeFlash: Parallel AR-Approximation for Faster Speculative Decoding arXiv preprint 1-13
2026 xPress: Parallel Refinement for Diffusion Drafters in Speculative Decoding arXiv preprint 1-16