PARD 精读¶
一句话定位¶
PARD 把模型家族中最小的自回归模型低成本改造成 一次前向并行预测多个未来位置 的 drafter,并让同一个 drafter 服务该家族的多个 target 尺寸。它以 Conditional Drop-token(COD)降低 Mask-Predict 训练冗余,在 vLLM 上最高 3.67×、264.88 token/s,并在部分配置超过 EAGLE-3。
1. 两个目标:少训练、少 draft 前向¶
EAGLE 类每个 target checkpoint 都需专属 feature adapter,且生成一段草稿仍有多次小模型前向。PARD 的两个假设是:同家族不同规模模型共享 tokenizer、数据谱系和语言偏好,小成员可作统一 proposal;并行 masked prediction 虽不显式建模未来 token 间依赖,但一次前向和恒定权重读取可弥补接受率损失。
这里的 target-independent 必须准确理解为“在一个模型 family 内不依赖具体 target size”。换 tokenizer、架构或训练分布并没有通用保证。
2. Parallel Draft / Mask-Predict¶
给已确认 prefix 在尾部接 K 个相同 mask token。位置 n+k 在只看到 prefix 与按规则可见的 masks 时预测 x_{n+k},所有未来位置一次计算:
q_k(x_{n+k} | x_<n, m_0,…,m_{K-1})。
由于各未来 token 不互相条件化,输出是一段 parallel draft,再交给目标模型块验证。共享 mask embedding 优于给每个 horizon 单独 token;推理 K 可大于训练 K,论文发现 K_train≥8 后较稳定、K_infer≈12 常较好。
3. Conditional Drop-token 为什么省训练¶
朴素训练要为每个预测 horizon 复制完整 prefix/KV,约 K×N token 计算。COD 以任务/位置为单位递减保留样本:第 i 个未来任务保留比例约 r^(i-1),但保留时保证其 prefix KV 状态完整;并设下限 r_min 防止远端任务饿死。总计算可控制在约 N/(1-r) 而非 KN。默认 K_train=8, r=0.7, r_min=0.2,论文报告相对传统 masked 训练约 3× 效率,并按每百万样本 PFLOPs 声称比 EAGLE/EAGLE-3 适配约 7×/10× 高效。这个比较受模型、数据量和收敛目标影响,应视为作者口径而非纯算法常数。
4. 实验结果¶
训练使用 8×MI250X、约 4 epochs,推理在 A100 40GB/vLLM,覆盖 LLaMA、Qwen、DeepSeek 家族。代表性结果:LLaMA3.1-8B 六任务均值 PARD 约 219.15 token/s、3.00×,EAGLE-3 193.86、2.65×;HumanEval PARD 264.88、3.63×。LLaMA3.3-70B 均值约 84.29、3.49×,EAGLE-3 77.88、3.22×,但 SpecBench 上 PARD 57.41、2.40× 低于 EAGLE-3 63.14、2.64×,说明不是全面占优。Qwen2.5-14B 均值约 3.71×。
作者按 horizon 报告 HumanEval/GSM8K 接受:PARD 第 1 位约 .93/.88、第 4 位 .90/.85,EAGLE-3 相应约 .87/.82 与 .85/.79。draft 权重带宽随 K=4/6/8 基本恒定约 2.48GB,而 EAGLE/EAGLE-3 的递归前向约 5.94/8.90/11.88GB。这是并行草稿的核心系统优势。大 batch 仍有约 1.33–3.63×,但瓶颈逐渐转向算力和验证块大小。
5. 正确性与实现¶
PARD 提供候选,不替代 verifier。greedy 下逐位比对目标 argmax可保持目标序列;随机采样若要严格保持分布,必须有可定义的 proposal 概率并执行标准 residual rejection。由于并行各位置给的是不同条件边缘,不能未经推导就把概率乘积当作普通自回归 q;论文系统实现与“lossless”主张的具体 verifier 应逐代码核查。
复现步骤是:选择家族最小模型,加入 mask token/attention 规则;用 COD 构造多 horizon labels;训练后一次生成 K logits;目标模型块前向校验并裁 KV。必须报告 family 边界、训练 token/PFLOPs、K、mask 规则、acceptance、draft/verify 带宽以及 vLLM 版本。
6. 局限与研究问题¶
- 并行 marginal prediction 缺少候选内因果依赖,在高熵开放生成中可能快速失配。
- family reuse 依赖共享 tokenizer 与训练偏好,跨微调/跨语言的鲁棒性未知。
- COD 是有偏抽样/任务重加权,远 horizon 的有效数据量和校准需单独检查。
- 值得研究并行 proposal 的严格分布校正、parallel/AR 混合块、跨家族 tokenizer 映射,以及以总服务成本而非单请求速度训练 drafter。
原文第 2–6 页为 PARD/COD,第 6–12 页为实验、效率和消融,第 13–18 页给训练设置及补充表格。