ADSD 精读¶
核心贡献¶
ADSD把拒绝规则的非对称性写进离散prompt-suffix攻击。只有draft对某token给的质量超出target、使 p/q小,才产生拒绝压力;普通KL/disagreement把相反方向也算坏。Soft-Collapse用verifier-aligned smooth surrogate专门推动这类overshoot,同时用target-preservation loss约束原任务输出,之后搜索可读token suffix。
GSM8K代表结果 mean sample time +62.3%而任务质量保持;跨独立drafter、head/tree策略、model/domain也有迁移。它和Mistletoe目标相似但方法重点不同:ADSD显式近似 asymmetric acceptance并输出prompt suffix;Mistletoe以semantic gradient null-space解冲突。
威胁假设包含离线draft/target访问,suffix长度、查询/梯度成本和是否可迁移到黑盒必须单报。lossless输出分布理论上仍是target,攻击只让系统做更多轮;有限样本“质量不变”不等于逐次响应相同。
防御应让scheduler按请求观察expected utility,acceptance collapse时禁用SD/限额,并对异常suffix/τ做rate-limit;训练drafter只提高平均alignment不能保证worst case。复现测time、τ、draft/verify浪费、target-only latency、clean随机suffix和shared-batch P99。原文第 3–5 页威胁/Soft-Collapse,第 5–10 页实验,第 11–15 页补充。
复现攻击时的因果对照¶
攻击优化应固定原 prompt 与目标任务,交替计算 verifier-aligned collapse loss 和 target-preservation loss,再把连续表示投回合法 token suffix;每一步记录 target 输出变化、proposal overshoot 项与预计接受率。要设置等长度随机 suffix、只优化 KL 的 disagreement suffix、只做语义保持的 suffix,以及在 target-only 解码上的同 prompt,才能排除“输入变长或更难”本身造成时延上升。攻击生成时间、所需白盒梯度/查询次数也必须单独报告。
系统测量应同时给被攻击请求自身 TPOT 与同一 continuous batch 中干净请求的 P99,并固定输出 token 数,避免 EOS 改变工作量。防御控制器可根据近期接受长、每轮验证浪费和 no-SD 预测成本触发降级,但需用迟滞避免攻击者制造频繁模式切换。安全结论的边界也要明确:标准 verifier 维持 target 分布,并不消除资源耗尽;相反,精确性保证使这类攻击更隐蔽,因为内容质量监控可能完全正常。