KVShot:KV Cache 复用与长程 Speculative Decoding 分析
论文: When Hidden States Drift: Can KV Caches Rescue Long-Range Speculative Decoding?
作者: Tianyu Liu, Yuhao Shen, Xinyi Hu, Baolin Zhang, Hengxin Zhang, Jun Dai, Jun Zhang, Shuang Ge, Lei Chen, Yue Li, MingCheng Wan
链接: arXiv 摘要 | PDF
问题背景
Speculative decoding 依赖轻量 drafter 先草拟若干 token,再由 target model 验证。现有 SOTA drafter 多复用 hidden state,但随着 speculative step 变长,draft accuracy 会明显衰减。作者指出,这个衰减不只是 train-inference mismatch,hidden state 本身也会把上下文压缩得过狠,丢掉后续步数仍然需要的信息。
方法
论文提出一个诊断框架 KVShot,系统比较三种复用范式:
- Hidden-only:沿用 EAGLE-3 风格,只复用顶层 hidden state
- KV-only:把 target model 的 KV cache 直接注入 drafter
- Hybrid:同时保留 hidden state 和 KV reuse,再用门控/交叉注意融合
作者的核心假设是:KV cache 比 hidden state 保留了更完整的 token 级上下文,因此更适合长程 drafting;但它能否真正转化成端到端收益,还要看 drafter 能否准确估计未来 query,以及 KV 投影能否拿到足够梯度。
实验结果
1. KV-only 确实改善长程接受率
在 Qwen3-8B 上,KV-only 的长程 retention 优于 hidden-only。线性投影也明显优于 head concatenation,说明问题不只是“把 KV 接进来”,而是要让 drafter 以可学习的方式对齐这些表示。
2. 但短程性能会拖后腿
KV-only 即使在长程上更稳,短程接受率仍落后于 hidden-only 基线。论文给出的一个关键现象是:
| 配置 | 结论 |
|---|---|
| KV-only, 1 层 | 长程更稳,但整体 MAT 仍不如 EAGLE-3 |
| 线性投影 vs head concat | 约 1.83 vs 1.78 MAT |
| KV-only 基线 vs EAGLE-3 | 仍低于 2.37 的 hidden-only 基线,主要输在短程 alpha_0 |
3. hybrid 最好,但收益很小
hybrid drafter 的 step-wise 表现最好,MAT 可到 2.54,高于 EAGLE-3 的 2.37。但端到端评测里,HuggingFace 口径的 MAT 只从 5.01 提到 5.04,同时 drafting latency 增加约 5% - 10%。也就是说,局部指标改善并没有转化成真正的系统级加速。
核心洞察
- hidden state 不是“坏表示”,而是偏向当前 next-token 任务的压缩表示
- KV cache 更完整,但它要求 drafter 自己学会更难的 query 估计
- 当前 autoregressive TTT 管线对 KV 投影和 cross-attention 的梯度太稀疏
- hybrid 中门控很容易塌缩,导致 cross-attention 分支学不起来
我的判断
这篇论文更像一篇诊断论文,而不是已经可落地的加速方案。它真正有价值的地方是把问题从“hidden state 不够好”推进到“当前训练范式不匹配 KV-aware decoding”。
如果要继续往前走,作者暗示的方向不是继续微调 TTT,而是 block-wise training 一类更适合 KV reuse 的训练范式。