ML 日报 2026-05-15

arXiv 每日精选,覆盖 cs.LG / cs.CL / cs.AI。

精选论文

1. An Interpretable Latency Model for Speculative Decoding in LLM Serving

作者: Linghao Kong, Megan Flynn, Michael Peng, Nir Shavit, Mark Kurtz et al. | 分类: cs.LG | arXiv

用 Little's Law 推导出 speculative decoding 在真实服务系统中的延迟解析模型,将请求延迟分解为负载无关/负载相关的 prefill、drafting、verification 三部分。解释了为什么 SD 加速比在高负载下衰减,并扩展到 MoE 模型的稀疏激活场景。对生产环境配置 SD 参数(draft length、acceptance rate、drafter 大小)有直接指导意义。


2. Performance-Driven Policy Optimization for Speculative Decoding with Adaptive Windowing

作者: Jie Jiang, Xing Sun | 分类: cs.CL | arXiv

提出 PPOW,将 drafter 的优化目标从 token 级模仿学习提升到 window 级强化学习。核心思路:用 cost-aware speedup reward 和 divergence-aware windowing 让 drafter 学会在"难 draft"位置自适应调整窗口。实测平均接受长度达 6.3-6.5,加速比 3.4-4.4x,显著优于传统 SFT drafter。


3. XFP: Quality-Targeted Adaptive Codebook Quantization with Sparse Outlier Separation

作者: Thomas Witt | 分类: cs.LG | arXiv

反转量化工作流:用户指定重建质量下限(cosine similarity),XFP 自动决定 codebook 大小和 outlier 预算,无需 Hessian 或校准数据。在 Qwen3.5-122B-A10B 上达到 138 tok/s(RTX PRO 6000 Blackwell, TP=2),比 Marlin INT4 快 49%,GSM8K 94.49%。对 397B MoE 模型也能在 2x96GB 内以 ~3.4 bit 运行。


4. A Hardware-Aware, Per-Layer Methodology for Post-Training Quantization of LLMs

作者: Earl Killian | 分类: cs.LG | arXiv

提出 Scaled Outer Product (SOP) 方法,结合固定/动态 codebook 对、per-block 选择位、activation-weighted cosine 选择和 knapsack 敏感层提升。关键发现:在 6.5 bpw 下(E2M3sUE4M4),重建误差低于传统 per-layer FP8(8.0 bpw),存储节省 1.5 bpw。提出新的硬件高效 LUT 输出格式 HIF。


5. Widening the Gap: Exploiting LLM Quantization via Outlier Injection

作者: Xiaohua Zhan, Kazuki Egashira, Robin Staab, Mark Vero, Martin Vechev | 分类: cs.LG | arXiv

首个能攻破 AWQ、GPTQ、GGUF I-quants 等主流量化方案的条件攻击。原理:注入大 outlier 使同 block 其他权重被 round to zero,从而在全精度下表现正常、量化后触发恶意行为。对量化模型的供应链安全敲响警钟——下载量化模型前需验证全精度源的完整性。


作者: Sahil Sen, Akhil Kasturi, Elias Lumer, Anmol Gulati, Vamse Kumar Subbiah | 分类: cs.CL | arXiv

系统比较 grep vs. vector retrieval 在不同 agent harness(Claude Code、Codex、Gemini CLI 等)下的表现。结论:grep 在多数场景下准确率更高,但整体分数强烈依赖 harness 架构和 tool-calling 风格。揭示了 agent 系统中检索策略与执行框架的交互效应,对 RAG agent 设计有实践参考价值。


7. Concurrency without Model Changes: Future-based Asynchronous Function Calling for LLMs

作者: Guangyu Feng, Huanzhi Mao, Prabal Dutta, Joseph E. Gonzalez | 分类: cs.CL | arXiv

提出 AsyncFC,纯执行层框架,让 LLM 解码与函数执行并行、函数间也可并行,无需微调或修改模型。关键发现:LLM 天然具备对 symbolic futures(未解析执行结果的占位符)进行推理的能力。在标准 function-calling benchmark 上显著降低端到端延迟,同时保持准确率。


8. Self-Distilled Agentic Reinforcement Learning

作者: Zhengxi Lu, Zhiyuan Yao, Zhuowen Han, Zi-Han Wang, Jinyang Wu et al. | 分类: cs.LG | arXiv

将 on-policy self-distillation 作为 gated 辅助目标嵌入 RL 主干,解决多轮 agent 训练中 OPSD 的不稳定性。通过 sigmoid gate 在 teacher-endorsed token 上加强蒸馏、在 negative rejection 上软衰减。在 ALFWorld/WebShop/Search-QA 上比 GRPO 提升 7-10%,避免了 naive GRPO+OPSD 的训练崩溃。


9. TFGN: Task-Free, Replay-Free Continual Pre-Training Without Catastrophic Forgetting at LLM Scale

作者: Anurup Ganguli | 分类: cs.LG | arXiv

首个在 LLM 规模(最大 9B)实现无 replay、无 task ID 的持续预训练架构。核心是 Read/Write 分解:前向传播全密集,跨域参数更新结构化保证不写入先前域子空间。6 个异构域训练后 backward transfer 仅 -0.007,且 Python 训练能让 JavaScript PPL 下降 26.8%(正向迁移)。


10. MeMo: Memory as a Model

作者: Ryan Wei Heng Quek, Sanghyuk Lee, Alfred Wei Lun Leong, Arun Verma, Alok Prakash et al. | 分类: cs.CL | arXiv

将新知识编码为独立的 memory model,LLM 参数完全不变。优势:捕获跨文档关系、对检索噪声鲁棒、无灾难性遗忘、不需要 LLM 权重/logits 访问(兼容闭源模型)、推理时检索成本与语料规模无关。在 BrowseComp-Plus、NarrativeQA、MuSiQue 上表现优于现有方法。

AI Assistant
Selected Text