ML 日报 2026-05-16
arXiv 每日精选,覆盖 cs.LG / cs.CL / cs.AI。
精选论文
1. Self-Pruned Key-Value Attention: Learning When to Write by Predicting Future Utility
作者: Gergely Szilvasy, Manuel Faysse, Maria Lomeli, Matthijs Douze et al. | 分类: cs.LG | arXiv
提出 SP-KV,在写入 KV cache 时通过轻量 utility predictor 预测每个 KV pair 的未来使用价值,低价值的直接丢弃不写入长期缓存。与事后淘汰策略不同,这是"写入时剪枝"的新范式,在 agentic 长序列场景下能从源头控制 KV cache 增长,同时保持生成质量。
2. Mistletoe: Stealthy Acceleration-Collapse Attacks on Speculative Decoding
作者: Shuoyang Sun, Chang Da, Hao Fang, Kuofeng Gao et al. | 分类: cs.CL | arXiv
发现 speculative decoding 的新安全漏洞:攻击者可以微调 drafter 使其在特定触发条件下大幅降低 acceptance rate,导致推理加速失效甚至比普通解码更慢。攻击隐蔽性强(不影响输出质量,只破坏速度),对依赖 SD 的生产系统构成实际威胁。
3. PreFT: Prefill-only Finetuning for Efficient Inference
作者: Andrew Lanpouthakoun, Aryaman Arora, Zhengxuan Wu, Dhruv Pai et al. | 分类: cs.LG | arXiv
观察到 PEFT adapter 在 prefill 和 decode 阶段的吞吐量差异巨大,提出只在 prefill 阶段应用 adapter、decode 阶段回退到基础模型的策略。这样多用户各自的 adapter 只在 prefill 时加载,decode 共享同一模型,大幅提升多租户 serving 吞吐量,同时保持个性化效果。
4. EndPrompt: Efficient Long-Context Extension via Terminal Anchoring
作者: Han Tian, Luxuan Chen, Xinran Chen, Rui Kong et al. | 分类: cs.CL | arXiv
提出无需在目标长度序列上训练即可扩展上下文窗口的方法。核心洞察:让模型接触长距离相对位置编码不需要构造完整长序列,只需在短序列末尾锚定远距离位置信息。训练成本从二次方降为线性,使长上下文适配变得廉价且可复现。
5. EvolveMem: Self-Evolving Memory Architecture via AutoResearch for LLM Agents
作者: Jiaqi Liu, Xinyu Ye, Peng Xia, Zeyu Zheng et al. | 分类: cs.LG | arXiv
指出现有 agent 记忆系统只进化存储内容、不进化检索机制的根本缺陷。EvolveMem 让 scoring function、fusion strategy 和 answer-generation policy 随使用经验共同进化。通过 AutoResearch 框架自动发现更优的记忆检索策略,实现记忆系统的"元学习"。
6. Latency-Quality Routing for Functionally Equivalent Tools in LLM Agents
作者: Kexin Chu, Dawei Xiang, Wei Zhang | 分类: cs.LG | arXiv
解决 agent 系统中同类工具多 provider 的路由问题(如多个搜索 API、多个 LLM 后端)。提出 LQM-ContextRoute,一个 contextual bandit router,在无 gold label 的部署环境下平衡延迟、可靠性和回答质量。将工具选择从静态配置提升为动态自适应决策。
7. How to Scale Mixture-of-Experts: From muP to the Maximally Scale-Stable Parameterization
作者: Leena Chennuru Vankadara, Moritz Haas, Luke Hayward, Sebastian Bordt et al. | 分类: cs.LG | arXiv
首次系统分析 MoE 架构中超参数如何随宽度 N、专家宽度 N_e、专家数 M、稀疏度 K、深度 L 缩放。从 muP 理论出发推导出"最大规模稳定参数化",为 frontier MoE 模型(如 DeepSeek-V3 类架构)的超参迁移提供理论基础,解决了 MoE 从小规模实验到大规模训练的 hyperparameter transfer 难题。
8. Diagnosing Training-Inference Mismatch in LLM Reinforcement Learning
作者: Tianle Zhong, Neiwen Ling, Yifan Pi, Zijun Wei et al. | 分类: cs.LG | arXiv
揭示 LLM RL 系统中 rollout 生成与 policy 优化阶段的数值不一致问题(TIM)。构建零失配诊断环境 VeXact,证明即使微小的 token 级概率偏差也能独立导致训练不稳定。这对所有分离 rollout/training 的 RL 框架(如 GRPO、PPO with vLLM)都有实践警示意义。
9. Beyond Mode-Seeking RL: Trajectory-Balance Post-Training for Diffusion Language Models
作者: Saba Ahmadi, Prasanna Parthasarathi, Yufei Cui | 分类: cs.LG | arXiv
识别扩散语言模型 RL 后训练的核心失败模式"trajectory locking":奖励驱动更新将概率质量过度集中到少数去噪路径上。提出 TraFL(Trajectory Flow Balancing),用流平衡目标替代纯奖励最大化,保持对多个正确解的覆盖。对扩散 LM 的 RLHF 后训练具有方法论意义。
10. LLMs Know When They Know, but Do Not Act on It: A Metacognitive Harness for Test-time Scaling
作者: Qi Cao, Yufan Wang, Peijia Qin, Shuhao Zhang et al. | 分类: cs.LG | arXiv
发现 LLM 具备潜在的元认知能力(能估计自己是否会答对),但这些信号通常被孤立测量而非用于控制推理。提出将元认知信号转化为 test-time 计算分配的控制器:模型"知道自己不知道"时分配更多计算,"知道自己知道"时快速输出。将 test-time scaling 从盲目扩展变为自适应分配。