ML 日报 2026-05-13

arXiv 每日精选,覆盖 cs.LG / cs.CL / cs.AI。

精选论文

1. ARTIST: Agentic Reasoning and Tool Integration for LLMs via Reinforcement Learning

作者: (arXiv:2505.01441) | 分类: cs.LG | arXiv

提出 ARTIST 框架,让 LLM 通过 outcome-based RL 自主学习何时、如何调用工具。模型在多轮推理链中自行决定工具调用策略,无需人工设计调用规则。实验表明 agentic RL 训练能同时提升推理深度和工具使用有效性。


2. Token-level Tool-use Preference Alignment Training Framework

作者: (arXiv:2505.20016) | 分类: cs.CL | arXiv

将工具使用的偏好对齐从轨迹级细化到 token 级,配合细粒度评估指标。解决了传统 RLHF 在工具调用场景中奖励信号过于稀疏的问题,让模型更精确地学习工具调用的时机和参数选择。


3. Accelerating Diffusion Language Model Inference via Efficient KV Caching and Guided Diffusion

作者: (arXiv:2505.21467) | 分类: cs.LG | arXiv

针对扩散语言模型(DLM)提出 FreeCache:跨去噪步骤复用稳定的 KV 投影,大幅降低推理计算量。这是将 KV cache 优化思路从自回归模型迁移到扩散模型的首批工作之一,对并行生成范式的实用化有重要意义。


4. Learning to Reason without External Rewards

作者: (arXiv:2505.19590) | 分类: cs.LG | arXiv

探索不依赖外部奖励信号的推理能力训练。结合内在信号和自博弈(self-play)优化 LLM,绕过 RLHF/RLVR 对人工标注或可验证答案的依赖。为开放域推理任务的训练提供了新思路。


5. The Cache for Diffusion Language Models (dKV-Cache)

作者: (arXiv:2505.15781) | 分类: cs.LG | arXiv

提出 dKV-Cache-Decode,为扩散语言模型设计专用缓存机制。在长序列上不仅加速推理,还意外提升了生成质量——说明现有 DLM 在推理时未充分利用上下文信息,缓存反而起到了正则化作用。


6. Memory-efficient KV-cache Management for Long-Sequence LLMs

作者: (arXiv:2604.10539) | 分类: cs.LG | arXiv

解决长序列推理中 KV cache 内存线性增长的瓶颈。提出新的内存管理策略,在保持生成质量的前提下显著降低显存占用,使长上下文推理在消费级 GPU 上更可行。


7. Dynamic Semantic Compression (DySCo) Framework

作者: (cs.LG new) | 分类: cs.LG | arXiv

提出动态语义压缩框架,用熵引导的动态采样替代固定启发式方法。根据内容信息密度自适应调整压缩率,在推理效率和信息保留之间取得更好平衡。


8. Agentic Tool Use in Large Language Models

作者: (arXiv:2604.00835) | 分类: cs.AI | arXiv

系统性综述 LLM 作为自主 Agent 时的工具使用能力。分析了信息检索、计算和外部动作三类工具的可靠性问题,指出当前部署中工具调用失败的主要模式和改进方向。


9. Automatic Scaling of Tool-Use Capabilities in RL via Decoupled Entropy Constraints

作者: (arXiv:2603.13348) | 分类: cs.LG | arXiv

通过解耦熵约束自动扩展 RL 中的工具使用能力。解决了 RL 训练工具调用时探索-利用平衡的难题,让模型在不同复杂度的任务上自适应调整工具调用的多样性。


10. KV Cache Optimization Strategies for Scalable and Efficient LLM Inference

作者: (arXiv:2603.20397) | 分类: cs.LG | arXiv

综述性工作,系统梳理 KV cache 优化的主要策略:量化、稀疏化、驱逐策略、分层管理等。为从业者选择适合自身场景的 KV cache 方案提供了清晰的决策框架。


AI Assistant
Selected Text