Agent / Computer Use
66 篇论文指向 Agent 从单点任务转向长周期、可恢复、可评测的工作流。
- DTOC: Dynamic Tool Output Compression for Adaptive Context Management in AI Agents 这篇主要讨论记忆、上下文或检索机制,重点是长期任务里的状态管理。
- Qwen-Planner-Agent: A Closed-Loop AI-for-AI Framework for Real-World Mobile Planner Agents 这篇主要关注模型如何操作真实界面,适合从 GUI Agent 和 Computer-use 产品角度阅读。
- An Empirical Study of Automating Agent Evaluation 这篇主要是在定义一个新的评测场景,用来判断 Agent 或模型是否真的能完成真实任务。
- ERPBench: A State-Grounded Evaluation Paradigm for Computer-Use Agents in Enterprise Software 这篇主要是在定义一个新的评测场景,用来判断 Agent 或模型是否真的能完成真实任务。