Agent / Computer Use
125 篇论文指向 Agent 从单点任务转向长周期、可恢复、可评测的工作流。
- How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks 这篇主要是在定义一个新的评测场景,用来判断 Agent 或模型是否真的能完成真实任务。
- Tool-Making and Self-Evolving LLM Agents in Low-Latency Systems 这篇论文需要先从标题和摘要判断它对应的任务场景、系统结构和产品迁移价值。
- A Contract-Centered Architecture for Scalable and Manageable Agentic Runtimes 这篇论文需要先从标题和摘要判断它对应的任务场景、系统结构和产品迁移价值。
- Counter with Evidence! A Multi-Agent Memory Efficient Reasoning Framework for Hate Category Informed Counterspeech Generation 这篇主要讨论记忆、上下文或检索机制,重点是长期任务里的状态管理。