Agent / Computer Use
92 篇论文指向 Agent 从单点任务转向长周期、可恢复、可评测的工作流。
- FinCUABuild: Can Agents Build Reliable Benchmarks for Dynamic Financial Computer Use? 这篇主要是在定义一个新的评测场景,用来判断 Agent 或模型是否真的能完成真实任务。
- DAREBench: Deployment-Aware and Reliable Evaluation of Models as Agents 这篇主要是在定义一个新的评测场景,用来判断 Agent 或模型是否真的能完成真实任务。
- HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration 这篇论文需要先从标题和摘要判断它对应的任务场景、系统结构和产品迁移价值。
- ParaRecover: A Process-Level Benchmark for Error Localization and Recovery in Parallel Tool-Use Agents 这篇主要是在定义一个新的评测场景,用来判断 Agent 或模型是否真的能完成真实任务。