How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks
中文这篇主要是在定义一个新的评测场景,用来判断 Agent 或模型是否真的能完成真实任务。
这类论文的重点通常不是榜单名次,而是它把什么真实任务定义成了可复现、可比较、可失败复盘的测试场。
查看判断依据Signal 85
How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks 的核心信号是 Agent 能力正在系统化,而不是停留在单次任务表现。
命中高价值主题: agent; 评分证据: reelos_relevance, product_transfer, technical_novelty, evidence_quality, content_value