ReelOS.ai Weekly Research Radar
2026-08-31 weekly brief

Weekly
Research Radar

本周最强信号集中在 Agent / Computer Use:不是单篇论文突破,而是一组论文同时把任务、评测和系统边界推清楚。

按主题聚合本周论文信号,识别 Agent、AI Coding、多模态和评测范式里的方向变化。

7/7数据覆盖
162有效信号

本周主题聚类

先看哪些论文正在同一个方向上形成簇,而不是把每篇论文平铺成同等强度的条目。

4 themes
01 125 papers

Agent / Computer Use

125 篇论文指向 Agent 从单点任务转向长周期、可恢复、可评测的工作流。

02 25 papers

多模态 / Robotics / World Model

25 篇论文连接视觉、动作、空间和具身任务,适合观察世界模型产品化。

03 7 papers

AI Coding

7 篇论文围绕软件工程 Agent,重点从代码生成推进到环境、测试、调试和轨迹学习。

04 5 papers

评测 / 架构 / Context

5 篇论文提供评测、框架或系统结构信号,适合转成产品架构判断。

本周代表论文

用表格保留检索效率,只展示最值得进入人工复核或深度拆解的代表样本。

10 papers
论文领域分数中文判断
How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks

这篇主要是在定义一个新的评测场景,用来判断 Agent 或模型是否真的能完成真实任务。

Agent 评测 85 接近主信号:用来评测 Agent 或模型在真实任务中的完成度、稳定性和可靠性。
Tool-Making and Self-Evolving LLM Agents in Low-Latency Systems

这篇论文需要先从标题和摘要判断它对应的任务场景、系统结构和产品迁移价值。

Agent 84 接近主信号:用来把复杂任务拆成 Agent 可执行、可检查、可恢复的工作流。
A Contract-Centered Architecture for Scalable and Manageable Agentic Runtimes

这篇论文需要先从标题和摘要判断它对应的任务场景、系统结构和产品迁移价值。

Agent 82 接近主信号:用来把复杂任务拆成 Agent 可执行、可检查、可恢复的工作流。
Counter with Evidence! A Multi-Agent Memory Efficient Reasoning Framework for Hate Category Informed Counterspeech Generation

这篇主要讨论记忆、上下文或检索机制,重点是长期任务里的状态管理。

Agent 80 接近主信号:用来提升 Agent 长任务中的记忆、上下文和状态管理能力。
ForeTime-VLA: Causal Future-Token Distillation from a World Action Model for Conveyor-Belt Manipulation

这篇主要面向多模态、空间理解或具身任务,适合关注世界模型和可执行动作链。

具身智能 78 接近主信号:用来连接视觉理解与动作执行,支持机器人和具身 Agent。
LLM4LLM: Bridging Kernel Benchmarks and Real Deployment via Closed-Loop Agentic Optimization

这篇主要是在定义一个新的评测场景,用来判断 Agent 或模型是否真的能完成真实任务。

Agent 评测 78 接近主信号:用来评测 Agent 或模型在真实任务中的完成度、稳定性和可靠性。
Agentic AI Containment Architecture for Security Hardening

这篇论文需要先从标题和摘要判断它对应的任务场景、系统结构和产品迁移价值。

AI 安全 77 接近主信号:用来把复杂任务拆成 Agent 可执行、可检查、可恢复的工作流。
DuMateBench: Evaluating Autonomous Agents in Complex Real-World Workflows

这篇论文需要先从标题和摘要判断它对应的任务场景、系统结构和产品迁移价值。

Agent 评测 77 接近主信号:用来评测 Agent 或模型在真实任务中的完成度、稳定性和可靠性。
InjecMEM: Memory Injection Attack on LLM Agent Memory Systems

这篇主要讨论记忆、上下文或检索机制,重点是长期任务里的状态管理。

AI 安全 77 接近主信号:用来提升 Agent 长任务中的记忆、上下文和状态管理能力。
Retrieval-Augmented Agentic Rubric Generation for Reliable Medical Response Evaluation

这篇主要是在定义一个新的评测场景,用来判断 Agent 或模型是否真的能完成真实任务。

医疗 AI 76 接近主信号:用来整合医疗影像与临床信息,辅助医学理解、解释和评估。