ReelOS.ai Weekly Research Radar
2026-09-15 weekly brief

Weekly
Research Radar

本周最强信号集中在 Agent / Computer Use:不是单篇论文突破,而是一组论文同时把任务、评测和系统边界推清楚。

按主题聚合本周论文信号,识别 Agent、AI Coding、多模态和评测范式里的方向变化。

7/7数据覆盖
122有效信号

本周主题聚类

先看哪些论文正在同一个方向上形成簇,而不是把每篇论文平铺成同等强度的条目。

4 themes
01 92 papers

Agent / Computer Use

92 篇论文指向 Agent 从单点任务转向长周期、可恢复、可评测的工作流。

02 21 papers

多模态 / Robotics / World Model

21 篇论文连接视觉、动作、空间和具身任务,适合观察世界模型产品化。

03 7 papers

评测 / 架构 / Context

7 篇论文提供评测、框架或系统结构信号,适合转成产品架构判断。

04 2 papers

AI Coding

2 篇论文围绕软件工程 Agent,重点从代码生成推进到环境、测试、调试和轨迹学习。

本周代表论文

用表格保留检索效率,只展示最值得进入人工复核或深度拆解的代表样本。

10 papers
论文领域分数中文判断
FinCUABuild: Can Agents Build Reliable Benchmarks for Dynamic Financial Computer Use?

这篇主要是在定义一个新的评测场景,用来判断 Agent 或模型是否真的能完成真实任务。

GUI Agent 84 接近主信号:用来让 Agent 看懂并操作电脑或手机界面,减少长流程中的偏航。
DAREBench: Deployment-Aware and Reliable Evaluation of Models as Agents

这篇主要是在定义一个新的评测场景,用来判断 Agent 或模型是否真的能完成真实任务。

多模态 82 接近主信号:用来评测 Agent 或模型在真实任务中的完成度、稳定性和可靠性。
AdaVLA: Adaptive Step Flow Matching for Training-free Acceleration of Vision-Language-Action Models

这篇主要面向多模态、空间理解或具身任务,适合关注世界模型和可执行动作链。

具身智能 81 接近主信号:用来连接视觉理解与动作执行,支持机器人和具身 Agent。
HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration

这篇论文需要先从标题和摘要判断它对应的任务场景、系统结构和产品迁移价值。

多模态 80 接近主信号:用来理解图像、视频和空间信息,支持多模态产品与工作流。
ParaRecover: A Process-Level Benchmark for Error Localization and Recovery in Parallel Tool-Use Agents

这篇主要是在定义一个新的评测场景,用来判断 Agent 或模型是否真的能完成真实任务。

Agent 评测 76 接近主信号:用来让多 Agent 自动恢复、重建并验证复杂的软件运行环境。
BlueLM-GUI Technical Report: A Real-Device-Centric Flywheel for Self-Improving Mobile GUI Agents

这篇主要关注模型如何操作真实界面,适合从 GUI Agent 和 Computer-use 产品角度阅读。

GUI Agent 76 接近主信号:用来让 Agent 看懂并操作电脑或手机界面,减少长流程中的偏航。
ProMediConv: Benchmarking Proactive Conversational Agents in Legal Dispute Mediation

这篇论文需要先从标题和摘要判断它对应的任务场景、系统结构和产品迁移价值。

Agent 评测 76 接近主信号:用来评测 Agent 或模型在真实任务中的完成度、稳定性和可靠性。
Harbor Adapters and Harbor-Index: Infrastructure and a Curated Meta-Dataset for Large-Scale Agentic Evaluation

这篇主要是在定义一个新的评测场景,用来判断 Agent 或模型是否真的能完成真实任务。

Agent 评测 75 接近主信号:用来评测 Agent 或模型在真实任务中的完成度、稳定性和可靠性。
HaWMPO: Hallucination-Aware World Model-based Policy Optimization for Generalist Robot Policy

这篇主要面向多模态、空间理解或具身任务,适合关注世界模型和可执行动作链。

具身智能 75 接近主信号:用来连接视觉理解与动作执行,支持机器人和具身 Agent。
MAVEN-T: Reinforced Heterogeneous Distillation for Real-Time Multi-Agent Trajectory Prediction

这篇论文需要先从标题和摘要判断它对应的任务场景、系统结构和产品迁移价值。

多模态 75 接近主信号:用来理解图像、视频和空间信息,支持多模态产品与工作流。