AI DAILY / 2026-09-16
机器人操作智能体资源汇总
kairunwen/Awesome-Robot-Use-Agent
全文中文翻译 · AI 生成,仅供学习交流
kairunwen/Awesome-Robot-Use-Agent
在物理世界中,机器人智能体(robot-use agent)通过可用的技能以及感知/控制接口,把机器人作为工具来使用。它利用观测数据和执行反馈来评估进度、调整计划,并在失败时尝试恢复。
本文是一份精心整理的资源合集,涵盖机器人智能体相关的文章、论文、开源项目、社区演示(demo)和基准(benchmark)。你可以在这里了解 AI 智能体如何连接机器人、使用感知和控制工具、生成可执行代码,并从执行反馈中学习,从而在仿真环境与真实物理世界中完成任务。
目录
- 入门
- 文章
- 论文
- 综述
- 方法与框架
- 数据集论文
- 基准
- 项目
- 开源
- 系统与框架
- 环境与沙箱
- 工具与实用程序
- 社区演示
- 数据集
- 基准
- 🤝 贡献
- 引用
入门
- 理解:从《机器人智能体(Robot-Use Agents)》和综述部分开始,获得整体概览。
- 探索:在"方法与框架"中了解各种方案。
- 构建:在"系统与框架""工具与实用程序"以及"环境与沙箱"中寻找适合你项目的资源。
- 评估:浏览"基准"来评估机器人智能体的能力。
- 观看:浏览来自 X / RedNote 的社区演示,建议在原网站上查看以获得最佳体验。
文章
Robot-Use Agents — Phillip Isola · 2026-09-07 · 视角文章。讨论通用 AI 智能体如何通过传感器与执行器 API 使用机器人,并探讨部署、延迟与可靠性问题。
作者发布;讨论了包括 Claude 在内的智能体。
Claude plays robotics — Anthropic · 2026-07-09 · 研究文章。比较了直接运动指令、生成控制器、预训练策略监督与强化学习(RL)训练在控制、运动(locomotion)和操作(manipulation)任务中的表现。作者报告的结果显示,机器人本体形态(embodiment)与控制接口会显著影响性能。直接控制的仿真在模型调用之间会有停顿;物理 Go2 探索实验应与仿真基准结果区分开来。
Introducing Auto Engineering for Robotics — General Robotics · 2026-09-09 · 研究博客。介绍了 GRID 面向机器人集成、仿真、技能创建与部署评估的智能体驱动工作流。展示了实验室中的操作任务,并描述了执行反馈如何帮助智能体诊断故障、修复组件,以及积累可复用的技能与工程知识。
Introducing Waddle: agents that control robots — Waddle Labs · 2026-07 · 研究博客。描述了能够观察摄像头画面、生成机器人控制程序并以动作模型为工具进行调用的智能体。展示了任务分解、结果验证、重规划(replanning)和多智能体协作的真实机器人演示,智能体之间还共享可复用的技能。
NVIDIA brings agents to life with DGX Spark and Reachy Mini — Hugging Face & NVIDIA · 2026-01-05 · 技术教程。将 Nemotron 推理与视觉模型、NeMo Agent Toolkit 和 Pipecat 连接到 Reachy Mini,实现语音、摄像头输入和机器人行为。介绍了用于硬件或仿真的 ReAct 工具调用与 Python 接口;重点是一款桌面交互式机器人,而非通用操作(manipulation)。
Gemini Robotics ER 2 — Google DeepMind · 模型概览。描述了面向多步规划、工具使用、成功率追踪与多机器人协作的具身推理(embodied reasoning)。ER 2 提供高层决策,而与之相连的 VLA 负责运动执行;该页面展示了开发者报告的能力与评估结果。
论文
论文引用按其贡献分组。除特别说明外,日期均指首次在 arXiv 发布的时间。方法摘要反映的是作者报告;代码、权重与完整复现则是独立的发布声明。交叉链接将论文与相关的实现和基准关联起来;资源计数反映的是目录条目数,包括这些独立条目。
综述
Survey on Multimodal Embodied Agents: A Unified Capability-centric Perspective from Computer-Use to Robot-Use — 2026-09-10 · ArXiv 2026。通过 PAPAV 框架,即感知(Perceive)、预测(Anticipate)、规划(Plan)、执行(Act)和验证(Verify),将计算机使用与机器人使用纳入统一视角;审视了物理约束与基准覆盖度。
A Survey on Agentic Multimodal Large Language Models — 2025-10-13 · ArXiv 2025。范围更广的多模态智能体综述,涵盖推理、反思、记忆、工具调用以及与物理环境(包括具身 AI 应用)的交互。
Towards Embodied Agentic AI: Review and Classification of LLM- and VLM-Driven Robot Autonomy and Interaction — 2025-08-07 · ArXiv 2025。对 LLM/VLM 智能体如何与机器人 API、ROS 中间件和编排框架集成进行分类;涵盖规划、工具调用、智能体角色以及实用的机器人工具包。
A Survey on Integration of Large Language Models with Intelligent Robots — 2024-04-14 · Intelligent Service Robotics 2024。LLM 在通信、感知、规划与控制中的集成。
方法与框架
Show-Harness: Just a VLM Agent Can Play Robots — 2026-09-09 · ArXiv 2026。VLM 通过机器人专属的解释器选择离散的、递增的动作单元。
*Details & sources* 包含规划、动作历史与恢复插件、GUMI 演示集以及微调工具。Franka/Piper 与仿真器适配器需要文档化的依赖与站点配置。
Zetta ζ: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence — 2026-08-17 · ArXiv 2026。在基础策略冻结的同时,通过执行、诊断和门控更新来训练运行时评论器与恢复技能。
SHAPER: Self-Evolving Embodied Agents via Skill-Harness Evolution — 2026-08-11 · ArXiv 2026。在模型参数冻结的同时,从目标环境的 rollout 中演化出可复用的技能和上下文代码框架(harness)。
*Details & sources* 在 VLABench 和 ESI-Bench 上评估,使用不同的动作接口。在不训练模型的前提下提升了外部技能和执行上下文。
Mimir: A Neuro-Symbolic Memory System with Dynamic Grounding for Embodied Agents in Interactive Environments — 2026-08-05 · ArXiv 2026。将世界记忆与任务记忆分离,在每次动作之前,将当前目标锚定到回忆起的物体、状态和证据上。
*Details & sources* 记忆模块在 EB-ALFRED 和 EB-Habitat 仿真环境中进行评估。
ETA: A New Agentic Paradigm for Embodied Tasks — 2026-08-04 · ArXiv 2026。规划器每次选择一个工具调用,通过统一接口执行,并利用最新的观测与结果修订规划、积累经验。
*Details & sources* OpenETA 提供可替换的规划器、工具与技能、记忆、可重放的轨迹以及仿真/真实机器人接口。硬件执行需要相应的适配器与配置。
Thea — Towards the Harness of Embodied Agents — 2026-08-03 · ArXiv 2026。把机器人能力包装成可调用的工具,维护符号化的场景上下文,并评估动作终止、成功率与失败原因。
*Details & sources* 公开了运行时与接口;机器人/仿真器的部署需要具体的适配器与能力定义。
You Don't Need To Stay in The Loop: An Agentic Robotics Loop for Robot-Policy Improvement (AgenticRobotics) — 2026-08-02 · ArXiv 2026。一个 LLM 控制器协调训练、评估与策略改进 worker,并记录工具调用、进行证据门控的提升和可恢复的执行状态。
*Details & sources* 报告预览重点关注误提升控制与运行可靠性;在所测谱系上,它并未展示出比人工更好的检查点选择能力。
Addressing the Orchestration Gap in Generalist Robots via Physical Agency — 2026-07-23 · ArXiv 2026。一个闭环编排器分解目标,选择冻结的 VLA 策略或参数化技能,从观测中验证结果,并从失败中恢复。
*Details & sources* 在 LIBERO-PRO 和真实机器人操作任务上评估,无需额外的策略训练。包含仿真和 Franka FR3 编排器;执行需要单独配置的感知、规划、策略服务器和机器人接口。
RoboHarness: Memory-Driven Orchestration of Heterogeneous Robot Policies for Long-Horizon Planning — 2026-07-20 · ArXiv 2026。利用执行记忆在异构策略之间进行路由,并通过 Memory Bridge 改善策略之间的交接。
PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution — 2026-07-18 · ArXiv 2026。通过会话状态、显式任务验证和可复用经验,将认知规划与物理执行解耦。
*Details & sources* 论文描述了基于文件的状态视图以及一个区分执行终止与任务成功的 SessionVerifier。不断演化的运行时需要单独配置的工具以及机器人或仿真器适配器。
RoboTTT: Context Scaling for Robot Policies — 2026-07-16 · ArXiv 2026。利用测试时训练(test-time training)的快权重(fast weights),根据长视觉运动历史调节机器人策略,支持从示范与执行上下文中进行自适应。
*Details & sources* 在真实机器人操作任务上评估的策略学习研究。
Harness VLA: Steering Frozen VLAs into Reliable Manipulation Primitives via Memory-Guided Agents — 2026-07-09 · ArXiv 2026。把一个冻结的 VLA 暴露为可重试的、接触丰富的动作原语(primitive),并与固定的解析原语和执行结果记忆相配合。
*Details & sources* 在 LIBERO-Pro、RoboCasa365 和 RoboTwin C2R 上评估,无需对 VLA 微调。论文链接到 RPent,提供运行时以及仿真器/VLA 集成;部署需要相应的模型和环境配置。
GaP: A Graph-as-Policy Multi-Agent Self-Learning Harness For Variational Automation Tasks — 2026-07-06 · ArXiv 2026。把语言指令编译成由模块化机器人技能组成的可执行图,再利用仿真反馈定位失败并优化图结构。
*Details & sources* 针对已知工作单元内具有不同物体几何和姿态的重复任务实例。Beta 版代码包含图生成、执行和机器人示例;部署需要技能依赖、标定好的传感器以及机器人特定的连接。
ASPIRE: Agentic /Skills Discovery for Robotics — 2026-06-30 · ArXiv 2026 · ⭐。利用多模态执行轨迹、失败诊断、修复验证、可复用技能库与进化搜索来优化 code-as-policy 程序。
*Details & sources* 提供仿真工作流与真实机器人迁移代码。行为仍受限于预定义的感知、规划与控制原语;真实部署需要成功检测、重置、安全监控与标定。
ENPIRE: Agentic Robot Policy Self-Improvement in the Real World — 2026-06-18 · ArXiv 2026 · ⭐。把场景重置、策略执行、结果验证与实验优化串联起来,使编码智能体能够通过物理试验来改进策略。
*Details & sources* 部署需要标定好的工位以及任务专属的重置与验证函数。
Playful Agentic Robot Learning — 2026-06-17 · ArXiv 2026。智能体自行提出练习任务,编写并执行机器人代码,诊断失败,并在下游任务到来之前将成功行为提炼为可复用技能。
*Details & sources* 在留出的 LIBERO-PRO 和 MolmoSpaces 任务上评估冻结技能库,并在不微调模型的前提下迁移到 RoboSuite 与真实机器人。代码库包含 play/evaluation 工作流和技能库;执行需要文档化的仿真器或硬件配置。
Guava: An Effective and Universal Harness for Embodied Manipulation — 2026-06-16 · ArXiv 2026。研究迭代式感知–推理–动作、语义动作抽象以及多模态观测;还描述了如何蒸馏成更小的智能体模型。
What Matters in Orchestrating Robot Policies: A Systematic Study of Hierarchical VLA Agents — 2026-06-09 · ArXiv 2026。研究高层 VLM 规划器与底层 VLA 控制器,包括子目标切换、观测表示和规划器记忆。
*Details & sources* 在仿真和 ALOHA 机器人上比较层次结构设计选择。这是一项策略编排研究。
Enabling Extensible Embodied Capabilities with Tools — 2026-05-26 · ArXiv 2026。通过 Embodied Tool Protocol(ETP)将具身能力外部化为可调用工具,并以 EmbodiedToolBench 评估工具需求识别、选择、执行与组合能力。
*Details & sources* 描述了 100 多个经过验证的工具,涵盖感知、认知、推理与执行,并在仿真和真实机器人上评估。报告称感知和认知方面的收益大于细粒度执行。
EmbodiSkill: Skill-Aware Reflection for Self-Evolving Embodied Agents — 2026-05-11 · ArXiv 2026。对执行轨迹进行反思,区分有缺陷的技能与执行失误,再据此修订技能内容或强化有效指导。
*Details & sources* 在冻结执行器的前提下进行免训练技能演化,在 ALFWorld 和 EmbodiedBench 上评估。发布的实现针对的是这些仿真环境。
Learning while Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies (LWD) — 2026-05-01 · ArXiv 2026。利用大规模机队部署经验、离线–在线强化学习以及人工干预来改进通用机器人策略。
*Details & sources* 支撑性策略学习研究,在 16 台双臂机器人上、跨 8 个任务进行评估。人工干预仍是学习工作流的一部分。
Robot Planning and Situation Handling with Active Perception — 2026-04-28 · IROS 2026。VAP-TAMP 将 VLM 引导的主动视角选择与情境评估,结合场景图与任务运动规划(task-and-motion planning),以应对执行过程中的干扰。
*Details & sources* 在仿真和移动操作平台上的服务任务中评估。
RoboClaw: An Agentic Framework for Scalable Long-Horizon Robotic Tasks — 2026-03-12 · ArXiv 2026。一个 VLM 控制器协调数据采集、策略学习与长视野执行;前后向动作对支持自重置的数据采集。
*Details & sources* 真实机器人操作评估把学到的策略原语与高层规划和恢复联系起来。硬件、策略和重置行为需要相应的配置。
Agentic Self-Evolutionary Replanning for Embodied Navigation (SERP) — 2026-03-03 · ArXiv 2026。把在线动作模型自适应与 LLM 引导的基于图的重规划相结合,以应对导航失败和变化的环境条件。
*Details & sources* 在仿真和真实导航环境中评估。自适应使用上下文学习(in-context learning)和自动微分。
VLAW: Iterative Co-Improvement of Vision-Language-Action Policy and World Model — 2026-02-12 · ArXiv 2026。利用真实 rollout 改进以动作为条件的(action-conditioned)世界模型,再通过合成 rollout 迭代改进 VLA 策略。
*Details & sources* 支撑性策略学习研究,在真实机器人上评估。发布的 Ctrl-World 代码覆盖了 VLAW 中世界模型后训练部分。
Self-Improving Embodied Foundation Models — 2025-09-18 · NeurIPS 2025。结合示范学习、学到的成功率与进度估计以及自主强化学习练习,以改进机器人策略。
*Details & sources* 策略训练与奖励学习研究,在仿真和真实机器人上评估。
Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models — 2025-02-26 · ICML 2025。高层 VLM 解释复杂指令与情境化的用户反馈,底层 VLA 执行所选子任务。
*Details & sources* 在单臂、双臂和移动双臂平台上展示。
Code-as-Monitor: Constraint-aware Visual Programming for Reactive and Proactive Robotic Failure Detection — 2024-12-05 · CVPR 2025。生成可视化监控代码以评估时空约束,既能事后检测失败,也能预测潜在的约束违反。
*Details & sources* 可围绕现有策略闭环的执行监控模块;在仿真和真实场景中评估。
EMOS: Embodiment-aware Heterogeneous Multi-robot Operating System with LLM Agents — 2024-10-30 · ICLR 2025。LLM 智能体读取 URDF 描述并调用运动学工具来构建机器人能力画像,进而协调异构机器人进行规划与执行。
*Details & sources* 包含 Habitat-MAS,用于本体感知的多机器人推理。评估使用仿真操作、感知、导航与重排任务。
AHA: A Vision-Language-Model for Detecting and Reasoning Over Failures in Robotic Manipulation — 2024-10-01 · ICLR 2025。生成自然语言失败诊断,可用于在机器人操作系统中改进奖励、任务规划与子任务验证。
*Details & sources* 失败推理组件使用 FailGen 生成的仿真失败数据,并集成到三个操作框架中。
ReKep: Spatio-Temporal Reasoning of Relational Keypoint Constraints for Robotic Manipulation — 2024-09-03 · CoRL 2024。把语言指令和 RGB-D 观测转换为作用于 3D 关键点的 Python 函数;通过分层优化在感知–动作闭环中求解末端执行器动作。
*Details & sources* 论文展示了移动单臂和固定双臂系统。发布的代码包含约束生成与仿真执行;硬件使用需要自行集成。
VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models — 2023-07-12 · CoRL 2023。利用生成的代码与视觉定位构建用于运动规划的 3D 值图;生成的程序可基于视觉反馈重新评估。
*Details & sources* 公开仓库提供 RLBench 演示;不包含真实机器人实验中使用的完整感知流程。
SayPlan: Grounding Large Language Models using 3D Scene Graphs for Scalable Robot Task Planning — 2023-07-12 · CoRL 2023。在分层 3D 场景图上搜索,调用经典路径规划器,并利用场景图仿真反馈来修复不可行的长视野规划。
*Details & sources* 针对大规模移动操作;项目包含真实机器人演示。仿真反馈验证规划,但不验证物理执行的每个细节。
RoCo: Dialectic Multi-Robot Collaboration with Large Language Models — 2023-07-10 · ICRA 2024。机器人智能体通过对话协商子任务并生成任务空间路径点,利用碰撞检测和其他环境反馈修订规划。
*Details & sources* 包含六任务的 RoCoBench 仿真基准与真实人机协作演示。运动规划由单独的规划器提供。
Robots That Ask For Help: Uncertainty Alignment for Large Language Model Planners — 2023-07-04 · CoRL 2023。KnowNo 使用共形预测(conformal prediction)校准语言模型规划器的不确定性,并在动作选择仍然不明确时请求人类澄清。
*Details & sources* 在仿真和真实机器人任务上评估。统计保证依赖于校准假设;该方法本身并不验证物理执行的安全性。
DoReMi: Grounding Language Model by Detecting and Recovering from Plan-Execution Misalignment — 2023-07-01 · IROS 2024。LLM 生成任务规划与执行约束,VLM 持续检查约束违反,在执行偏离规划时触发恢复。
*Details & sources* 研究了带有扰动或不完美控制器的机械臂与人形机器人任务。
REFLECT: Summarizing Robot Experiences for Failure Explanation and Correction — 2023-06-27 · CoRL 2023。总结多感官执行历史,解释失败,并将这些解释作为规划器的条件以生成修正动作。
RoboCat: A Self-Improving Generalist Agent for Robotic Manipulation — 2023-06-20 · Transactions on Machine Learning Research (TMLR) 2023。训练了一个视觉目标条件(visual goal-conditioned)的通用策略