AI DAILY / 2026-09-24
面向真实世界的物理 AI 机器人推理卸载
Offloaded inference for real-world physical AI robotics
全文中文翻译 · AI 生成,仅供学习交流
面向真实世界物理 AI 机器人的卸载推理
挑战机器人 AI 的一个核心假设:我们的研究表明,将物理 AI 推理完全运行在板载 GPU(Graphics Processing Unit)上会限制机器人的性能、电池续航和可扩展性,而将推理卸载到边缘或云端 GPU 可以带来显著优势。
展示推理卸载的可量化收益:在代表性的移动操控(mobile manipulation)工作负载下,卸载推理提升了任务成功率,使更大的 AI 模型得以运行,并帮助机器人在动态的真实环境中更有效地做出响应。
延长机器人运行时间:用电量更低的板载硬件搭配远程推理取代耗电量大的板载 AI 计算,可以显著延长电池续航,让机器人在两次充电之间运行更长时间。
在 Physical AI Toolchain 中引入一项新能力:开发者现在可以使用基于 Kubernetes 的分布式推理工具,将机器人 AI 工作负载容器化、部署并在机器人、边缘基础设施和云端之间进行编排。
随取随用的物理 AI,让机器人在制造、家居和仓储等场景中为用户提供协助,在提升安全性、生产力和辅助水平等多个方面蕴含着巨大潜力。在许多方面,面向物理世界的 AI 代表着 AI 的一个重要前沿。物理 AI 必须在开放、不可预测的环境中运行,与其他机器人和人类交互,并适配多种不同的本体形态(embodiments)。要实现这一愿景,需要在三个维度上取得进展:机器人硬件、具身 AI(embodied AI)模型,以及用于训练和推理的系统基础设施。尽管近年来机器人硬件与 AI 模型发展迅速,但本文我们将聚焦于一个相对被忽视的方面:物理 AI 的推理基础设施。要让机器人在物理世界中有效且安全地运行,需要复杂的系统来处理大规模的分布式推理算力。
如今,物理 AI 的主流做法是为机器人配备板载 GPU,例如将 GPU 直接连线到机器人上。在这种模式下,机器人的推理被局限在板载 GPU 之上,并需要为机器人提供执行任务所必需的"动作块(chunks)"和动作序列。虽然更高级别的规划可以在云端进行,但任务执行通常仍与机器人自身绑定。我们对这一假设提出质疑。随着物理 AI 模型规模和复杂度的持续增长,板载算力的种种限制日益凸显:GPU 消耗大量电力、缩短电池续航、增加成本和重量,并限制了运行最新一代 AI 模型的能力。
为了更好地理解物理 AI 在系统层面的影响,我们开展了首个针对机器人工作负载的系统性研究。我们聚焦于移动机器人操控(mobile robotic manipulation),以"去厨房查看垃圾并放入垃圾桶"这类典型任务为例。这样的任务包括规划通往厨房的路径、感知环境以发现垃圾、导航到垃圾处、捡起垃圾、再导航回垃圾桶完成处置。我们在三类核心能力上评估了具有代表性的模型:语义建图与规划、导航,以及操控,详见图 2。

图 2:移动操控任务各组成部分所用模型的详细信息。
将物理 AI 推理卸载到机器人之外,提升了其响应时间与准确性,同时改善了电池续航并降低了成本。我们在板载、边缘和云端等多种算力配置下对推理模型进行了评估。具体测试硬件的细节可参阅我们的技术报告。

任务性能方面的优势:我们的评估表明,卸载推理可以在建图、规划、导航和操控等多种工作负载下显著提升机器人性能。一些显存较小的 GPU 无法容纳完整的移动操控推理栈。在显存足够的 GPU 上,与 A100 相比,建图和规划的速度最多减慢 383%,从而限制了机器人在动态环境中的能力。导航任务在使用较小 GPU 时,对障碍物的及时检测率下降了 30%。虽然视觉-语言-动作(VLA)模型在较小 GPU 上的速度下降并不明显,但这一放缓仍足以使其准确率下降 50%。换言之,板载 GPU 限制了机器人的性能表现,而将推理卸载到本地或云端 GPU 则能提升其运行效率,详见下方视频和量化图表。随着物理 AI 模型规模和复杂度的持续增长,卸载推理带来的收益可能会更加显著。
图 3a:视频展示了使用板载 GPU 时执行交接任务的过程。
图 3b:视频展示了在推理被卸载后执行交接任务的过程。

图 4:使用不同 GPU(部分为板载,部分为卸载)进行推理时,机械臂相互交接物体的成功率。卸载推理提升了成功率。
电池续航方面的优势:除性能影响外,板载 GPU 还会显著消耗机器人的电池续航。我们将板载 GPU 替换为 Raspberry Pi-5 开发板,并把全部数据发送至卸载的 GPU 进行推理,对比电池续航的提升情况。即便是较大的机器人,搭载更大的板载 GPU(例如 Jetson Thor)也会使其电池续航最多缩短 160%(约数小时)。
图 5:卸载 GPU 推理对机器人电池续航的影响;以上数据基于 Stretch-3 机器人测得。
上述结果表明,要在开放世界中运行大模型并保持长电池续航,将 GPU 推理卸载至机器人之外至关重要。尽管如此,将推理从机器人卸载出去涉及性能、网络延迟与带宽以及可用 GPU 资源之间的复杂权衡。我们相信本研究中的测量结果将为物理 AI 推理系统的设计提供参考。
自动卸载工具集
我们构建了一套工具集,便于将推理从机器人卸载出去,并在边缘 GPU 与云端之间分配推理。Kubernetes 是提供统一抽象的自然平台,可在机器人自身算力、边缘 GPU 和溢出到云端的算力之间分配机器人 AI 工作负载。该工具集支持基于声明式规范(declarative specifications)对机器人工作负载进行自动容器化与卸载,使用 Kubernetes 的智能策略分发物理 AI 容器,并集成机器人仿真器、LeRobot 和 ROS2,便于开发。下图所示的步骤展示了如何通过提示告知工具集要卸载的内容,以及它如何创建一个独立的 GPU 推理容器并完成卸载。
图 6:卸载工具集中包含容器化与部署的工作步骤。
Microsoft 最近发布了 Physical AI Toolchain,用于大规模地将物理智能投入运行。Physical AI Toolchain 是一个开源、生产就绪的框架,它将 Microsoft Azure 云服务与 NVIDIA 的物理 AI 栈相集成,加速机器人和物理 AI 开发者在感知、移动、模仿学习和强化学习等流水线中自动化、规模化地完成数据整理、增强与评估。我们宣布作为 Physical AI Toolchain 的一部分,加入一项业界首创的、面向机器人物理 AI 推理卸载的能力。本次发布包含对 SO-101 和 UR10e 进行推理卸载的示例项目。下方视频展示了如何将 Microsoft 面向双臂机器人的 Rho 模型的推理卸载到一台 Jetson Thor GPU 上,并由该 GPU 控制 Mobile Aloha 机器人的动作。
图 7a:将 Microsoft Rho 模型的 GPU 推理卸载,控制 Mobile Aloha 机器人操作 BusyBox 按下蓝色按钮。
图 7b:将 Microsoft Rho 模型的 GPU 推理卸载,控制 Mobile Aloha 机器人操作 BusyBox 将旋钮转到第 4 档。
欢迎查看推理卸载功能,了解源代码,并将您的反馈告诉我们。我们已经在多种真实场景中进行了测试,期待听到您的部署体验。
