Tidewell Robotics

机群大脑、具身记忆与机上算力,2026 年 9 月

多机器人系统今天究竟共享什么、文献中的具身记忆如何构建、一台 Jetson Thor 真正能跑什么,以及新加坡买家所处的供应链规则。

洞察 · 2026 年 9 月 7 日 · 阅读约 28 分钟 · Tidewell 文章团队撰写,Timothy Mo 审校

本文贯穿三种标记,含义与研究文件中一致。[单一来源] 指只在一处找到的说法。[推断] 指我们从证据出发的推理,而非已发表的说法。[先验知识] 指本轮未重新核实的既有知识。其余内容至少有两个来源,或有来源列表中的权威一手来源。

这一轮研究于 2026 年 9 月 5 日进行:约 60 次网络检索与 45 次页面阅读,覆盖 arXiv、NVIDIA 文档与论坛、DeepMind 与厂商页面,以及行业媒体。检索预算在算力与供应链部分中途耗尽,因此 Wi-Fi 6E 漫游实测、Intel 与 AMD 的边缘产品、高通模组价格与 Physical Intelligence 的机群工作比预期单薄,并在出现处标注。

四个部分分别是:多机器人共享记忆与协同;具身智能体的记忆架构;机上与现场服务器算力;以及新加坡买家所处的供应链约束。

A 部分:多机器人共享记忆与协同

谁共享什么,以及是否真的在运行

系统(所有者,日期)机器人之间共享什么如何实现(拓扑)时延量级真实部署证据备注
Gemini Robotics ER 2 与 Gemini Robotics 2(Google DeepMind,2026 年 7 月 30 日)任务级语义理解与子任务交接,以自然语言在机器人之间交换。不共享权重,不共享世界状态,没有共享记忆存储。每台机器人运行自己的一份模型栈。云端视觉语言模型(Gemini API 与 Live API 双向流式);视觉语言动作模型与导航 API 被声明为「工具」。协同是基于语言的点对点。每次 ER 2 调用「亚秒级」;云端往返。ER 2 宣称时刻定位准确率 91.3%,平均绝对距离 0.96 秒,「比竞争模型快 4 倍」。演示:Apptronik Apollo 2 加 Franka FR3 Duo 的工具配套交接;一个 Spot 取物演示。ER 1.6 自 2026 年 4 月 8 日起已在 Boston Dynamics Orbit AIVI-Learning 中对所有已登记的 Spot 客户上线。On-Device 2 仅限受信任测试者。ER 2 是编排大脑;机上的视觉语言动作模型(基于 Gemma)无法独立完成多机器人协同,并且「未在移动平台或全身控制上评估」。
Amazon DeepFleet(Amazon Robotics,arXiv 2508.08574,2025 年 7 月与 8 月)机群运动预测:机器人位置、目标与交互。实质上是一个共享的、习得的地面交通模型。集中式:对场内每台机器人做一次批量前向计算;「权重在所有 N 个智能体之间共享」。四种架构:以机器人为中心 9,700 万参数、约 500 万机器人小时;机器人-场地 8.4 亿;图像-场地 9 亿;图-场地 1,300 万。未公开;预测视野是秒到分钟,不是控制环。用「数十万台机器人」的数据训练;Amazon 宣称在 100 万台机器人规模上机群行程时间改善 10%。网格上的同构驱动单元。不是记忆系统,而是交通预言机。
Agility Arc(Agility Robotics,2024 年 3 月,2025 至 2026 年更新)场地地图、工作流定义、关键绩效指标(正常运行时间、吞吐量、平均干预间隔)、机器人状态;仓储管理系统、仓储执行系统与制造执行系统 API。云端 SaaS。没有证据表明 Digit 之间共享情景记忆、语义记忆或技能。看板与任务时延,秒级。商用 Digit 机群(GXO、Schaeffler 等);与 MiR 和 Zebra 的自主移动机器人集成;第 6 代 Digit 转向 Jetson Thor。一个机群运维工具,不是机群大脑。
Boston Dynamics Orbit(2023 年起;AIVI 自 2026 年 4 月起基于 Gemini)任务、地图、排程、巡检结果、360 度 Site View 历史、异常检测结果。多站点看板。AWS 托管,或本地 1U「Site Hub」一体机,或 OVA 虚拟机。机器人经 Wi-Fi 或 LTE 接入。任务排程;巡检复核时延,秒到分钟。工业界数以百计的 Spot 机群;支持 Stretch;Atlas 在计划中。2026 年的 Atlas 交付现代 RMAC 与 Google DeepMind;首个外部 Atlas 试点在 2027 年。「只要一台 Atlas 学会一项新任务,该任务就能立即复制到整个机群」这一说法属于宣传;其机制,即推送策略检查点,并无文档。[单一来源]
优必选 BrainNet 2.0 与 Co-Agent(优必选,2025 年 3 月极氪公告;2025 至 2026 年的 Walker S2)一个云端「群脑」保存机群调度与场景数据库;机器人共享环境数据,因此一台机器人测绘出堵塞通道后其余机器人改道。Co-Agent 在本地运行:多模态大模型加小技能模型加异常处理。一个「Internet of Humanoids」中央枢纽。中心辐射式:云端超级大脑加机上子脑;极氪深圳工厂的 5G 专网。未公布时延数字。极氪的「数十」台 Walker S1(分拣、搬运、装配、检验);Walker S2 有 3 分钟自主换电;2026 年 7 月中越边境口岸的 Walker S2。最接近连接式大脑的公开对照物。架构说法停留在新闻稿层面,缺乏独立验证。
NVIDIA Isaac、OSMO 与 Mega(2025 至 2026)OSMO 是开源编排器,用于跨本地与云端的数据生成、训练、强化学习与软件在环流水线。Mega Omniverse Blueprint 是用于路径与任务优化的数字孪生机群仿真(KION 试验)。对工作负载做云端或本地编排,而不是运行时的机器人记忆。离线。与 KION 的 Mega 试验;OSMO 用于 NVIDIA 自己的流水线。NVIDIA 没有已交付的运行时机群记忆产品。它的机群叙事是「在仿真中训练,推送一个新大脑」。
Open-RMF 与 RoMi-H(Open Robotics 加新加坡 CHART、IHiS、HopeTechnik、政府科技局;2019 年起)一份交通排程数据库,记录每支机群的预定路线、电梯、门与通道状态,以及任务派发。冲突由机群适配器协商加裁决者解决。一个中央 RMF 内核加各厂商的机群适配器;MiR 适配器是公开的。路径规划时间尺度,秒级;没有硬实时。RoMi-H 之下的新加坡医院试点;RMF 是新加坡公共部门混合厂商医院机群事实上的标准。[对当前医院覆盖面为先验知识]共享意图与基础设施状态,不共享感知或记忆。
InOrbit(OpenRobOps)、Formant、Viam(2024 至 2026)遥测、遥操作、任务、空中下发更新、告警、数据流水线。InOrbit 开源了 OpenRobOps 数据模型;Viam 做模块化硬件抽象与机群空中升级(2026 年 6 月 18 日与 Tech Mahindra 合作);Formant 企业版约每台每月 250 美元。云端 SaaS 加边缘代理。秒级。众多自主移动机器人机群。是机器人运维,不是大脑。作为机群大脑之下的运维层很有用。
Figure Helix-02(2026 年 5 月)没有显式共享:两台人形机器人运行同一个视觉语言动作策略,「仅凭动作」推断同伴意图,没有消息传递,也没有中央规划器;全部推理都在机上。隐式对等。机上视觉语言动作模型的速率。一个卧室整理演示;宝马产线上的「8 小时自主班次」。说明仅共享权重的协同对同处一地的两台机器人有效;它无法扩展到全场记忆。
Learning While Deploying(上海创智学院与智元,arXiv 2605.00416,2026 年 5 月)策略权重。16 台智元 G1 双臂机器人上传轨迹与人工干预;一个中央学习器(DIVL 加 QAM 强化学习)每 50 个训练步广播一份新的共享策略;策略在机上以 30 Hz 运行。中央学习器加机上推理。策略每几分钟刷新一次;4 小时墙钟时间约合 60 机器人小时。一个实验室与工业测试台,8 项任务,成功率 95%。2026 年关于机群学习在 16 台规模上确实可行的最佳证据。评判器留在服务器上。
Fleet-DAgger(加州大学伯克利分校,2022)一份由一组人类监督者的干预训练出的共享策略;ROHE 指标;ROHE 为基线的 8.8 倍。集中式。离线更新。4 台 ABB YuMi 机械臂,2 名远程人类;一个 100 台机器人的仿真。所有「机群从遥操作中学习」叙事的学术祖先。
Robot Fleet Learning via Policy Merging(2023)与《Federated Learning for Cloud Robotic Manipulation》综述(arXiv 2507.17903,2025 年 7 月)在不集中数据的前提下,把来自异构数据集的权重合并。对等或中心辐射。离线。仿真加少量真机。对操作而言,联邦学习仍处于综述与原型阶段。
多机器人三维场景图:Hydra-Multi(麻省理工,2023)、MR-COGraphs(清华,2024 年 12 月与 2025 年 3 月)、CURB-OSG(2025 年 3 月)、Language-Grounded Hierarchical Planning with Multi-Robot 3DSG(2025 年 6 月)、D-Lite一份融合的度量语义三维场景图,包含房间、地点、物体与开放词表特征。Hydra-Multi:一个集中式服务器融合增量输入,求解相对变换与回环闭合。MR-COGraphs:一个学习到的编码器在传输前压缩物体特征图,数据量减少 80% 以上,再经基于特征的地点识别合并。在线;Hydra 系列可实时运行。融合时延没有硬数字。真实的多机器人实验,室内与室外,规模较大。这是共享核心记忆的技术基础。
大模型多机器人规划器:RoCo(哥伦比亚大学 2023)、SMART-LLM(2023)、DART-LLM(2024,有向无环图任务分解)、EMOS(ICLR 2025,从 URDF 生成的「机器人简历」,Habitat-MAS)、COHERENT(ICRA 2025,提案-执行-反馈-调整)、DynaHMRC(2026 年 6 月,去中心化)、LLM-HBT(2025 年 10 月,行为树)、综述 arXiv 2502.03814一个任务图与子任务分配;机器人的能力描述;对话记录。多数是一个中央大模型分配器加每台机器人的执行智能体;RoCo 与 DynaHMRC 基于对话且去中心化。在云端大模型上每轮规划数秒。仿真基准;少数桌面或小团队的真机演示。没有工业部署。可复用的想法:机器人简历、有向无环图任务图、反馈回路。
Governed Shared Memory for Multi-Agent LLM Systems(arXiv 2606.24535,2026 年 6 月;MemClaw)面向智能体机群的共享多租户记忆服务,具备范围化检索、时间取代、来源追踪与策略治理的传播。一个中央 REST 服务,写入时做增强。亚秒级的来源重建;测试中机群内可见性 97.5%,跨机群泄漏为零。仅软件智能体,没有机器人。对一致性问题最清晰的表述,详见下文。

这一领域今天真正共享的是什么

在已交付或接近交付的系统中存在四类共享,没有一类是共享大脑:

  1. 共享权重,离线。机群学习(Fleet-DAgger、策略合并、智元的 Learning While Deploying)向每台机器人推送一份新的策略检查点。共享发生在分钟到每夜的时间尺度上。在 16 台机器人规模上这已被证明,而推理仍在每台机器人上以 30 Hz 运行。Figure 的 Helix-02 展示了退化情形:同一份权重,零通信,协同从相互观察中涌现。
  2. 共享意图与交通状态。Open-RMF、DeepFleet 与所有自主移动机器人机群管理器共享机器人打算去哪里,以及电梯与门的状态。DeepFleet 是其中规模最大的学习版本,9,700 万至 9 亿参数,训练数据达数百万机器人小时,采用集中式批量推理。这是唯一有机群规模经济影响硬证据的一类,即 Amazon 宣称的 10% 行程时间改善。
  3. 共享运维数据。Orbit、Arc、InOrbit、Formant 与 Viam 共享任务、地图、遥测、关键绩效指标与空中下发更新。Orbit 在 AI 上最先进,自 2026 年 4 月起有 Gemini 支持的巡检推理,但它共享的仍是巡检结果,不是机器人记忆。
  4. 共享语言。Gemini Robotics ER 2(2026 年 7 月)是第一个演示异构机器人交接子任务的大厂产品。机制是明确的:每台机器人运行自己的一份同样的技术栈,彼此以自然语言交谈;没有共同的记忆存储,没有共享场景图,也没有共享的情景历史。优必选的 BrainNet 2.0 宣称的更多,包括一个云端场景数据库,以及从另一台机器人观察到的堵塞通道触发改道,但这些说法只有新闻稿的成色。

没有人交付的,是一个现场级的记忆服务:异构机器人,一台轮式操作机器人与一台双足机器人,向同一份受治理的存储写入并从中读取,其中包含带物体恒常性的融合三维场景图、带来源的情景日志、语义化的现场知识与标准作业程序,以及一个技能库,并且带有一致性规则;同时每台机器人保留一份本地副本,以便离线时优雅降级。每一个组件都在某篇论文或某个产品里存在;但整合,尤其是面向具身写入的一致性与来源层,作为产品并不存在。学术文献才刚开始为这个问题命名,见 Governed Shared Memory(2026 年 6 月)与 ICLR 2026 的 MemAgents 研讨会。

B 部分:具身智能体的记忆架构

四种记忆类型

记忆类型功能代表性实现存储载体能否在机上(Thor 级)运行?多写入方一致性问题
工作记忆 / 短期记忆当前场景、物体状态、任务状态、最近 N 步Hydra(实时三维场景图,麻省理工)、ConceptGraphs(由二维基础模型加多视角关联得到的开放词表三维场景图)、Clio(任务驱动的开放集三维场景图)、REACT(可更新的三维场景图)、KARMA 短期(带替换策略的物体位置与状态增量)、HiMe「Sentry」层(ICML 2026)、RoboMemory 的时间 FIFO 加大模型整合一张包含房间、地点与物体的分层图,每个节点带嵌入;一个 FIFO 缓冲可以。Hydra 在笔记本级 CPU 与 GPU 上实时运行;ConceptGraphs 接近离线,但 Thor 尚有余量。Solo 模式下它必须在机上。两台机器人从不同坐标系看到同一物体会产生重复节点;这需要地点识别加相对变换(Hydra-Multi)与节点合并规则。
情景记忆发生了什么、在哪里、什么时候;按时间、空间或语义检索ReMEmbR(NVIDIA:VILA 描述加时间戳与位姿写入 Milvus;记忆在 Jetson Orin 32GB 上构建,由 GPT-4o 查询;Nova Carter,25 分钟记忆)、Embodied-RAG(拓扑地图之上的语义森林;公里级,250 次查询)、STaR(任务条件化检索,2026 年 2 月)、RoboMemory 情景(RAG 抽取器与更新器,Qwen3-Embedding)、eMEM(SQLite 加 hnswlib 加 R-tree,进程内,eMEM-Bench 上 80.8/100)、E-mem(多智能体情景重建,2026 年 1 月)向量数据库中记录嵌入、位姿、时间与描述的行;或图节点记忆构建可以,在 Orin 或 Thor 上以约 1 Hz 做视觉语言模型描述;跨小时或跨天的长时程查询是服务器的活,因为 FindingDory 表明视觉语言模型在几百张图之后就会失灵。机器人之间的顺序与时钟偏差;重复事件;过期传播,即机器人 A 的过期观测覆盖机器人 B 更新的观测。
语义 / 长期记忆现场知识、标准作业程序、物体可供性、人员、偏好KARMA 长期(把三维场景图作为长期记忆;在 AI2-THOR 中成功率提升 1.3 至 2.3 倍)、RoboMemory 的空间知识图加大模型冲突检测、Mem0(大模型抽取后执行 ADD、UPDATE、DELETE 或 NOOP;另有图变体)、Zep(时间知识图;在 LongMemEval 上 63.8% 对 Mem0 的 49.0%)、A-MEM(卡片盒式的链接笔记)、MemoryBank(艾宾浩斯遗忘)、Letta 与 MemGPT(一个上下文内的核心块加回忆与归档)、HiMem(2026 年 1 月)、BrainMem(2026 年 4 月)、HoloAgent-0(三维空间记忆,2026 年 6 月)、Embodied Agents Meet Personalization(2025 年 5 月)一个知识图加一个向量索引;一个固定在大模型上下文中的小「核心」块机上放只读副本,因为现场知识图很小,只有数十 MB。写入与整合属于现场服务器。矛盾残留,即两台机器人对同一扇门或同一个货架断言不同状态;以及来源丢失,即谁在何时说过这句话被丢失。
程序性记忆技能、策略、代码、行为树Voyager 技能库(可执行代码)、按本体微调的 Isaac GR00T 动作头、LLM-HBT 行为树、SayCan 式可供性打分、RoboMemory 的底层执行器(带 LoRA 的 pi0)每种本体的权重、代码片段、行为树 XML,加上一份记录每项技能何时适用的索引权重必须在机上。技能索引与技能库放服务器,本地做缓存。版本偏差,即机器人停留在不同的检查点上;这需要技能版本管理与 Viam 或 Arc 那类的灰度策略。
基准测试衡量上述能力FindingDory(60 项 Habitat 任务;视觉语言模型在几百张图之后吃力)、WorldLines(2026 年 6 月)、EvoMemBench、AMA-Bench、MemCompiler、EmbodiedBench(RoboMemory 用 Qwen2.5-VL-72B 达到平均成功率 26.5%)、Habitat-MAS(EMOS)、RoCoBench不适用不适用目前还没有任何基准衡量共享具身记忆上的多机器人写入冲突。[推断]

领先系统如何存储

  • ReMEmbR(NVIDIA)用 VILA 为短视频片段生成描述,将其嵌入,并把嵌入、x-y-yaw 与 t 存入 MilvusDB;一个大模型智能体按文本、位置或时间做迭代检索。记忆构建在 Jetson Orin 32GB 上运行,推理使用 GPT-4o。这是一台机器人记住二十分钟前在哪里看到过某物的参考设计。它的弱点,比如把汽水机和饮水机搞混,来自没有场景图、只有描述的记忆。
  • Embodied-RAG(卡内基梅隆大学)是拓扑地图之上的语义森林,带多个抽象层级的语言描述;它能在公里级环境中处理物体级与「氛围」查询,并被用作无人机、LoCoBot 与四足机器人的全局规划器。
  • RoboMemory(2025 年 8 月)有四个并行模块。空间是带大模型冲突检测的动态知识图;时间是带整合的步骤摘要 FIFO;情景与语义是带抽取器、更新器与 Qwen3-Embedding 向量库的 RAG。有一个带评判器的规划器。骨干是 Qwen2.5-VL-72B,执行器是 Mobile ALOHA 上带 LoRA 的 pi0。真实世界的终身学习结果是,在 15 项任务上第二次尝试的成功率提高。这是最接近完整本地记忆栈的单篇论文,但 72B 的骨干无法放在机器人上。
  • KARMA(2024 年 9 月)把长期记忆做成一张完整的三维场景图,把短期记忆做成带自适应替换策略的物体位置与状态变化;它在 AI2-THOR 中报告成功率提升 1.3 与 2.3 倍,效率提升 3.4 与 62.7 倍。
  • HiMe(ICML 2026)是对频率与能力悖论的明确回答:一个高频的 Executor(视觉语言动作模型)、一个 Sentry(关注事件的工作记忆)与一个 Planner(慢速大模型),并具备增、改、删的记忆可塑性。它报告长时程操作平均成功率 90%。
  • eMEM(2026 年 6 月)是一个混合图记忆,带三种索引(SQLite 管结构、hnswlib 管语义、R-tree 管空间)、分层的「从海马体到新皮层」整合,以及十种可由大模型工具调用的回忆原语,进程内运行,无需基础设施。在其消融实验中,朴素 RAG 基线在上下文相关检索上低 30 分,在虚假记忆拒绝上低 29 分。
  • Mem0、Letta、A-MEM 与 Zep 来自软件智能体领域,实用的经验是:在上下文中固定一个小的核心记忆块,写入时由大模型做抽取后再调和(增、改、删、不动),以及一个时间知识图在「什么时候什么是真的」上胜过扁平向量(Zep 在 LongMemEval 上 63.8%,Mem0 为 49.0%)。机器人领域尚未系统性地采用后两者;RoboMemory 的知识图冲突检测是最接近的。
  • Governed Shared Memory,即 MemClaw(2026 年 6 月),为机群记忆的四种失效模式命名:未授权泄漏、过期传播、矛盾残留与来源丢失。它提出范围化检索、时间取代、来源追踪与策略治理的传播,并在写入时做同步增强。它只覆盖软件智能体,但可以直接迁移。

记忆在机上与现场服务器之间的划分

这一划分是我们自己对上述证据的解读 [推断]。

机上(Thor T5000 或 T4000)现场服务器同步规则
场景图(工作记忆)本地按传感器速率构建与更新;每个区域约 1,000 至 10,000 个节点一张融合的现场图,Hydra-Multi 风格连接时机器人以 1 至 5 Hz 推送节点增量,按 MR-COGraphs 风格压缩,体积减少 80% 以上;进入区域时拉取该区域的图
情景最近 30 至 60 分钟的描述与位姿滚动缓冲,几 MB;一个本地向量索引完整历史,数天到数月;Milvus 或 pgvector;整合任务仅追加上传;服务器分配全局顺序;机器人从不阻塞于上传
语义(现场知识图、标准作业程序、人员)数十 MB 的只读副本,加上规划器上下文中几 KB 的固定核心记忆块事实来源;写入时由大模型抽取与调和;来源与取代有变更时拉取;机器人的写入在服务器调和之前只是提案
程序性策略权重、技能索引缓存、行为树技能库、版本、灰度策略、微调空中下发并按机器人固定版本;从不在任务中途
机群调度本地回退:RMF 式路线加保守规则RMF 交通排程与协商;任务有向无环图分配链路丢失超过 2 秒,机器人切换到 Solo 模式规则:减速、全面让行

一致性问题,具体地说

当多台机器人写入同一份记忆时,按痛苦程度排序会出现:重复物体,即同一个托盘被两台机器人看到后变成两个节点;过期覆盖,即机器人 A 在 t=100 报告门开着,机器人 B 在 t=130 报告门关着,但 A 的消息后到;矛盾残留,即两者都留在知识图中,规划器随便挑一个;以及来源丢失,即一条从错误的人工纠正中学到的标准作业程序在整个机群中传播。

已经存在且易于采纳的解法有:用于单元级信念地图的 CRDT 式键值「虚拟共识主动性」;用于物体状态的混合逻辑时钟加最后写入者胜出;写入时的大模型调和,如 Mem0 与 RoboMemory;范围化可见性与来源元数据,如 MemClaw;以及 Hydra-Multi 的规则,即只有在找到回环闭合质量的相对变换之后才合并几何。困难且未解的部分是语义矛盾,比如「这条走廊在查房期间禁止通行」,其解法是经人工关口的提升。

C 部分:机上算力的现实

NVIDIA Jetson Thor 系列

一手来源:NVIDIA 产品页面、JetPack r38 文档、CNX Software 于 2026 年 7 月 22 日的价格表,以及 ProventusNova 的路线图。

模组AI 算力(FP4 稀疏)内存CPU功耗2026 年 7 月 22 日前后价格(1KU)供应
Jetson T50002,070 TFLOPS;2,560 个 CUDA 核心与 96 个 Blackwell Tensor 核心,最高 1.57 GHz128 GB 256 位 LPDDR5X,273 GB/s14 核 Arm Neoverse-V3AE,2.6 GHz40 至 130 W(默认 NVP 模式为 120 W;MAXN 不设限)2,999 美元,后为 4,999 美元自 2025 年 8 月起出货
Jetson T40001,200 TFLOPS64 GB LPDDR5X,273 GB/s12 核 Neoverse-V3AE40 至 70 W1,999 美元,后为 2,999 美元出货中
Jetson T3000865 TFLOPS32 GB,273 GB/s8 核「约为 T5000 的一半」未公开2027 年第一季度,JetPack 7.2.1 中可仿真 [单一来源]
Jetson T2000400 TFLOPS16 GB未公布未公布未公开2027 年第一季度 [单一来源]
AGX Thor 开发套件(T5000)同 T5000128 GB同 T5000130 W3,499 美元,后为 5,499 美元2026 年 7 月在 NVIDIA 美国商城缺货;可经分销商获得
AGX Orin 64 GB(回退方案)275 TOPS INT8 稀疏64 GB LPDDR5,204.8 GB/s12 核 Cortex-A78AE15 至 60 W1,599 美元,后为 2,999 美元供应至 2032 年 1 月
AGX Orin 32 GB200 TOPS32 GB8 核15 至 40 W899 美元,后为 1,799 美元有货
Orin NX 16 GB100 TOPS16 GB8 核10 至 25 W599 美元,后为 999 美元有货

要点:

  • 2026 年 7 月的涨价,整条 Jetson 线上涨 50% 至 101%,没有新闻稿,是经 NVIDIA 的常见问题页与商城发现的,时间上与 DRAM 挤压吻合:LPDDR5X 合约价在 2026 年第二季度环比上涨 89%,移动 LPDDR5X 交期达到 26 至 39 周,部分先进内存达到 40 至 58 周。NVIDIA 让所有 LPDDR4 的 Jetson(Xavier、TX2)停产,最后下单日为 2026 年 7 月 1 日,最后出货日为 2027 年 7 月 15 日,理由是 DRAM 市场动态。由这些数据点可推出模组交期 6 至 9 个月,且批量订单不可取消、不可退货 [推断]。
  • Jetson 模组与开发套件的出口管制分类编码为 5A992.c(NVIDIA 常见问题)。产品生命周期为 5 至 10 年可供货,量产模组保修 3 年;JetPack 7(Ubuntu 24.04)现已支持 Thor,并在 2026 年内支持 Orin。
  • 热设计:模组热设计功耗为 130 W,结到封装的热阻为 0.231 K/W,意味着满载时结温与模组温差大约 30 摄氏度;被动降频触发点接近 110 摄氏度,临界关机接近 115 摄氏度(JetPack r38.2.1 文档)。论坛上向 NVIDIA 索要封闭式机器人功耗分解的帖子,除了「去读《热设计指南》」之外没有得到回应。实际后果是,电池供电的双足机器人应按 T4000 的 70 W,或限制在 60 至 80 W 的 T5000 配置来做预算,而不是 130 W [推断]。
  • 内存带宽才是真正的限制:273 GB/s 与 DGX Spark 相同,大约是 RTX 4090 的四分之一。VLA-Perf 发现 Thor 即便在视觉编码器上也是内存受限的,这与任何桌面或数据中心 GPU 都不同。

Thor 上能跑什么,跑多快

模型规模硬件速率来源与说明
GR00T N1.7(Cosmos-Reason2-2B 骨干加 SigLIP2 加流匹配 DiT)3BAGX Thor 128 GBPyTorch 8.9 Hz,TensorRT 全流水线 12.4 HzNVIDIA Isaac-GR00T 硬件建议;「建议最低 10 Hz 以上」;动作分块可维持约 30 FPS 的执行
GR00T N1.73BAGX Orin 64 GBPyTorch 2.9 Hz,TensorRT 6.6 Hz同上;「只适合慢速、非反应式的任务」
GR00T N1.73BH100 或 RTX Pro 600030 Hz 以上,H100 上最高 35.9 HzHugging Face 模型卡
GR00T N1.63BAGX Thor22 至 24 Hz(41 至 45 毫秒)NVIDIA 论坛上一位手写 CUDA 内核的独立开发者;精度与功耗模式未说明 [单一来源]
pi0.5约 3BAGX Thor23 Hz(44 毫秒)同一论坛帖 [单一来源]
pi0约 3BAGX Thor同帖中 22 Hz(46 毫秒);VLA-Perf 中 19.0 Hz(52.6 毫秒)两次独立测量在约 20 Hz 上一致
pi0约 3BRTX 4090 或 509032 Hz 与 54 至 57 HzVLA-Perf;论坛
pi0 级视觉语言动作模型放大到 167 亿参数16.7BAGX Thor2.1 HzVLA-Perf;对控制无用
带 100 个时间步 KV 缓存上下文的视觉语言动作模型约 3BAGX Thor8.1 Hz,1,000 个时间步时 1.3 HzVLA-Perf;在 Thor 上,把长上下文记忆放进视觉语言动作模型里代价太高
经 vLLM 运行的 Qwen3.6-35B-A3B NVFP4(混合专家,3B 激活)总计 35BAGX Thor16 并发下聚合 190 至 239 token/s;单流峰值 72 至 84 token/s;重载下首 token 时间 30 至 200 秒NVIDIA 论坛基准报告,2026 年 8 月 [单一来源]
同上35BDGX Spark聚合 249 至 268 token/s;峰值 92 token/s同一报告
同上35BRTX Pro 6000 Blackwell聚合 818 至 1,053 token/s;峰值 316 至 336 token/s同一报告
Llama 3.1 8B(量化)8BJetson,设备未指明单用户 44 token/sJetson AI Lab 基准教程示例
Nemotron 3.5 Lightning、Qwen3.8-27B27B 级AGX Thor 或 Orin据 NVIDIA 博客为「不错的选择」;未取到数字NVIDIA 技术博客,页面未渲染 [单一来源]
Gemini Robotics On-Device 2未公开,基于 Gemma未公开;「无需网络即可本地运行」未公开DeepMind 模型卡。仅限受信任测试者;在高自由度机器人上吃力;「未在移动平台或全身控制上评估」
SmolVLA0.45B高通 IQ-9075 NPU每步 31 毫秒,约 32 Hz,INT8AI Review Zones [单一来源]
Llama 2 13B13B高通 IQ-907512 token/s高通与 DigiKey 资料
Llama 3.2 1B1BHailo-10H约 2.5 W 下 30 至 50 token/sHailo 与社区

在 Thor 上,一个 3B 级视觉语言动作模型能跑到 10 至 25 Hz,取决于投入多少内核优化工作;机上的大模型规划器在 7 至 8B 稠密(40 至 50 token/s)或 3B 激活的混合专家(单流 70 至 80 token/s)是现实的,这足以每几秒做一次推理,但不足以支撑一个 30 至 70B 的评判器。在 Thor 上,任何超过约 8B 稠密的模型都会与视觉语言动作模型争抢 273 GB/s 的总线 [从 VLA-Perf 与 vLLM 报告推断]。

VLA-Perf 的部署结论对任何双模式设计都重要:「服务器端推理(即便是消费级 GPU 加 Wi-Fi)也优于 Jetson Thor 的机上推理;只有在网络条件极差(4G 或更差)时才优先选择机上推理」;设备与服务器分工并传输 KV 缓存比两者单独运行都慢;而异步推理在无线上带来 2.6 至 13.8 倍的加速。所以在服务器上运行视觉语言动作模型的连接模式在技术上更快,但它让安全依赖于无线,这正是没有人为人形机器人交付它的原因。

Thor 的替代方案

平台AI 算力内存功耗对新加坡机器人企业的状态备注
Jetson AGX Orin 64 GB275 TOPS INT864 GB,205 GB/s15 至 60 W安全的回退方案,供货到 2032 年,现价 2,999 美元TensorRT 上 3B 视觉语言动作模型 6.6 Hz:对做慢速取放的轮式操作机器人够用,对反应式双足不够
高通 Dragonwing IQ-9075NPU 100 稠密与 200 稀疏 INT8 TOPS;GPU 1.2 TFLOPS最高 36 GB LPDDR5约 30 W 无风扇功耗范围评估套件可在 DigiKey 与 Lantronix 购买;模组价格未公开;为加速进化与 VinMotion 的人形机器人供货能效比强;QNN 与 AI Hub 工具链在视觉语言动作模型上不如 CUDA 成熟;SmolVLA 的 32 Hz 说明小型视觉语言动作模型放得下
Hailo-10H40 TOPS INT4,20 INT8模组上 4 至 8 GB LPDDR4X2.5 W一块 M.2 模组;以色列公司,对新加坡无出口问题适合做 1 至 2B 视觉语言模型的旁路,用于感知与情景记忆的描述生成,不适合跑视觉语言动作模型
地平线(D-Robotics)RDK S100 与 S100P80 与 128 TOPS BPU 加 6 个 A78AE 加 4 个 Cortex-R52 微控制器通常 8 至 16 GB [推断]数十 W经微雪、亚博与 OpenELAB 销售;50 家以上客户,包括双足与人形机器人;在 Embedded World 2026 展出单芯片同时提供算力与带实时微控制器的控制,对双足的底层控制器很有吸引力;中国出身,不受美国管制
地平线征程 6P最高约 560 TOPS [先验知识]车规车规仅车规型号,20 家以上主机厂目前还不是机器人零件
黑芝麻 A2000X约 1,000 TOPS「等效」[单一来源]不适用不适用面向具身智能发布;未见零售渠道观察名单
瑞芯微 RK35886 TOPS NPU最高 32 GB5 至 15 W无处不在且便宜;用于四足与服务机器人一块感知或辅助板卡,不是大脑
瑞芯微 RK368832 TOPS NPU,12 个 Armv9.3 核心,LPDDR6 200 GB/sLPDDR6约 10 至 20 W [推断]2026 年中新品导入,2026 年末量产一块值得关注的 2027 年辅助板卡
华为昇腾 310、Atlas 200I A216 TOPS;Atlas 200I A2 为 8 TOPS 带 4 GB在中国可得昇腾 910B、C 与 D 的「在世界任何地方」使用于 2025 年 5 月被美国工业与安全局认定为违反出口管制;310 未被点名,但声誉与合作方风险仍在。对希望获得美国与欧盟客户的公司应回避 [推断]
小鹏图灵(IRON 中 3 颗芯片,2,250 TOPS)聚合 2,250 TOPS不适用不适用仅自用;IRON 量产目标为 2026 年底;2026 年 8 月融资 9 亿美元不可购买
Intel Core Ultra 与 AMD Ryzen AI Embedded40 至 50 TOPS NPU 加集成显卡DDR515 至 45 W广泛可得本轮未研究;作为现场边缘盒子够用,在视觉语言动作模型上不能与 Thor 竞争 [先验知识]

连接模式下的现场服务器方案

方案算力内存价格适配
NVIDIA DGX Spark(GB10)约 1 PFLOP FP4128 GB 统一内存,273 GB/s2025 年 10 月上市时 3,999 美元,2026 年 2 月起 4,699 美元(新蛋 4,399;百思买 5,404)可运行最高约 2,000 亿参数的推理,但受带宽限制:在 3B 激活的混合专家上峰值 92 token/s,仅约为一台 Thor 的 1.3 倍。适合做开发机,以及 2 至 4 台机器人的小型现场记忆与规划器服务器 [推断]
2U 服务器中的一到两块 RTX Pro 6000 Blackwell(每块 96 GB GDDR7)每块 GPU 约 4 PFLOPS FP4每块 GPU 96 GB,约 1.8 TB/sGPU 每块约 8,000 至 10,000 美元 [先验知识];服务器 20,000 至 35,000 美元在 Qwen3.6-35B 上单流 316 至 336 token/s,聚合 800 至 1,000 token/s;可做 GR00T 微调并保持 30 Hz 以上推理。这是 5 至 20 台机器人正确的现场大脑:一个 30 至 70B 的规划器大模型、一个评判器、记忆整合与每夜微调
一组 Jetson Thor 开发套件每台 2 PFLOPS FP4每台 128 GB每台 5,499 美元与单台机器人相同的内存带宽天花板;只有在要求服务器与机器人使用完全相同的软件栈时才合理。不建议作为主要现场服务器 [推断]
云端(经 Live API 的 Gemini Robotics ER 2,或超大规模云厂商的 GPU)不适用不适用按 token 计费每次调用亚秒级,但依赖互联网;新加坡的医院与港口常常禁止把视频送上云;只能作为可选层

机器人到服务器调用的网络时延预算

链路实测时延来源
5G 专网独立组网,实验室下行中位数低于 1 毫秒,99.9 分位 1.1 毫秒Adamuz-Hinojosa 等,经 Firecell
5G 专网,工厂车间,低负载单向上行 3.9 毫秒、下行 4.6 毫秒Silicon Austria Labs,2023
5G 专网,园区平均往返 11.36 毫秒,最大 33.1 毫秒东芝欧洲,2024
5G 专网,安全功能测试台平均往返 20.4 毫秒;急停路径 99 分位 99 毫秒;含 VPN 与可编程逻辑控制器的最坏情况 149.6 毫秒亥姆霍兹-施密特大学,2024(arXiv 2407.15177)
5G 专网,重载有服务质量保障时均值 25 毫秒,无保障时 53 毫秒Firecell 摘要
5G 专网,跨研究的区间7 至 28 毫秒Shah 等
Wi-Fi 6E 对公网 5G 非独立组网,自主移动机器人视频与音频Wi-Fi 6E 视频 123 毫秒、音频 13.9 毫秒;5G NSA 视频 205 毫秒、音频 33.7 毫秒;5G 到云视频 244 毫秒Cambium Networks 现场测试 [单一来源]
经验法则20 km/h 下往返 50 毫秒意味着命令落地前已行进 30 cm;10 毫秒对应 3 cmCambium

本轮未取到 802.11r、k 与 v 之下的 Wi-Fi 6E 漫游实测;行业实践是除非调优快速漫游,否则切换间隙为 50 至 200 毫秒 [先验知识]。工作假设是:无论 5G 专网还是 Wi-Fi 6E,典型往返 10 至 30 毫秒,尾部 100 至 150 毫秒,并在漫游或乘梯期间偶发数秒中断。

现实的划分

功能位置速率 / 时延原因
关节伺服环、双足平衡的全身控制器机上,微控制器加 Thor 的 CPU 核心,或 RDK S100 级的 R52 微控制器伺服 500 至 1,000 Hz;全身控制 100 至 500 Hz硬实时;任何对无线的依赖都不安全
安全监控(急停、地理围栏、速度与间距、碰撞)机上,一个独立的安全控制器100 Hz 或更高,10 毫秒以内响应标准(ISO 10218、13482、3691-4)假定安全在本地;5G 急停路径显示尾部达 99 至 150 毫秒
视觉语言动作模型或操作策略,3B 级机上 Thor重规划 10 至 25 Hz;经分块动作执行 30 至 50 Hz在 Thor 上实测;服务器端视觉语言动作模型更快,但依赖无线
本地感知、SLAM、场景图(工作记忆)机上传感器速率;图更新 1 至 10 HzSolo 模式所需
本地规划器或回退大模型(7 至 8B 稠密,或 3B 激活的混合专家)机上40 至 80 token/s;每 2 至 5 秒一步推理让 Solo 模式可行,代价是任务通用性下降
情景记忆采集(约 1 Hz 描述生成、嵌入)机上1 Hz成本低;Orin 上的 ReMEmbR 模式已经证明
高层任务规划器(30 至 70B)、大模型评判器或校验器、视觉语言模型长时程问答现场服务器,RTX Pro 6000 级每次调用 0.5 至 3 秒;仅在任务边界或异常时调用在 Thor 上无法与视觉语言动作模型并存;对时延不敏感
长期记忆整合、现场知识图、来源、矛盾消解现场服务器秒到分钟,批量多写入方的调和需要单一权威
机群调度(交通、电梯、门、任务有向无环图分配)现场服务器,Open-RMF 内核加一个任务分配器100 毫秒至 1 秒与 RMF 和 DeepFleet 的实践一致
技能库、策略版本、每夜微调、仿真在环现场服务器或云小时级智元的机群强化学习模式;一次 GR00T 微调需要每 GPU 40 至 80 GB 显存

因此,本地模式就是线以上的全部:机器人用一个更小的规划器、一个 30 至 60 分钟的情景缓冲、一份现场知识图的只读副本与保守的交通规则继续工作。连接模式增加了大规划器、评判器、融合场景图与机群调度,并且从不接管控制环或安全。

D 部分:新加坡买家的供应链约束

本部分只覆盖机上与现场服务器算力。

  • Jetson Thor 与 Orin 的分类。NVIDIA 声明 Jetson 模组与开发套件的出口管制分类编码为 5A992.c。这是面向大众市场的加密分类,对新加坡免许可,除分销商条款之外没有客户尽职调查要求。未找到把 Thor 归入 3A090 或 4A090 的来源。[推断:Thor 的 2,070 稀疏 FP4 TFLOPS 低于数据中心 GPU 的总处理性能阈值,且 NVIDIA 在全球范围内销售它。]
  • 《芯片安全法案》(H.R. 3447 与 S. 1705)。2026 年 3 月 26 日以 42 比 0 通过众议院外交事务委员会;截至所读来源尚未成为法律。它覆盖出口管制分类编码 3A090、3A001.z、4A090 与 4A003.z(H100、H200、B200、GB200、MI300X 以及含它们的系统),要求在法案生效后 180 天内实现位置验证。它没有提到 5A992 或 Jetson。它会波及作为 3A090 级部件的 RTX Pro 6000 Blackwell 现场服务器 [推断],也可能波及 DGX Spark;新加坡的进口商被明确点名会受到「特别审查」。
  • 美国工业与安全局 2026 年 1 月规则。对华出口 H200 与 MI325X 改为逐案审批,附带 25% 关税、50% 数量上限、第三方测试与客户尽职调查。它不适用于新加坡的最终用途,但分销商如今在全球范围对 Blackwell 工作站与服务器 GPU 施加客户尽职调查与最终用户声明 [推断]。原本会把新加坡列入第二梯队的《AI 扩散规则》已于 2025 年 5 月撤销。
  • 华为昇腾。美国工业与安全局 2025 年 5 月的指引称,在「在世界任何地方」使用昇腾 910B、C 或 D 有违反美国出口管制的风险,该指引还覆盖「可比的」的中国芯片。昇腾 310 级边缘产品未被点名,但对一家要向有美资背景厂商在场的医院、以及有美国客户的港口销售的新加坡公司而言,任何昇腾部件都是商业负债。
  • 可以干净地进口到新加坡的中国替代品:经微雪、亚博、OpenELAB 与 ThinkRobotics 公开销售的地平线与 D-Robotics RDK S100;瑞芯微 RK3588 与 RK3688;以及黑芝麻在出现零售渠道之后。中国对这些片上系统出口到新加坡没有限制;风险在于未来美国的「可比芯片」措辞与客户观感,而不是合法性 [推断]。
  • 新加坡的规则。适用《战略物资(管制)法》,《2025 年战略物资(管制)令》自 2025 年 12 月 1 日起生效,管制清单最近一次更新为 2026 年 2 月 23 日。清单内物品的出口、转运、过境、无形技术转移与中介均需许可。为国内使用而单纯进口不属于许可活动,但外国出口商可能要求新加坡海关出具国际进口证明书,而在某物是否在清单内不明确时,海关提供预先咨询意见。需要提前规划的情形是再出口含受管 GPU 的机器人,例如把一台装有 Thor 的机器人卖到越南或印度尼西亚 [推断]。
  • 交期与定价。2026 年 7 月的 Jetson 价目表(1KU 下 T5000 4,999 美元、T4000 2,999 美元、Orin 64 GB 2,999 美元)在 LPDDR5X 交期维持 26 至 58 周期间,可以预期保持或上涨,而批量模组订单不可取消、不可退货。开发套件在美国商城间歇性缺货,亚太分销商(Seeed、微雪、Connect Tech、Leetop、Silicon Highway)是实际渠道。

以当前芯片做不到的事

  • 一个大脑经无线为多台机器人运行视觉语言动作模型,用于双足。VLA-Perf 表明它在实验室更快,但 5G 与 Wi-Fi 100 至 150 毫秒的尾部与中断,使其对平衡与操作不安全;没有人形机器人厂商交付它。
  • 实时共享权重,即一台机器人学到的东西立刻可被其他机器人使用的蜂群学习。机群更新是分钟到每夜级:智元每 50 个训练步推送一次,而 Boston Dynamics 的「立即复制」是推送检查点,不是实时。
  • 在机器人上让一个 30 至 70B 的推理模型与视觉语言动作模型并存。Thor 的 273 GB/s 总线在 167 亿参数的视觉语言动作模型上只有 2 Hz,在 3B 激活的混合专家上约 80 token/s;700 亿参数的稠密模型是服务器的活。
  • 让视觉语言动作模型在机上记住整个班次的长上下文记忆。100 个时间步的 KV 缓存把 Thor 降到 8 Hz,1,000 个时间步降到 1.3 Hz。记忆必须在外部并按需检索,而不是放在上下文里。
  • 数十台机器人之间无服务器的点对点共识记忆,以及状态一致的跨站点全局大脑。两者在任何地方都未被演示,而泄漏、过期传播、矛盾与来源这些一致性问题现在才开始被形式化。
  • 把 Gemini Robotics On-Device 2 用作双足的控制器。DeepMind 说明它未在移动平台或全身控制上评估,且在高自由度机器人上吃力。
  • 在涉及美国或欧盟客户时,宣称运行在华为昇腾上,或让核心大脑依赖单一的中国片上系统。

对 Tidewell 的意义

本报告中的任何内容都不改变我们已经公布的东西。Tidewell Brain 有两种模式:Solo 把机器人需要的一切运行在机器人上,包括操作策略、安全监控、本地规划器、工作记忆与滚动的情景缓冲,是一等状态而非备用方案;Crew 把现场网络内的每台机器人接入一份三层的受治理记忆,核心、短期与长期,只有经指定人员才会进入核心记忆。算力划分正是上述测量所描述的那一种:双足用 Jetson Thor T5000,轮式操作机器人用 T4000 并提供 Orin 降本版本,一台 RTX Pro 6000 级现场服务器承担任务规划器、校验器、记忆整合与机群调度。我们不作的声明没有变化:不经无线提供操作策略,权重不在机群间实时更新,机器人上不运行 700 亿参数的模型,策略上下文不保存整个班次,没有跨站点的全局大脑,技术栈中任何位置都不使用华为昇腾。

来源

A 部分

B 部分

C 部分

D 部分