Tidewell Robotics

没有分母的成功率

这个领域里公开得最完整的几次机器人发布,给出的成功率从 32% 到 92%,背后没有一个试验次数;而在人人引用的那个基准上,一个 0.54M 参数的策略几乎追平了一个 4.1B 参数的策略。按这个领域实际跑的试验次数,一个公开的成功率无法把真实的改进与噪声分开。以下是该向机器人厂商索要的东西,以及我们在拥有自己的第一个数字之前,就先把自己绑住的十条规则。

洞察 · 2026 年 9 月 4 日 · 2026 年 9 月 11 日 更新 · 阅读约 12 分钟 · Tidewell 文章团队撰写,Timothy Mo 审校

2026 年 7 月 30 日,Google DeepMind 为 Gemini Robotics 2 公布了十一个成功率 [单一来源]。它们从用簸箕扫地的 32%,一直到拧下灯泡的 92%。

图表的图注里有两句交代方法:"Each bar represents the average success rate over multiple tasks within the same skill category. For multifinger tasks we show individual task performance."(每根条形代表同一技能类别下多个任务的平均成功率。多指任务则给出单个任务的表现。)

两句都读。第二句回答了我们想问的一半:五个多指任务的数字是具名的单个任务,而且它们正好落在区间的两端——92% 是拧下灯泡,32% 是簸箕。另外六根条形是若干个任务的平均,而任务有多少个没有说。所以 DeepMind 确实告诉了你每根条形是什么

这两句话都没有告诉你的,对十一个数字中的任何一个都没有告诉你的,是它算自多少次尝试。页面上其余的地方也没有告诉你。图表画了误差棒,没有数值,背后也没有 N,而画它的是全世界资源最雄厚的机器人实验室。92%,是多少次里的 92%?

Physical Intelligence 的 π0.7,2026 年 4 月 16 日,比这还薄 [单一来源]。从头读到尾,正文里没有给出任何一个数值形式的成功率;成功率只出现在标着「Success Rate (%)」的条形图上,大致在 60% 到 100% 之间 [单一来源——读自图表,正文未给出]。它最醒目的一句是一个比较:π0.7 在这个任务上的成功率,「实际上追平了专家级人类遥操作员的『zero shot』成功率」——比较的两边都没有数字。

这是这个领域里公开得最完整的两次发布。这正是重点:如果最好的披露都这么薄,问题就在惯例,而不在这两家公司。我们在 2026 年 9 月 11 日梳理的六个信息源里——上面这两家读了全文,加上 Skild、波士顿动力、LionsBot 与 Hivebotics [背景]——没有一家公布干预率,也没有一家公布可用率。

所以,一个公开的成功率本身不构成采购证据。不是因为厂商说谎。而是因为按这个领域实际跑的试验次数,这个数字无法把真实的改进与噪声分开,同时几乎没有人公布那个能让买家自己核对的分母。该索要什么,写在下面,连同我们在拥有一个自己要去辩护的数字之前,就先给自己定下的标准。

分母能买到什么

反例是这样一篇论文:它攻击这个领域最受宠的基准,把自己的分数报得略低于它用来对照的那个模型,并且公开了自己的 rollout 次数(rollout 即一次完整的任务执行尝试)、协议与种子波动带,好让任何人都看得出这个差距值不了多少。MINERVA——Sendai、Matsushima 与 Iwasawa,arXiv 2609.03715,2026 年 9 月 3 日——问的是:一个操作策略可以小到什么程度,还能解出 LIBERO。答案是 0.54M,也就是 54 万个参数,在四个标准套件上取得 95.05%(摘要取整为 95.1)。这比表 I 里那个 LeRobot 的 π0.5 移植版低 2.4 个百分点,而表 I 把它直接写明:4.1B,41 亿个参数,四套件平均 97.50%,参数比 7,700 倍。这个除法自己做一遍:4.1 × 10⁹ ÷ 0.54 × 10⁶ 等于 7,593 [推断]。四个数字彼此自洽,所以四个我们都印出来。

现在是更要紧的部分。MINERVA 公布了自己的分母——「标准 LIBERO 的结果用的是每个任务 50 个回合 × 10 个任务 × 4 个套件 = 2,000 次 rollout,固定随机种子」——也公布了自己的噪声底:「单是换一个训练种子,四套件平均值就会移动 ±1 个百分点(基线跨 94.60 至 96.75;仅长程套件一项就跨 87.6 至 92.8)」。

那个头条里的两个数字并不共用一个分母。MINERVA 的 95.05% 来自 2,000 次 rollout;表 I 里 π0.5 那一行,是 LeRobot 实现自己报告的结果,而表格写明了它靠的是什么——「每任务 10 个回合,400 次 rollout」。少五倍。是这篇论文自己披露的,这也是本段能够存在的唯一原因。

差距是 2.4 个百分点。它自己声明的种子波动带是 ±1 个百分点,而基线自身的四套件平均值,仅仅因为训练种子就横跨 2.15 个百分点 [推断]。所以,一个 0.54M 的策略与一个 4.1B 的策略之间被报出来的差别,勉强只有一个随机种子所带来的噪声的两倍出头。它之所以还站得住,是因为 MINERVA 把 2,000 次 rollout 汇总在了一起。按这个领域通常报告的每任务 50 次 rollout 的粒度,一个 95% 的单元格带着 13.3 个百分点宽的威尔逊区间 [推断],那张表里每一个单独的单元格,在统计意义上都什么也说不了。

这一切我们之所以知道,只因为 MINERVA 说了。这就是分母的理由,而把它讲出来的,是这组材料里最讲纪律的那篇论文,不是最不讲纪律的那篇——同样的纪律还带出两个发现。一个任务 ID 置换探针改任务 ID 的映射,场景、机器人与任务本身一概不动,而它「把成功率降到接近随机」:LIBERO 的指令条件化,很大程度上是在已记住的任务之间做选择。在 LIBERO-Plus 的扰动之下,同一个策略掉到 46% 至 56%。

四个数量级的参数,换 LIBERO 上的 2.4 个百分点四个数量级的参数,换 LIBERO 上的 2.4 个百分点LeRobot π0.5,4.1B 参数表 I 所报告:400 次 rollout97.5 %MINERVA,0.54M 参数2,000 次 rollout:50 × 10 × 4 个套件95.05 %同一个策略,LIBERO-Plus被扰动的测试分布46–56 %097.5MINERVA,0.54M测试集被扰动4.1B 的对照公布的区间
  • LeRobot π0.5,4.1B 参数 — 97.5 % — 表 I 所报告:400 次 rollout
  • MINERVA,0.54M 参数 — 95.05 % — 2,000 次 rollout:50 × 10 × 4 个套件
  • 同一个策略,LIBERO-Plus — 46–56 % — 被扰动的测试分布
  • MINERVA,0.54M
  • 测试集被扰动
  • 4.1B 的对照
  • 公布的区间
参数与 LIBERO 成功率,出自 MINERVA 的表 I——Sendai、Matsushima 与 Iwasawa,arXiv 2609.03715,2026 年 9 月 3 日。四个数量级的参数差,41 亿对 54 万,换来四个标准套件上的 2.4 个百分点;而扰动测试分布要付出三十九到四十九个百分点。MINERVA 写明了自己那一行背后的分母——2,000 次 rollout,固定种子下的 50 个回合 × 10 个任务 × 4 个套件——也写明了对照那一行背后的分母,即 LeRobot 移植版所报告的结果,每任务 10 个回合,400 次 rollout。它还声明了四套件平均值上 ±1 个百分点的种子波动带,而这是任何人得以看出那个 2.4 个百分点的头条只比论文自己的噪声多出一倍的唯一原因。RIPL 那个 0.09B 参数的探针本该出现在这条轴上,却画不出来:那份审计说它「达到或接近已报告的最好结果」,并且没有为它公布任何数字。

有些基准比另一些好得多

2026 年 6 月 2 日,RIPL 的 Jiang、Tan、Wheeler、Sun、Ayalew 与 Walter(arXiv 2606.04233)审计了五个操作基准,问它们究竟在测什么。他们点出四种失效模式,每种配一个诊断——捷径可解、缺乏统计显著性、逐渐过拟合、数据源依赖——全都归在这篇论文里最干净的一条原则之下:「一个基准分数只有在任何取得它的策略都确实具备那项能力时,才算作能力的证据。」在 LIBERO 上,「一个简单的 0.09B 探针,没有语言编码器,也没有大规模机器人预训练,就达到或接近已报告的最好结果」。在 CALVIN 上,「在训练范围之内随机化积木位姿,会让每一个被测策略的表现下降」——是训练范围之内,不是之外。

然后是买家真正能用的那个数字。「在 LIBERO 与 SimplerEnv 上,分别只有 19.8% 与 19.7% 的 SOTA 声称是可证显著的。在 RoboCasa 与 RoboTwin 2.0 上,这个比例升到 53.3% 与 73.7%。」[单一来源]

这是一种不对称,不是一纸判决。在最常被引用的那两个基准上,五个声称里有四个无法被证明是真的;在另外两个上,多数可以,而那两个在进展宣传里出现得少得多。所以该拿去问厂商材料的问题是:哪一个基准,以及这个基准上有多大比例的声称扛得住显著性检验。而不是基准是否毫无意义:LIBERO 能被 54 万个参数解出来,这件事本身就是一个有用的事实。

有一处限度我们有义务说明。我们能读到的任何地方,这份审计都没有点名「可证显著」(provably significant)背后用的是哪个检验,也没有给出每次评测跑了多少次。我们可以引用 19.8%;我们说不出它是怎么算出来的。

那道算术,以及是谁先说的

丰田研究院(TRI)在我们之前就说过这件事,公开地说,用平白的英文说,背后的证据比任何人攒起来的都多。TRI 的大型行为模型(LBM)研究——arXiv 2507.05331,2025 年 7 月 7 日,后发表于《Science Robotics》2026 年——跑了 1,800 次真实世界评测 rollout,以及超过 47,000 次仿真 rollout,每个真实世界任务 50 次,每个仿真任务 200 次。它的 §4.1.5 描述了方法:一个序贯假设检验框架,"sequentially compares paired outcomes of each evaluation trial until either a decision is reached or all the trials are consumed."(对每一次评测试验的配对结果逐次比较,直到得出判定,或者试验全部用完。)

他们的结论在 LBM 的项目页 toyotaresearchinstitute.github.io/lbm1/ 上:"It's easy for noise due to experimental variation to dwarf the effects being measured, and many robotics papers may be measuring statistical noise due to insufficient statistical power."(实验变异带来的噪声很容易盖过被测量的效应,而许多机器人论文由于统计效能不足,测到的可能只是统计噪声。)同一个页面把它量化了:"With 50 rollouts, for example 10 rollouts each on 5 behaviors, the resulting CI width is generally 20% to 30% absolute success rate."(在 50 次 rollout 下,例如 5 个行为各 10 次,得到的置信区间宽度一般是绝对成功率的 20% 到 30%。)Badithela 及其同事(arXiv 2510.04354)对实践给出同样的判断:策略「在很少的硬件试验上被评测,没有任何统计保证」。

我们能找到的任何来源,都没有提供买家需要的那个数字:要把这个领域惯常声称的效应量分开,需要跑多少次试验。所以我们自己算了,并把公式印出来,好让人拿计算器核对。n 次试验里有 x 次成功,令 p̂ = x/n,z = 1.96,则 95% 威尔逊得分区间的半宽为 (z/(1 + z²/n))·√(p̂(1−p̂)/n + z²/4n²);下面的宽度是它的两倍。在观测值 90% 处,区间宽度在 n=10 时为 38.6 个百分点,n=20 时为 27.3,n=50 时为 17.0,n=2,000 时为 2.6 [推断]。

由此掉出两件事。第一,一次对 TRI 的核对:在 n=50、p̂=0.50 处,我们的算术给出 26.7 个百分点 [推断],稳稳落在 TRI 公布的区间之内,而且是独立算出来的。第二,是没有人印出来的那个数字。按标准的两比例检验,双侧 α = 0.05、效能 80%,要把 90% 与 92% 分开,每组需要 3,213 次试验;要把 MINERVA 的 95.1% 与 π0.5 的 97.5% 分开,每组需要 970 次 [推断]。

这个领域跑 20 到 50 次。

区间宽度对试验次数,观测值为 90%区间宽度对试验次数,观测值为 90%n = 1038.6 个百分点n = 20SO-101,每个模型-任务 20 个回合27.3 个百分点n = 3022.2 个百分点n = 50TRI 每个真实任务;MINERVA 每个任务17 个百分点n = 10011.9 个百分点n = 320SO-101,四个模型与四个任务合计6.6 个百分点n = 1,0003.7 个百分点n = 2,000MINERVA 的 LIBERO 汇总2.6 个百分点两个百分点的改进,也就是这个领域惯常声称的效应038.6几乎没有人跑的次数这个领域实际所在,20 到 502 个百分点,那个声称
  • n = 10 — 38.6 个百分点
  • n = 20 — 27.3 个百分点 — SO-101,每个模型-任务 20 个回合
  • n = 30 — 22.2 个百分点
  • n = 50 — 17 个百分点 — TRI 每个真实任务;MINERVA 每个任务
  • n = 100 — 11.9 个百分点
  • n = 320 — 6.6 个百分点 — SO-101,四个模型与四个任务合计
  • n = 1,000 — 3.7 个百分点
  • n = 2,000 — 2.6 个百分点 — MINERVA 的 LIBERO 汇总
  • 两个百分点的改进,也就是这个领域惯常声称的效应 — 2 个百分点
  • 几乎没有人跑的次数
  • 这个领域实际所在,20 到 50
  • 2 个百分点,那个声称
95% 威尔逊得分区间的宽度对试验次数,观测值为 90%,z = 1.96。这道算术是我们自己的 [推断],按上一段里的公式算出,拿计算器就能复现。按这个领域实际跑的次数,一个公布出来的 90%,在 n = 20 时意味着 69.9% 到 97.2% 之间,在 n = 50 时意味着 78.6% 到 95.7% 之间。即使跑满 2,000 次,仍留下 2.6 个百分点的区间,还是比论文惯常声称的两个百分点的改进更宽。图上的标注标出真实协议落在试验次数轴的什么位置;这里每一个宽度都按 90% 算,而不是按那项研究自己的成功率算,所以 MINERVA 实际的汇总值,2,000 次 rollout 上的 95.05%,要更窄,是 1.9 个百分点。

这篇文章不能豁免于它自己的规则。我们最好的来源里有三个引用了一个没有分母的百分比。RIPL 那份审计的 19.8% 没有点名检验,也没有给出 n。Moritz Reuss 对 ICLR 2026 的 164 篇 VLA 投稿所做的综述——现有对基准饱和最尖锐的公开批评,也正是那篇说出「LIBERO 基本已经被解出来了,拿 99% 对 98% 说事没什么用……」的文章——里面只有一个数值比例,「本文提到的论文里有 90% 都在 LIBERO、SIMPLER 或 CALVIN 上测试」[单一来源],而它的分母是一个读者数不出来的集合。MEMOBench(arXiv 2609.07047)为最强的记忆模块基线报出「31.9% 的平均成功率」[单一来源;全新、单一团队、仿真],背后没有任何试验次数。没有一处是不诚实的;惯例就深到这个程度——深到在写这篇文章的过程里把我们自己也逮住了两次。

一份对 RIPL 页面的摘要,递给我们的研究员一个关于 CALVIN 的、干净利落的显著性数字,而那个数字在那个页面上根本不存在;它是靠换一个更窄的问题重新抓取一遍才被抓出来的。上面那段 MINERVA 的比较,在本文里、也在本文的图里,一直是一场干净的正面对决,直到评审:我们没有把表 I 的脚注读得够细,没有注意到一边靠的是 2,000 次 rollout,另一边靠的是 400 次。它现在之所以是这个样子,是因为有人回到了原始来源。

该索要什么

已经有人公布得很好,而且是任何人都能照抄的方式。Yu 与 Qiu 的 SO-101 研究(arXiv 2606.08881,2026 年 6 月 7 日,两位作者,低成本硬件)在方法部分写明了自己的分母——「对每一个模型-任务组合,我们跑 20 个独立的真实世界评测回合,四个模型与四个基准任务合计 320 个评测回合」——点名了一套失败分类,并把恢复率定义为「N_成功恢复 / N_恢复机会」,两个项都写了出来。一个把分母写进定义里的分数式指标,正是本文所要的东西。它没有报告置信区间,所以它是半套协议:在 n=20、观测值 95% 处,威尔逊区间从 76.4% 到 99.1%,宽 22.7 个百分点 [推断]。任何人能做出的最便宜的可信贡献,就是把这项研究加上区间再做一遍。

还有两个。RoboArena(arXiv 2506.18123)在七家机构、七个策略上跑了超过 600 次成对的真机回合,评测者「必须对成对的策略执行双盲评测」:它的贡献是协议,不是算力。Tommoro 的 Habilis-β(arXiv 2602.18813)把干预做成头条指标,每小时 124 个任务,对应 137.4 秒的平均干预间隔时间,仿真数字单列。

这一组里公开得最好的,出自一家厂商。Dyna Robotics 的 DYNA-1 页面以「99.4% 的成功率——零干预,整班可靠」开头,说的是一次 24 小时连续运行中叠出的 850 条以上餐巾 [单一来源],然后在下一段就把它背后的分布公布出来:「虽然 98% 的折叠达到接近完美的质量(等级 ≥3),只有 75% 达到我们严格的质量标准。」多数公司在第一段之后就停了。

所以,七个问题,短到可以直接粘进招标文件。

  1. 跑了多少次,测的是什么? 每一个百分比背后、按任务给出的分母。
  2. 置信区间是多少,用的是哪种方法? 点名方法,好让人复现。
  3. 要各个条件下的单元格,不要汇总值。 哪个任务,哪个场地,哪一天。
  4. 什么算失败,什么算恢复? 在开跑之前就成文写定。
  5. 干预率是多少? 按小时计,旁边附上遥操作小时。
  6. 仿真还是实机? 每一个数字分别说明。
  7. 是谁跑的,他们是否对受测的系统不知情?

答不出这些的厂商,未必是在卖一台差的机器人。他们是在卖一台性能还无法被评估的机器人,而这是两桩不同的买卖,价格也不同。

我们在有数字之前先签下的规则

我们没有机群数据,也没有公布过任何结果。我们记分板上六行产品的每一个单元格都是故意空着的,而板上唯一的那个目标 taskSuccessRate: 95,是一块空板上的一个目标——不是结果,不是接近结果,在有一个分母坐到它旁边之前,也不是一个声称。我们大脑页上的承诺,即我们销售的任何任务,目标是 95% 无干预成功率,并且公布这个数字,此前背后没有协议。这就是那份协议,自今日起生效。它管的是我们可以公布什么,而不是我们必须做到什么,所以在手上一个测量都没有的时候,每一条规则也都能被遵守。

  1. 没有分母就没有成功率。 Tidewell 公布的每一个百分比,都在同一句话里或相邻的单元格里带上它所算自的试验次数。一个没有分母的比例不上记分板,也不进任何一份对外材料。
  2. 没有区间就没有点估计。 每一个公布的成功率都带一个 95% 威尔逊得分区间,并点名方法,好让人复现。威尔逊是用于比例的,而我们记分板五列里有四列不是比例:任何其他公布出来、属于估计而非计数的量——每小时干预次数也在其中——都带一个区间,并各自点名自己的方法。凡是区间比所声称的效应更宽的,先印区间。
  3. 先分条件,后汇总。 比例按任务、按场地、按条件公布。汇总值只在与它背后的那些单元格一同公布时才公布,绝不取而代之。
  4. 一份成文的失败定义,在开跑之前就定下。 什么算失败、什么算恢复、什么算干预,在开跑之前写下来,并原样连同结果一起公布。我们采用 SO-101 的形状:一套具名的失败分类,以及把分母写进定义里的分数式恢复率。
  5. 干预计入,绝不冲抵。 每小时干预次数与每一个成功率并列公布,遥操作小时随之一同公布。一个在人接管操纵之后才完成的任务,不是成功。
  6. 仿真与实机绝不混进同一个数字。 每一个数字都标明是仿真还是实机。仿真数字绝不作为现场性能的证据公布,有没有迁移论证都一样。
  7. 是谁跑的,他们是否不知情。 每一个结果都点名跑它的那一方,并说明评测者是否知道受测的是哪个策略或哪台机器——包括答案是「未设盲」的时候。
  8. 每一个声称都带一节局限。 取自 CoRL 2026:限制性假设、失效模式,以及我们没能测到的东西,连同结果一起公布,而不是等人来问。
  9. 1 倍速,不剪辑的视频。 取自 Holson 为他的 Humanoid Olympic Games 定下的规则:"a 1x speed video with no cuts… running autonomously."(1 倍速、无剪辑、自主运行的视频。)任何经过剪辑或加速的片段都标为示意,并且不带任何数字。凡是带数字的片段,片段本身未经剪辑,干预次数与它一同说明。
  10. 那条要付代价的规则。 当一个数字在这套协议之下比不用它时更难看——当区间吞掉了那个声称,当分条件的拆解暴露出一个我们宁愿平均掉的单元格,当一次干预计数把 95% 变成 80%——我们公布更难看的那个数字,在这套协议之下公布,而更好看的那个哪里都不公布。我们不会因为不喜欢一次测量就把它撤掉。已公布的数字在原处更正,注明日期,原值保持可见。这条规则约束的是同一次测量:我们所压下的,是把一套更宽松的方法套在我们实际跑过的那一次上——不是汇总值,规则 3 要求我们把汇总值连同它背后的那些单元格一并公布;也不是后来一次确实更好的运行所得的结果,那个结果照样在这同一套协议之下公布,带上它自己的分母与区间。

那块板背后的五列——任务成功率、遥操作小时、自主运行小时、每小时干预次数与机群运行小时,列在我们的数据页上——在被填上的时候,六行产品上的每一列都会带一个试验次数和一个区间。

十条里只有规则 10 对我们有代价,所以它也是唯一一条能证明另外九条的规则。而它今天还是免费的:我们没有任何东西可压。账已经签下,代价还没有付,而板是公开的,所以任何人都可以看我们付不付。