Tidewell Robotics

谁检查过我们的检查

语言模型规划器会提出危险的动作,而规模并不能修复这一点:在一个 12,279 项任务的基准上,规划得最好的模型有 28.3% 的方案是危险的,安全意识从 3B 到 671B 参数一直持平。所以,握住执行器的是规划器之外的东西。我们公布了它必须通过的五项检查。每一项都有已发表的先例,其他团队已经在真实机器人上组合出了形状相当的关口,而没有人公布过的那一个数字——包括我们自己——是这样一道关口对照真实机器人的任务周期,每个动作要花多少成本。

洞察 · 2026 年 9 月 7 日 · 2026 年 9 月 14 日 更新 · 阅读约 14 分钟 · Tidewell 文章团队撰写,Timothy Mo 审校

2026 年 4 月 20 日发表的一个基准,把 12,279 项任务摆在 23 个模型面前。规划能力最强的那个模型,只有 0.4% 的任务没有给出有效方案,却有 28.3% 给出了危险方案(DESPITE,arXiv 2604.18463,Zhang、Qu、Li、Wu、Hutter、Li 与 Shi)。它会规划。它规划出来的,是不该做的事。

这道缺口,就是我们的架构里有一道校验关口的原因;它也是一个我们自己的文件曾经写错的结果。DESPITE 发现持平的是规模:在 3B 到 671B 参数的 18 个开源模型上,规划能力从 0.4% 爬到 99.3%,安全意识却一直停在 38% 到 57% 的区间里——"larger models complete more tasks safely primarily through improved planning, not through better danger avoidance"(更大的模型之所以安全完成更多任务,主要靠的是规划能力的提高,不是更会避开危险)。推理并不持平。23 个模型中的三个专有推理模型达到 71% 到 81% 的安全意识,而非推理的专有模型与开源的推理模型都停在 57% 以下。推理训练确实买到了一些东西,而在最顶端仍然留下大约五分之一的方案是危险的 [推断——按 DESPITE 自己给出的 81% 上限做的算术]。在这组模型里规划最强的那一个身上,会规划(99.6%)与规划得不危险(71.7%)之间的距离,就是在规划器之外设一道关口的理由 [推断——DESPITE 自己给出的 0.4% 与 28.3% 的补数]。

地板在这一切之下。SafeAgentBench(arXiv 2412.13178)是 10 个危险类别下的 750 项任务,对 9 个基线,在交互式仿真里,不在实体机器人上:"The most safety-conscious baseline achieves only a 10% rejection rate for detailed hazardous tasks. Moreover, simply replacing the LLM driving the agent does not lead to notable improvements in safety awareness."(最有安全意识的基线,对写得详细的危险任务也只有 10% 的拒绝率。而且,单纯换掉驱动智能体的 LLM,并不会带来安全意识上的明显改善。)

由此得出的架构结论,已经有不是我们的人论证过。《Modular Safety Guardrails Are Necessary for Foundation-Model-Enabled Robots in the Real World》(arXiv 2602.04056,Kim 与来自多家机构的十一位合著者,2026 年 2 月 3 日)认为,静态验证、单体控制器与端到端学习策略各自单独都不够,并提出 "modular safety guardrails, consisting of monitoring (evaluation) and intervention layers, as an architectural foundation"(以监测层(即评估层)与干预层组成的模块化安全护栏,作为架构基础)。这是一篇没有基准的立场论文,当作立场论文来读。Parallax(arXiv 2604.12986)说得最重 [单一来源——一位作者,没有发表场所,方法与实现都是它自己的]:"Cognitive-Executive Separation, which structurally prevents the reasoning system from executing actions"(认知—执行分离,从结构上阻止推理系统执行动作)[单一来源]。

这些都不能让一台机器人变得安全。安全功能在机器人上,在一条任何模型输出都到不了的确定性链路里;关口是另一样东西,它以一个说得出名字的代价,减少一类说得出名字的规划器失效,在任务边界与异常时运行,从不在控制环内。

五项检查,以及每一项各接住哪种失效

这份清单发表在智能体团队技术页上,没有附推导:

校验器检查五件事:几何,即触及范围与路径是否放得下、物体是否在规划器认为的位置;现场规则,即区域、限时限制与现场的例外政策;安全限制,即速度与间距、负载,以及作业单元内是否有人;前置条件,即电梯预约、门与门禁;以及范围,即这台机器人是否被允许执行这项任务与这次工具调用。

五类失效:一个不可能实现或会碰撞的方案;一个可以实现但在这里被禁止的方案;一个被允许但太快或太近的方案;一个世界还没准备好的方案;一个这台机器人无权执行的方案。

读者有理由问:这份清单是不是我们编出来的。我们去找先例的时候,预期找到的是孤儿。五项都有先例。

每一项最先是谁检查的

几何。《Bridging Semantics and Physics with Constrained LLMs for Safe and Trustworthy Robotic Manipulation》(arXiv 2608.29379,Hong、Wei 与 Zhang,2026 年 8 月 29 日;ECCV 研讨会论文)。格式错误的 MCP 工具调用在到达机器人之前被拒绝,幸存的每一次调用都落到一条 MoveIt Task Constructor 流水线上:"Only trajectories that pass both kinematic and collision checks are sent to the robot."(只有同时通过运动学检查与碰撞检查的轨迹,才会被发送给机器人。)在一台实体 UFactory 850 上,每项任务十次试验:倒水最高 80% 成功,抓取放置 90%,最难的任务 60%,对照脚本策略的 10%。这是五行里最扎实的一行——真实操作硬件,试验次数写在论文自己的句子里。

**现场规则。**AgentSpec(arXiv 2503.18666,Wang、Poskitt 与 Sun;ICSE 2026)把用户定义的运行时强制执行包在智能体的决策外面:触发器、谓词与强制动作,手写或由模型生成,在代码智能体、具身智能体与自动驾驶车辆上分别评测。叫 AgentSpec 的 arXiv 论文有三篇互不相干,我们用的是 2503.18666:标识符走得动,名字从来走不动。

这一行,是我们自己的规则差点让我们付出代价的地方。摘要里的数字——代码智能体案例的 90% 以上、具身智能体任务中的全部危险动作、模型生成规则的一个精确率与一个召回率——没有一个带着案例数或任务数。没有分母的比率无法核对:这条规则我们是冲着厂商发布的,而把它用到一篇我们所倚赖的论文上,意味着读到摘要之外去,而不是把数字划掉。计数在论文里。表 6 把每个风险数据集拆成上下文示例与测试集——750 个代码场景留出 75 个,250 个具身场景留出 25 个,8 个自动驾驶场景一个不留——并在余下的部分上给 OpenAI o1 生成的规则打分:87.26%、95.56% 与 62.50%,即 675 中的 589、225 中的 215、8 中的 5。最后这个数字属于生成的规则,不属于 AgentSpec,AgentSpec 自己在同样这八个违法场景上的自动驾驶强制执行是 100%,八个场景在表 5 里逐一列出。开销也不只是"以毫秒计":谓词求值在代码智能体上平均 2.83 毫秒,在具身智能体上 1.11 毫秒,解析 1.42 毫秒,对照的智能体平均执行时间分别是 25.4 秒与 9.82 秒。仿真的智能体,逐组件而非端到端,所以它们并没有关上本文结尾那个问题。但它们是发表了的,带着分母,而本段的第一稿说它们没有。

安全限制。《How Long Until Your Robot Ignores You?》(arXiv 2609.07288,Bajrami、Elshamouty 与 Kraus,2026 年 9 月 7 日;CBS 2026)在一套 MCP 架构之上定义了五条可测试的安全不变量,"grounded in ISO 10218-2:2025 protective measures"(以 ISO 10218-2:2025 的防护措施为依据)。只有第一层的结果——文本提示——40 个会话、每个会话 100 轮,跨三个云端后端与一个本地开放权重基线 qwen3:8b。模型家族定下地板:两个后端的违规次数在零或接近零,GPT-4o-mini 每个会话最多 13 次。上下文管理随后把两条轴掰开。每个云端后端的平均行为问题下降 42% 到 57%,而 GPT-4o-mini 的违规几乎翻倍,每会话从 3.8 次到 7.2 次。"The simulation and physical layers remain ongoing"(仿真层与实体层仍在进行中):初步的仿真层复现了这个排序,而在一台 Unitree G1 EDU 人形机器人上的实体验证是一份设计,不是一个结果。

**前置条件。**VerifyLLM(arXiv 2507.05118,Grigorev、Kovalev 与 Panov;IROS 2025)把指令翻译成线性时序逻辑,再在执行之前分析动作序列里缺失的步骤、冗余与顺序错误。分母:71 条指令,0.5B 到 3B 的五个模型,仿真家居任务,没有机器人。真正要紧的数字是它自己的消融,表 III:完整系统的序列相似度 0.183,去掉 LTL 翻译模块 0.178,去掉 LLM 验证 0.0717。去掉形式逻辑这一步——正是它让这篇论文成为前置条件的先例,而不是第二遍语言模型——代价是 0.005,对照语言模型验证值的 0.111 [推断——对表 III 的读法;表是一手材料]。干活的是语言模型,而 0.183 的绝对值意味着经过验证的方案与参考方案仍相去甚远。这是我们最没有把握的一行,原因是这组消融,不是缺一个时延数字。SELP(arXiv 2409.19471;ICRA 2025)与之相邻,但不是第二道关口:对照 Büchi 自动机的约束解码让规划器发不出违规的 token,其中没有任何东西可以拆出来放到另一个规划器前面。它确实报告了规划时间,作为仿真中对两个基线的相对比较。

范围。《Contract-Grounded Behavior Tree Synthesis via Coding Agents》(arXiv 2607.12220,Salfity、Anderson 与 Pryor,2026 年 7 月 13 日;已投 RA-L,未录用)。一个编码智能体在合成行为树之前,先向机器人侧的 MCP 服务器索取 "an explicit contract consisting of a skill library, permitted BT operators, and optional BT composition templates"(一份明确的契约,由技能库、允许的行为树算子与可选的行为树组合模板构成),而 "a robot runtime validation gate enforces correctness before execution"(一道机器人运行时验证关口在执行前强制保证正确性)。在 PyRoboSim 的 110 项仿真任务与一台实体 Husarion Panther 上的 14 项任务上,"contract grounding enables near-perfect BT validation"(契约接地使行为树验证接近完美)。契约放在机器人上,这才是要紧的性质:这具身体可以做什么,权限握在身体手里,不在提出请求的规划器手里。

发表场所不是装饰。五项里有两项被顶级会议录用,ICSE 与 IROS;SELP 的 ICRA 录用挨着前置条件那一行,不在那一行里。几何一行是研讨会论文,范围一行是一份投稿,安全限制一行是 CBS 2026,三层评测有两层没做完。

  1. 语言模型规划器提出一个动作。在 DESPITE(arXiv 2604.18463,12,279 项任务,2026 年 4 月)的 23 个模型中规划最强的那一个身上:0.4% 的方案无效,28.3% 危险。
  2. 1. 几何触及范围与路径是否放得下,物体是否在规划器认为的位置。先例:arXiv 2608.29379(2026 年 8 月),ECCV 研讨会论文。实体 UFactory 850 机械臂,每项任务十次试验:倒水最高 80% 成功,抓取放置 90%,最难的任务 60%,对照脚本策略的 10%。
  3. 2. 现场规则区域、限时限制、现场的例外政策。先例:arXiv 2503.18666(2025 年 3 月),ICSE 2026。代码智能体、具身智能体与自动驾驶车辆,在仿真中。一条用户定义的规则在被提出的动作执行之前对它触发。分母在论文的表 6 里而不在摘要里:OpenAI o1 生成的规则在 675 个未见过的代码场景上强制执行了 87.26%,在 225 个具身场景上 95.56%,在 8 个自动驾驶场景上 5 个。AgentSpec 自己在同样这八个场景上的自动驾驶强制执行是 100%。
  4. 3. 安全限制速度与间距、负载、作业单元内是否有人。先例:arXiv 2609.07288(2026 年 9 月),CBS 2026。只有文本提示——三层中的第一层,仿真层与实体层未完成。GPT-4o-mini 每个会话最多 13 次违规,40 个会话、每个会话 100 轮。
  5. 4. 前置条件电梯预约、门、门禁。先例:arXiv 2507.05118(2025 年 7 月),IROS 2025。仿真家居任务,没有机器人:完整系统的序列相似度 0.183,去掉时序逻辑模块 0.178,71 条指令。
  6. 5. 范围这台机器人是否被允许执行这项任务与这次工具调用。先例:arXiv 2607.12220(2026 年 7 月),已投 RA-L,未录用。PyRoboSim 的 110 项仿真任务与一台实体 Husarion Panther 上的 14 项,契约放在机器人上而不在规划器里。
  7. 机器人侧安全功能一条任何模型输出都到不了的确定性链路。独立于上面的一切,也是为什么让机器人安全的不是上面那道关口。
  8. 执行器

每个箭头是一个被提出的动作传到下一项检查。关口在任务边界与异常时运行,从不在控制环内。

第六个挂钩,吊在链条末端

6. 每个经校验动作的端到端成本,对照实体机器人的任务周期先例:无。

画成空的,因为它就是空的。我们找不到任何一项工作把这五项检查组合成一道串行关口并公布这个数字——我们自己也没有。

  • 一个普通部件:提出动作的规划器
  • 边界的我们这一侧——五项检查,如我们所发布
  • 机器人上一个独立的安全控制器,任何模型输出都到不了
  • 一个没有任何已发表结果可挂的挂钩,包括我们的
五项检查与智能体团队技术页所发布的一致。每一项先例都是另一个团队各自建成并发表的系统——不是我们集成过的组件,也不是实现了我们这道关口的系统。图中每一个结果都带着分母,也都属于别人:本图里没有一个数字是我们的测量,因为我们没有在任何机器上测过任何东西。来源:如各处标注的 arXiv 标识符,检索于 2026 年 9 月 11 日。

给关口定过价的人,算出了什么

ProbGuard(arXiv 2508.00500,Wang、Poskitt、Wei 与 Sun;ASE 2026)是这里唯一一篇把成本与完成率成对公布的工作。在具身家居智能体任务中,它的重新提示干预 "reduces unsafe behavior by 65.37% relative to the unmonitored baseline while retaining 80.4% of the baseline task completion"(相对无监测基线把不安全行为减少 65.37%,同时保留基线任务完成率的 80.4%)。更严格的中止配置把不安全行为减少 93.60%,"at a larger cost in completion"(以更大的完成率代价),而没有为它公布完成率——这一对的第二个点不存在,我们不会穿过一个点画一条线。它的预警提前量,在不产生误报的阈值下最长 15.84 秒,在更严格的阈值下最长 38.66 秒,来自自动驾驶,不是机械臂。ProbGuard 与 AgentSpec 是同一个团队,ProbGuard 是对 AgentSpec 一项局限的回应:反应式规则只在不安全行为迫在眉睫或已经发生时才触发。五行先例中的一行,加上成本这一行,追溯到同一个实验室。

在机器人规划器前面放一层 LLM 裁判做验证,其唯一公开的墙上时钟成本,来自《Agentic Harnesses: LLM-Driven Verification Layers for Robot Autonomy》(arXiv 2608.09857)[单一来源]:一份未经评审的七页预印本,arXiv 上的备注写着 "7 pages. Not yet finalized for conference submission"(7 页。尚未定稿投会),致谢里承认是美国能源部 SULI 本科生实习的工作。五个裁判模型,加上第六个做首席裁判,首席裁判在从未看过方案的情况下裁定五个裁判推理的质量。在 58 份 AI 生成、人工标注的方案上,加权平均精确率 0.85,宏平均 0.83,准确率 0.81,分类别为接受 0.91、升级 0.61、拒绝 0.96 [单一来源]。它的摘要声称对对抗攻击的遏制率为 97%;同一篇论文的表 2,在同一个含 31 份真值拒绝的 38 份方案集上,报告的遏制率是 1.00,严重失效率 0.00 [单一来源]。论文自相矛盾,没有第二版,也没有一个本该抓住这一点的发表场所——而它的摘要和我们自己的文件都从未带上的那个数字,就在那张表里:安全方案通过率 0.67,而那个 38 份方案集里接受类的支持数是三,所以它的意思是两份真正安全的方案通过、一份被拦下 [单一来源]。时延方面,五裁判运行在 58 份方案上平均 24.2 秒;在 55 份方案上,一、三、五、七个裁判分别为 27.76、28.94、28.69 与 31.56 秒,随集成规模几乎不变,因为裁判是异步运行的 [单一来源]。

失效模式不是坏方案漏过去。而是关口迟迟不作决定,人工队列越排越满:58 份方案上的升级类精确率 0.61,38 份上人工评审覆盖 0.14 的不安全方案 [单一来源]。这条队列末端的人要付出什么,是另一个论证,另行发表

谁已经把它造出来了

有两个团队已经组合出了这种形状的关口,并把它放到了真实机器人前面。

SafeGate(arXiv 2604.05427,Obi 与七位合著者,2026 年 4 月 7 日)是 "a neurosymbolic safety architecture that prevents unsafe natural language task commands from reaching robot execution"(一套神经符号安全架构,阻止不安全的自然语言任务指令抵达机器人执行)。它从 ISO 13482 中抽出结构化的安全属性,用一道确定性决策关口批准或拒绝,把通过的部分分解为由不变量、守卫与中止条件构成的任务安全契约,再对得到的约束运行 Z3 SMT 求解——跨 230 项基准任务、30 个 AI2-THOR 场景与真实世界机器人实验。以标准为依据的不变量检查、一道确定性关口、按任务的契约与一个形式求解器,装在同一个预执行架构里,比我们发布自己的清单早了五个月。整篇论文没有报告任何时延。

RoboGuard(arXiv 2503.07885,Ravichandran、Robey、Kumar、Pappas 与 Hassani;IEEE RA-L,2026 年 2 月录用)把预先定义的安全规则接地为时序逻辑规约,用一个受屏蔽的信任根模型,再用控制综合来化解与方案的冲突。它把不安全方案的执行率从 92% 以上压到 3% 以下,覆盖 1,500 次以上的评测——70 种对抗行为,每种攻击 210 次评测——并在一台 Clearpath Jackal 上做了真实世界验证,对 35 种有害行为与十种安全行为。它用自己的话把效率列为一项期望性质:"(D4) Efficiency. Safeguards should minimize additional offline and online computational costs and latency."((D4) 效率。防护措施应尽量减少额外的离线与在线计算成本及时延。)然后它用 token 给关口定价:每次推理 4329.6 ± 353.6 个 token 与 1 ± 0 次 LLM 查询。一篇正对着这个问题的 RA-L 论文,把时延列为要求,报出来的却是 token。这是本文里最有用的一个事实。

另有两个结果从别的方向为这个问题划了界。一个外置的五功能治理层(arXiv 2604.07833)公布了一张按动作计的时延表,5 个种子乘 1,000 次试验:"Total pre-execution governance overhead (Admission + Policy Guard) is under 0.72 µs at the 99th percentile."(预执行治理的总开销(准入 + 策略守卫)在第 99 百分位低于 0.72 µs。)作者自己说明了它的限度——Python 级仿真,真实的 ROS 2 部署每次服务调用大约再加 100 到 500 µs [单一来源],并且 "real-robot validation is needed to assess governance overhead under physical execution constraints"(需要真实机器人验证,才能评估物理执行约束下的治理开销)。MaCoPlanner(arXiv 2608.28300,2026 年 8 月 28 日)在动作执行之前,先把候选方案对照程序约束与状态转移约束做符号化推演,在一台空载控制面板模拟器上跑了 25 次长时程实体试验:表 5 汇总为规划器与 API 时间 4.2 秒,对照物理执行 3.9 秒,25 次试验中 23 次到达目标状态。它自己的结论:"Explicit task-level verification is therefore not the principal computational bottleneck in the measured pipeline."(因此,显式的任务级验证并不是实测流水线中的主要计算瓶颈。)

这种组合不新颖,这个想法也不是我们的。剩下来的是一次测量。我们找不到任何一项工作,把这五项具体的检查——运动学与碰撞可行性、现场分区与例外规则、以 ISO 10218-2 为依据的速度、间距与负载限制、对外部资源的 LTL 前置条件、以及机器人侧的权限与工具范围契约——组合成一道串行关口,并公布一个对照实体机器人任务周期、以墙上时钟计的每个经校验动作的端到端成本。SafeGate 组合了四样这种形状的部件——不变量检查、关口、契约与求解器,不是我们五项检查中的四项——没有公布时间。RoboGuard 公布的是 token。治理层公布的是 Python 仿真里的微秒数,并且自己说明了这一点。MaCoPlanner 公布的是规划器调用的秒数,并发现验证不是瓶颈。

这些边界应该写在句子里,而不是脚注里。2026 年 9 月 11 日,我们用十种查询表述检索了 arXiv 的 Atom API,另做了两次关于厂商是否公布逐动作验证时延的网络检索。IEEE Xplore、ACM 数字图书馆、Springer、没有镜像到 arXiv 的会议论文集、厂商工程博客与中文厂商文档没有检索。

一道预执行关口每个动作要花多少?

RoboGuard——token每次推理 4329.6 ± 353.6 个 token 与 1 ± 0 次 LLM 查询。IEEE RA-L,2026 年 2 月录用。它用自己的话把时延列为设计要求,然后用 token 给关口定价。
arXiv 2604.07833——微秒准入平均 0.23 µs,策略守卫 0.29 µs,预执行总计在第 99 百分位低于 0.72 µs,5 个种子乘 1,000 次试验。在 Python 级仿真中测得,作者自己写明了这一点,并估计真实部署中每次 ROS 2 服务调用另需 100 到 500 µs。
MaCoPlanner——规划器调用的秒数规划器与 API 时间 4.2 秒,对照物理执行 3.9 秒,汇总自一台空载控制面板模拟器上的 25 次长时程实体试验,其表 5。不是每个经校验动作的端到端成本。
arXiv 2608.09857——裁判集成的秒数58 份方案上平均往返 24.2 秒,五个裁判加一个首席裁判。未经评审的七页预印本,出自本科生实习;[单一来源]。
每个经校验动作的端到端墙上时钟,对照实体机器人的任务周期没有任何人公布过数值,包括我们。

token、微秒、规划器调用的秒数、裁判集成的秒数,是穿着同一个问题的衣服的四个不同问题。

  • 别人公布的数字,用的是别人的单位
  • 没有人填过的那一格
  • 四个答案共同对应的那一个问题
这是概念图,不是比较:这四个量放不到同一条轴上,把它们画在同一条轴上正是本图所说的那种错误。这里没有一格是 Tidewell 的测量——每个数值都属于格内点名的团队。另一个已发表的答案,AgentSpec 的逐组件毫秒数,在正文里点了名而没有画在这里:它是逐组件的、在仿真里的,同样换算不成这四个。最底下那一格对所有人都是空的,包括我们。来源:如各处标注的 arXiv 标识符,检索于 2026 年 9 月 11 日。

我们差点发出去的东西,两次

本文第一版说这五项检查没有已发表的先例。错。第二版说没有人组合过这样一道关口。也错,SafeGate 与 RoboGuard 就是原因。

第三个错误才值得发表。八天里,我们的五份研究文件带着一套关于某个"PNNL/CMU"验证框架的数字——三裁判集成、85% 精确率、97% 遏制率、每次检查 24 到 28 秒——并把避险的前提挂在上面。每一项都错,错法如上文所述:五个裁判加一个首席裁判,不是三个;一个 58 份方案上的加权平均;一个被论文自己的表格推翻的遏制率;一个上限被削掉的时延区间。那个前提从来不是那篇论文的发现:它出现在引言里,是对 DESPITE 的引用,而我们有五份文件把被引的结果记在了引用者的名下。

接着,我们自己那份为了圈住这条主张而开的更正文件,写道仓库里任何地方都不存在这份文档的标题、作者、标识符或 URL。也错。URL 就在与被标记的数字同一份文件里,在数字往下四十行的来源列表中——数字在一行,带一个光秃秃的括号式归属;链接在另一行,什么都没挂——于是两半从彼此都搜不到,五份下游文件继承了没有链接的那一半。在那一份文件里 grep 一下 "arxiv",不到一秒就找到。

值得发表,是因为这种失败比捏造更常见,也更不显眼。没有人编造任何东西。一条引用在写下的那一刻被劈成两半,后来的每个读者都拿走了摆在自己面前的那一半。修法是机械的,数字与标识符放在同一行;而它只有在有人把发生过的事说出口之后才会被修。

剩下的是我们欠的那个数字。智能体团队技术页公布了一份预算:「规划器与校验器的调用在任务边界或异常时运行,为 0.5 至 3 秒,从不在控制环内。」那是一份设计预算与一个假定,不是一次测量。我们没有在任何机器上测过任何东西——没有跑过的原型,没有台架,没有在订的零件——所以本文里每一个实测数字都属于别人,并在承载它的那个句子里注明归属。这份预算的假定是可证伪的,值得点明:关口是一条确定性检查的链,最多带一次有界的模型调用,而不是一个裁判模型的集成。唯一被人计过时的集成,一种配置下跑 24.2 秒,另一种配置下 27.8 到 31.6 秒 [推断——把我们公布的预算与 arXiv 2608.09857 的实测区间放在一起;它们不是对同一个系统的测量]。

我们会公布自己的每个经校验动作的端到端成本,对照实体任务周期测量,注明分母与硬件。今天没有数值,也没有给出数值的日期。上面每一条先例都可以对照论文本身核对,读我们 Crew 页面的工程师应该去核对。这里唯一一句无法对照任何东西核对的,是最后这一句,而在有一台机器可测之前,它就是这样。