本文要论证的一个判断

物理 AI 的通用性来自数据多样性。但多样的数据天然质量参差,朴素地往上堆只会把模型训成平庸。真正的突破口不是过滤,而是给模型讲清楚:这条数据是怎么来的。丰富的上下文能让「数据量」从包袱变成红利,也能让训出来的模型变成一个你可以指挥的东西。

支撑这个判断的是一条反直觉的规模化曲线:加上 episode 元数据之后,哪怕数据集的平均质量在走低,模型性能照样持续上涨;去掉元数据,性能反而随着低质量数据的涌入而下滑 [π0.7 §IX-E, Fig. 18]。这还引出一个很漂亮的推论——π0.7 靠元数据条件化,把 π*0.6 的强化学习轨迹「蒸馏」了进来,自己一轮 RL 都没跑 [π0.7 §VI-A]

怎么读这篇文章

本文假设你熟悉 LLM 的预训练与后训练、扩散与流匹配、大规模 Transformer 工程,同时假设你对机器人一无所知。机器人领域的前置知识全部在正文里讲清,集中放在可跳过的预备知识框里。组织线索是 π0.7 论文本身 [π0.7 §I]

三条贯穿全文的约定,它们是承重的,不是装饰 [π0.7 §V-E]

每部分都先摆输入输出。 输入 → 输出,论文给了具体形状和单位的地方就写具体值。能说清一个模块「吃什么、吐什么」,就能在不读内部实现的前提下推理它——也就能替换它 [π0.7 §IV]

每个论断都标类型。 已公开:论文白纸黑字写了。推断:我从公开事实推出来的,会明说。未公开:外界不可能知道的,一律收进第 10 部分的缺口清单,绝不含混 [π0.7 §VI-A]

每个数字都带出处。 本文的数值由脚本机械校验:正文里出现一个不在事实台账里的数字,或哪一段没挂引用,构建直接挂掉。这是我知道的唯一能让这么长一篇文章保持诚实的办法 [π0.7 §V-E]

最后界定范围。「复现 π0.7」在这里的意思是把整条规模化路径、设计哲学,以及数据采集、组织、训练、服务的所有公开细节搞透,透到能把这套系统当工程计划重建的程度;不是移植代码。π0.7 既没放权重,也没放代码 [π0.7 ref. 42]


第 0 部分 —— 目标是什么,凭什么说它难

本部分的输入输出: 输入——你的 LLM 直觉;输出——「通用物理 AI」的精确定义,以及为什么你已经掌握的那套方法论到这里行不通。

「通用」到底在说什么

「通用」大概是这个领域被滥用得最厉害的词,所以先把定义钉死:在 π0.7 看来,通才就是在它实际测量的四个维度上都交得出成绩单的模型 [π0.7 §I]

通用性的四个维度,以及各自对应的评测

开箱即用的灵巧性——不做任何任务专属后训练,直接上手完成多阶段高难操作,同一份权重通吃 [π0.7 §I]指令泛化——在训练里从没出现过的环境中执行开放式语言指令,具体协议是 14 个场景、每个场景 3–6 条开放式指令,跑在 4 个没见过的厨房和 2 个没见过的卧室里 [π0.7 §IX-B, Fig. 9]跨本体迁移——把技能迁移到从没演示过这个技能的机器人身体上,比如在双臂 UR5e 上叠衬衫,而叠衣数据几乎全采自另一台更轻的机器人 [π0.7 §IX-C]组合泛化——把已知技能重新排列组合出训练中从未配对过的「任务 × 场景」,这项成绩是 60–80%,分布内则超过 90% [π0.7 §X]

注意这四条的共性:每一条都得真机上场、人在旁边看结果。没有任何离线基准能替代一次真实试验 [π0.7 §IX-E]

LLM 的配方为什么搬不过来

文本上怎么造通才你已经很清楚了:爬巨量语料,做 next-token 预测预训练,接指令后训练,离线评测,快速迭代。一旦输出变成物理机器发出的关节指令,这个闭环几乎每一步都会断 [π0.7 §I]

网络文本 vs 机器人动作:决定下游一切设计的那种不对称

图里列的这些不对称是我对论文所解决问题的概括,不是原文引述,请当作推断——只有一条例外。数据规模那行是公开的:π 系列的预训练语料被描述为「跨越大量任务和多种机器人的数万小时演示数据」[π*0.6 §IV-C]。在机器人领域这已经是巨量了,放到文本语料面前只能算个零头。

后果是连锁的。动作数据得在物理世界里一帧一帧地录,所以瓶颈是数据,不是算力。每台机器人的臂展、质量、惯量、夹爪几何都不一样,语料远没有文本那样独立同分布——论文明确说 UR5e 显著更长、形态不同、重得多、关节惯量更大,得用完全不同的操作策略和桌面摆位 [π0.7 §VIII, App. F]。评测又必须靠真机试验,LLM 研究靠的那个快速迭代闭环在这里根本跑不起来;论文自己也坦承,在这个数据规模下「实际上很难明确判定哪些任务真正算是’见过’或’没见过’」[π0.7 §IX-E]

预备知识 —— 遥操作。 人类操作员开着机器人干活,系统按控制频率同步录下相机画面和关节位置,这段录像就是一条「演示」或一个 episode。今天几乎所有高质量的机器人动作数据都是这么来的——所以机器人数据是有工资成本的。π0.7 的人类对照实验能让你感受到技能门槛有多高:被招来的 10 名操作员处于经验分布的前 2%,各平台遥操作时长平均约 375 小时 [π0.7 App. F, Fig. 21]

采不到的数据,造不出的仿真

数据这么贵,第一反应当然是跑仿真。但仿真的效果比圈外人想的差得多,理解「为什么差」几乎能解释 π0.7 的全部设计取向——这套系统完全建立在真实机器人数据、人类视频和网络数据之上,没用过一帧仿真 [π0.7 §VI-A]

家里真正要紧的任务,偏偏全是接触密集、变形物体相关的:叠衣服、做三明治、削菜皮、舀咖啡豆、擦洒出来的水。π0.7 的任务清单几乎清一色这类——从洗衣篮里取出纽扣衬衫叠好、把 T 恤从里向外翻正、涂花生酱再斜切三明治、用挂绳固定的刀切西葫芦 [π0.7 App. G]。布料、食物、液体都不存在可处理的刚体状态;一个能把衬衫动力学模拟到足以指导抓取点选择的仿真器,本身就是个研究课题,不是个拿来就能用的工具。

第二道坎是家电和环境的长尾。π0.7 的任务里有打开空气炸锅、用烤箱烤贝果、操作意式咖啡机、穿过一扇会自动弹回的壁橱门 [π0.7 App. G]。每样东西都有它独有的卡扣和开合方式。给它们造高保真模型不是规模问题,是个没有边界的建模问题,何况家家户户的东西还都不一样。

整个领域就这样被推向了真实数据。这段是我对「π0.7 为什么把钱花在这些地方」的推断,但论文的投入方向强烈暗示了它:机队、遥操作员、标注、数据引擎 [π0.7 §VI-A, §VIII]

核心困境

现在来看驱动整篇论文的那个陷阱 [π0.7 §I]

通用性要求多样性。想当通才,你就得有很多任务、很多环境、很多机器人本体、同一件事的很多种做法。但大规模采来的多样数据,质量必然参差不齐。有的 episode 快,有的慢;有的干净利落,有的中间犯了错又找回来;有的出自资深操作员,有的是模型自己评测时失败的回放 [π0.7 §VI-A]

常规做法是过滤:好的留下,烂的扔掉。这是谨慎的从业者会做的事,也正是 π0.7 反对的做法。过滤把你花钱买来的大部分数据扔进了垃圾桶,而被扔掉的那些 episode 里恰恰藏着机器人最需要的信息——事情是怎么搞砸的,搞砸了怎么补救。但全留也不行:在并集上训练,模型学到的是平均行为——平庸、犹豫、容易出错 [π0.7 §I, §IX-E]

π0.7 选了第三条路:全都留下,但告诉模型它在看的是什么。给每条 episode 打上标签:跑得多快、质量多高、中间有没有犯错。测试时,直接向模型索要你想要的那种行为。一条又慢又有失误的 episode 不再是污染源,而是一个标注好了的「慢+有失误」样本,它的存在反而让模型对「快、好、不犯错」的理解更加精准 [π0.7 §V-C, §VII]

这套路你可能觉得眼熟——对,就是回报条件化/优势条件化的行为克隆,只不过把标量推广成了多模态上下文 [π*0.6 §V-B]。第 3 部分会展开讲这层关系。


第 1 部分 —— 预备:VLA 到底是什么

本部分的输入输出: 输入——你的扩散与 Transformer 知识;输出——把「视觉-语言-动作模型」理解成一个契约明确的黑盒,外加后文需要的四个机器人概念。

契约

视觉-语言-动作模型(VLA)说白了就是一个策略:吃进观测和上下文,吐出一段未来动作 [π0.7 §III]

VLA 的输入输出契约:观测快照进,动作块出

形式化地写,观测是 $o_t = [I_t^1, \ldots, I_t^n, q_t]$——$n$ 路相机图像加上关节构型;模型输出一个 $H$ 步的动作块 $a_{t:t+H}$,实际只执行其中较短的 $\tilde{H} < H$ 步,然后重新观测、重新规划 [π0.7 §III]。训练目标是

$$\max_{\theta}\; \mathbb{E}_{\mathcal{D}}\left[\, \log \pi_{\theta}\!\left( a_{t:t+H} \mid o_{t-T:t},\, C_t \right) \right]$$

其中 $C_t$ 是上下文,$o_{t-T:t}$ 是一段历史观测窗口 [π0.7 §III, Eq. 1]。给较真似然的读者一个诚实提醒:流匹配动作专家优化的是这个量的一个近似下界,而非解析形式的似然本身 [π0.7 §III]

落到 π0.7 上,这份契约有非常具体的数字。输入是最多 4 路相机——前视、两个腕部、可选后视——每路最多 6 帧历史,采样步长 1 秒,全部缩放到 $448\times448$;加上最多 3 张子目标图像(省略后视)[π0.7 §VI-B]。输出是恰好 50 个动作 token,一个 50 步的动作块 [π0.7 §VI-B]。运行时只执行其中 15 或 25 步就重新规划 [π0.7 §VII]

这份契约里最值得玩味的其实是缺席的东西。输入里没有动作历史、没有奖励信号、没有地图,除了本体感知之外也没有任何显式状态估计 [π0.7 §III]。策略对自身输出几乎是马尔可夫的:闭环是经由物理世界闭合的,不是经由上下文闭合的。就这一个设计选择,让 VLA 的误差累积行为跟自回归世界模型截然不同——第 11 部分会回到这个对比。

预备知识 —— 控制频率。 机器人底层控制器要求以固定频率收到新的目标值。π0.7 的平台跑在 50 Hz,只有 UR5e 是 20 Hz [π0.7 §VIII]。50 Hz 下,一个 50 步的动作块刚好一秒钟。所以延迟在这里是一等约束而非锦上添花:推理一旦比执行窗口还慢,机器人就会在动作中途卡死。

预备知识 —— 动作分块(action chunking)。 模型不是每次前向只出一个动作,而是一口气联合预测 $H$ 步,机器人先执行其中前 $\tilde{H}$ 步。联合预测能避免逐步独立采样带来的抖动和不连贯,同时把推理开销摊到很多个控制周期上。$H$ 是建模层面的选择,$\tilde{H}$ 是控制层面的选择,两者在平滑性和反应性之间做权衡 [π0.7 §VII]

预备知识 —— 本体(embodiment)。 「本体」就是一台具体的机器人身体:运动学结构、自由度、夹爪形式、相机安装位置。π0.7 覆盖了双臂移动操作机(两条 6 自由度手臂 + 升降轴 + 全向底盘)、静态双臂平台、配 Robotiq 夹爪的双臂 UR5e,以及单臂系统 [π0.7 §VIII, Fig. 4]。各平台的动作空间并不相同,「跨本体迁移」之所以是个真问题而不只是换个标签,原因就在这里。

动作怎么表示

把连续的机器人动作变成 Transformer 能产出的东西,主流有两条路。π0.7 两条同时走——用在不同参数组上,配不同的目标函数 [π0.7 §III]

流匹配把动作块当作连续向量,学一个从噪声到数据的速度场,跟你在生成模型里熟悉的一模一样 [π0.7 ref. 102]。推理时对这个场做少数几步积分,π0.7 用 5 步 [π0.7 §VII]。这种表示精度高——而精度恰好是执行机构的硬需求。

离散化 token 则用基于 DCT 的方案压缩动作块,变成语言模型词表里的 token,用普通的 next-token 交叉熵训练 [π0-FAST]。这种表示是有损的,但好处是动作目标能用主干的母语来说话。

为什么两条路同时走?因为这正是知识隔离要解的问题 [π0.7 §III]

知识隔离:一道梯度防火墙

先说失败模式——也是知识隔离被提出来要修的毛病 [KI, π0.7 §III]。你拿一个对世界知识丰富的预训练视觉-语言模型,接上一个连续动作头,在机器人数据上训练。动作头的高方差回归梯度一路回传,把你当初正是为之而来的网络知识给冲垮了。最后得到一个会动、但已经忘了滤锅长什么样的模型。

知识隔离用两把锁解决它,而从业者经常把这两把锁搞混 [π0.7 §III]

第一把是目标函数:主干用离散 FAST token 的交叉熵来监督——稳定、条件良好、跟预训练时同类型的分类损失;动作专家另起炉灶,用流匹配训练 [π0.7 §III]

第二把是梯度:动作专家能注意主干的所有激活,但梯度不准流回主干 [π0.7 §III]专家看得到一切,但改不了任何东西。 π0.6 用的就是这个方案——连续动作和 FAST 离散 token 端到端训练,同时一个 stop-gradient 把流匹配专家的影响挡在主干门外 [π*0.6 §V-A]

还有第三把锁,大多数解读文章都漏了:注意力掩码 [π0.7 App. B, Fig. 19]

块因果注意力:什么可以被看见

FAST token 只在训练时存在,而且 FAST token 和流动作之间互不注意 [π0.7 App. B, Fig. 19]。这不是优化细节,是正确性要求。FAST token 本身就是量化后的标准答案,如果动作专家能看到它们,它就会学着从上下文里直接解码答案,而不是从观测里推断——等到部署时这些 token 不存在了,模型直接崩盘。

所以分工是这样的:掩码管每条分支看得见什么stop-gradient 管每个目标函数改得了什么。知识隔离之所以成立,靠的是这两把锁配合,单拎哪个都不够 [π0.7 §III]

还有个顺手拿到的好处,第 8 部分会用到:动作 token 注意前缀但前缀不注意动作 token,所以前缀只需要编码一次,全部 5 个去噪步之间复用缓存 [π0.7 §VII]。一个掩码设计,正确性和推理速度一箭双雕。

延迟为什么是头等大事

在 LLM 领域,延迟是体验问题;在 VLA 领域,延迟是正确性问题——物理世界不等人 [π0.7 §VI-B]

π0.7 的处理方式不是消灭延迟,而是把策略训得能预期延迟的存在。训练时用实时分块(RTC)模拟 0–12 个时间步的延迟,对应 50 Hz 下 240 ms 的最大推理延迟 [π0.7 §VI-B]。策略从一开始就被训练成能吸收它将来会遇到的那种延迟。实测延迟远在预算之内:最小配置下 3 路相机、5 个去噪步时 38 ms,开了 MEM 视觉编码器并把子目标图像放进上下文后,最坏情况升到 127 ms,全跑在单张 NVIDIA H100 上 [π0.7 App. D]

记住这个对比。240 ms 的预算 vs 38 ms 的地板——中间那段余量就是系统里所有可选特性的购买力:历史帧、子目标图像、引导;而 127 ms 的最坏情况说明这些可选项到底吃掉了多少余量 [π0.7 §VI-B, App. D]

第 1 部分超参数表

参数取值出处
相机路数最多 4(前视、两个腕部、可选后视)[π0.7 §VI-B]
每路历史帧最多 6 帧,步长 1 秒[π0.7 §VI-B]
子目标图像最多 3 张(省略后视)[π0.7 §VI-B]
图像分辨率448×448[π0.7 §VI-B]
动作块长度 $H$50 步[π0.7 §VI-B]
执行步长 $\tilde{H}$15 或 25[π0.7 §VII]
去噪步数5[π0.7 §VII]
控制频率50 Hz;UR5e 为 20 Hz[π0.7 §VIII]
RTC 模拟延迟0–12 步 = 50 Hz 下 240 ms[π0.7 §VI-B]
推理延迟最小 38 ms,最坏 127 ms,单张 H100[π0.7 App. D]

第 2 部分 —— 规模化路径:从 π0 到 π0.7

本部分的输入输出: 输入——第 1 部分的 VLA 契约;输出——搞清楚每一代加了什么能力、付出了什么代价,以及 π0.7 为什么必须把它们全收进来。

π0.7 不是一个灵光一现的想法,它是一条谱系里的第九项。这条谱系有个显著特征:每一代都在保留前一代全部能力的前提下再加一项新能力;而 π0.7 自身的贡献,就是让单个模型同时握住所有这些能力的那套条件化方案 [π0.7 §I, §VI-A]

从 π0 到 π0.7 的规模化路径

各代加了什么

π0 立下了范式:在预训练视觉-语言模型上接一个流匹配动作专家,把网络级的视觉知识变成连续灵巧控制 [π0.7 ref. 10]。之后所有工作都在打磨这个架构,没人换过它。

π0-FAST 引入了基于 DCT 的动作 token 化,让高频动作数据上的自回归训练跑得通 [π0.7 ref. 104]。它留给 π0.7 的遗产不在推理路径上,而在训练路径上:知识隔离里用来监督主干的,就是 FAST token [π0.7 §III]

Hi Robot 加了层级——高层策略产出语义子任务,低层策略负责执行——这是让开放式长时程指令跟随变得可处理的关键 [π0.7 bibliography]。π0.7 保留了这个结构:高层策略与主模型同架构,把观测、任务描述和过往子任务映射为下一条子任务指令 [π0.7 §V-A, Fig. 2]

π0.5 加了异构数据协同训练与显式的语义子任务预测,实现了对真正没去过的家庭的开放世界泛化 [π0.7 ref. 14]

知识隔离(KI) 贡献了第 1 部分分析过的那道 stop-gradient 防火墙——让 VLM 适配动作的同时不摧毁已有知识 [π0.7 ref. 103]

实时分块(RTC) 解决了相邻动作块之间的接缝问题,让机器人连续执行不必停下来等下一块算完 [π0.7 ref. 107]。π0.7 用的是训练期变体,跟测试期 RTC 不同,推理时零额外开销 [π0.7 ref. 108, App. D]

MEM 贡献了记忆,π0.7 几乎整套照搬——值得单开一节 [π0.7 ref. 37]

π*0.6 贡献了「从真实部署经验中做强化学习」,是本文论点最重要的祖先——同样单开一节 [π0.7 ref. 50]

π*0.6 到底干了什么

把 π*0.6 简化成「他们跑了 RL」,你就会错过 π0.7 真正依赖的那个机制 [π*0.6 §IV]

方法叫 RECAP——RL with Experience and Corrections via Advantage-conditioned Policies [π*0.6 abstract, §IV]。拆开看有三步:先跑策略采数据、标注 episode 结果,中间可以插入人类的纠正性干预;然后拿迄今收集的全部数据训一个价值函数;最后用价值函数导出的最优性指示符去条件化地训练策略 [π*0.6 §IV-C, Alg. 1]

价值函数是一个多任务的分布式评论家,跟策略同架构但主干更小,用 670M 的 VLM,同样从 Gemma 3 初始化 [π*0.6 §V-C, Fig. 3]。它把回报离散成 $B = 201$ 个分箱,用蒙特卡洛回报上的交叉熵训练 [π*0.6 §IV-A]。奖励刻意设计得极其简陋,好让它通用于所有任务:成功时终止步给 0,失败给一个大的负常数,其余时刻给 −1;再按任务最长 episode 长度归一化到 $(-1, 0)$ [π*0.6 §V-C, Eq. 5]

接下来是真正关键的一步。RECAP 没有用策略梯度更新——对流匹配策略来说策略梯度很别扭,因为它给不出可处理的对数似然——而是把策略条件化在一个二值优势指示符上,这个指示符以纯文本形式插入:「Advantage: positive」或「Advantage: negative」[π*0.6 §V-B]。它插在语言输入之后、动作之前,所以只影响动作部分的对数似然 [π*0.6 §V-B]。阈值 $\varepsilon_{\ell}$ 取该任务下评论家预测值的 30% 分位数;人类纠正一律强制为 positive,假设是专家干预总比不干预好 [π*0.6 §V-D, §IV-B]。又因为训练时会随机丢掉这个指示符,推理时自然就能上无分类器引导 [π*0.6 §V-B]

有两个工程细节的价值超出了论文本身。第一,每轮迭代都从预训练检查点微调,而不是在上一轮的结果上接着练,以避免多轮漂移 [π*0.6 §V-D]。第二,专家模型从预训练模型微调而来,最终的通才模型则是从头训的 [π*0.6 §IV-C]。回报是:RECAP 在最难的一批任务上吞吐量翻了一倍以上,失败率大致砍半,足以支撑连续 13 小时做意式咖啡、在陌生家庭连续 2 小时叠新衣物而不需要人工干预 [π*0.6 abstract, §I]

回头看优势条件化到底是什么:就是把行为克隆策略条件化在一个「这段演示有多好」的文本标签上。π0.7 拿走了这个想法,把标签从一个二值标量推广成了一整束多模态上下文 [π0.7 §V-C]

π*0.6 还顺带记下了它的前任。π0.6 没有论文,只有一张模型卡 [π0.7 ref. 42];但 π*0.6 披露了它派生自 π0.5、基础 VLM 用 Gemma 3 4B、动作专家扩到 860M、预训练集加入了更多机器人平台的数据,并以 50 Hz 输出关节角与夹爪指令 [π*0.6 §V-A]。外部团队想了解 π0.6,翻这里就够了。

MEM 加了什么

MEM 全称 Multi-Scale Embodied Memory(多尺度具身记忆)。它之所以存在,是因为把策略直接条件化在一长串原始观测上,算力根本撑不住 [MEM §I]。朴素地把帧塞进主干,推理延迟会炸穿实时红线——在单张 H100、4 路相机的 π0.6 VLA 上,这条红线实测为 300 ms [MEM Fig. 3]

MEM 按时间尺度把记忆分成两层 [MEM abstract, §III-A]长时程记忆是一段语言摘要,由高层策略维护:根据上一次的摘要加上当前观测,预测出更新后的摘要 [MEM §III-B]。训练数据来自现成的 LLM——它把过往子任务及其成败信息汇总成摘要,并被明确要求「能删的删、能压的压」[MEM §III-B]压缩本身是关键:如果只是朴素地拼起所有历史子任务指令,效果反而差很多,因为推理时策略反复重试同一个失败子任务产生的序列,在接近最优的训练演示里压根不会出现 [MEM §IV-A, Fig. 6]

短时程记忆是一个改造 ViT 注意力模式得到的视频编码器:每帧内部做双向空间注意力,另外每隔 4 层加一次跨帧的因果时间注意力 [MEM §III-C, Fig. 4]。这个分解把开销从 $O(n^2 K^2)$ 降到 $O(Kn^2 + nK^2)$ [MEM §III-C]。有两个性质让它几乎白送:一是只有当前时刻的表示往后传,编码器输出的 token 数和无记忆的单帧 VLA 完全一样 [MEM §III-C];二是相比标准单图 ViT 不引入任何新的可学习参数,记忆能力全靠注意力模式加一个固定的正弦时间位置编码 [MEM §III-C]。当 $K = 1$ 时初始化跟源 VLM 完全一致,因为该位置编码在 $t = 0$ 处取值为 $0$ [MEM §III-C]

MEM 预训练用 6 帧观测——5 帧历史加当前一帧——步长 1 秒,后训练还能扩到 18 帧、54 秒 [MEM §III-D]。对照 π0.7 的输入契约:每路相机最多 6 帧历史,步长 1 秒 [π0.7 §VI-B]。π0.7 连状态处理都一并继承了:用线性投影把本体感知嵌入主干维度,替代了 π0.6 的文本 token 方案 [MEM §III-D, π0.7 §VI-B]

提炼出的那条哲学

九代积累下来有个值得明说的模式,因为它才是对任何想做这类项目的人真正的启示:能力是累积的,不是被替换的。好几代前引入的 FAST token 化,今天仍然是主干的训练信号 [π0.7 §III];Hi Robot 的层级结构,今天仍然是子任务接口 [π0.7 §V-A];MEM 的编码器是一个被集成的部件,而不是一次推倒重来 [π0.7 §IV]

而 π0.7 自身的贡献,就是让单个通才同时握住所有这些能力的条件化方案——其中明确包含吸收 RL 专家的行为:π*0.6 在 RL 训练期间采集的数据被当作额外训练样本使用,论文称之为「一种’蒸馏’过程」[π0.7 §VI-A]。通才继承了专家的能力,而自己不需要跑 RL。


第 3 部分 —— π0.7 的核心想法:可指挥的上下文条件化

本部分的输入输出: 输入——谱系脉络;输出——定义 π0.7 的那一次重新表述,逐字段拆开,附上每一个 dropout 比率。

条件化在「怎么做」,而不只是「做什么」

标准指令跟随,策略只被条件化在做什么上:一条任务字符串。π0.7 的做法是把上下文 $C_t$ 从一条干巴巴的指令,撑开成一束同时描述这条 episode 是怎么来的的多模态信息 [π0.7 §III, §IV]

整个想法看一个字符串就全明白了 [π0.7 §V-E]

<Multi-view observation><Multi-view subgoals>
Task: peel vegetables. Subtask: pick up the peeler. Speed: 8000.
Quality: 5. Mistake: false. Control Mode: joint.<Proprioception>

π0.7 提示词的解剖

字段逐个拆

子任务指令 $\tilde{\ell}_t$——和总任务 $\ell_t$ 并列的中间层语义子任务,承袭自 π0.5。推理时可以来自学到的高层策略,也可以来自旁边「教」机器人的人,或者干脆不给 [π0.7 §V-A]

子目标图像 $g_t$——期望的近期未来状态的多视角图像。基座视角承载环境和物体层面的目标,腕部视角承载手臂和夹爪层面的目标 [π0.7 §V-B]。这是一种视觉指令,而且实验证明,跨本体迁移上提升最大的通道恰恰就是它。

Episode 元数据 $m$——三个由人打的标签。总体速度是 episode 的时间步长度,按 500 步分箱,于是一条 1750–2250 步的 episode 会被标为「2000 steps」[π0.7 §V-C]总体质量是 1 到 5 的整数,5 最好 [π0.7 §V-C]失误是按动作片段给的布尔量,由人粗粒度标注 [π0.7 §V-C]

控制模式 $c \in \{\mathrm{joint},\, \mathrm{ee}\}$——动作空间是关节位置还是末端执行器位姿 [π0.7 §V-D]

元数据就是核心论点的具体载体。「Speed: 8000」描述的不是任务,而是这批动作所出自的那条 episode。一条慢吞吞、手忙脚乱的演示不再是该过滤的噪声,而是一个标注好了的「慢且笨拙」样本;正因为有它的对照,模型对「快」和「高质量」的感知才更加锐利 [π0.7 §IX-E]

dropout 让字段变成可选

上下文这么丰富,部署时就有个麻烦:你不一定有子目标图像,不一定有子任务字符串,元数据也不一定靠谱。π0.7 的解法是——训练时按特定比率随机丢掉每个字段,逼模型在缺了它的情况下照样能干活 [π0.7 §V-E]

完整的 dropout 调度表,全出自同一节 [π0.7 §V-E]

  • 子目标图像只出现在每 batch 25% 的样本中 [π0.7 §V-E]
  • 在带子目标的样本里,子任务指令有 30% 概率被丢 [π0.7 §V-E]
  • Episode 元数据整体有 15% 概率被丢 [π0.7 §V-E]
  • 元数据各分量——速度、质量、失误——再各自以 5% 概率被单独丢 [π0.7 §V-E]
  • 控制模式完全不 dropout [π0.7 §V-E]

其中两个比率值得细看:一个论文给了明确理由,另一个则意味深长地沉默了 [π0.7 §V-E]

25% 这个子目标比率不是正则化的经验数字。有了子目标图像,任务会退化成接近逆动力学——模型直接看到目标状态然后往那儿插值就行了——训练因此快得多 [π0.7 §V-E]。放任不管的话,模型会一直走这条容易的通道,把难的那条训练不足。把子目标限在四分之一的样本里,就是为了让「从观测到动作」这条通路始终保持承重。这条原则很值得偷:某个输入通道让任务变得太容易的时候,给它限量。

控制模式完全不 dropout 则是个镜像式的决定 [π0.7 §V-E]。其他字段都是建议性的——关于「怎么做」的提示。控制模式不是,它是动作空间本身的硬事实:关节位置和末端位姿是两套完全不同的输出语义,一个搞不清自己在输出什么的模型不叫「可指挥」,叫「坏了」。可选的字段才做 dropout;语义契约不做。

运行时怎么「指挥」

模型已经学到了行为模式上的条件分布,部署就变成了「向它索要你想要的那个模式」[π0.7 §VII]

运行时的参数设定很激进:速度提示按任务设为该任务 episode 长度的第 15 百分位——相当于要求一次比绝大多数训练演示都更快的执行;质量恒定为 5;失误恒定为 false [π0.7 §VII]拿中等偏下的数据训练,然后推理时要求它拿出最好的表现。

又因为 dropout 造就了一个「有元数据用元数据、没元数据也能跑」的模型,无分类器引导(CFG)直接就能上。π0.7 对 episode 元数据施加 CFG,权重 $\beta \in \{1.3,\, 1.7,\, 2.2\}$ [π0.7 §VII]。这个机制你在扩散模型里已经很熟了:从无条件预测的方向往外推,把结果更用力地拉向条件所指的模式。只不过这里的「条件」不是一段描述内容的文本提示,而是关于行为质量的描述。$\beta$ 调大,策略对「快、干净、不出错」就更坚决。

以上就是全部核心想法 [π0.7 §IV]。后面各部分讲的,都是在真实规模上把它落地所需要的工程。

第 3 部分超参数表

参数取值出处
总体速度episode 时间步长度,500 步分箱(1750–2250 → 「2000 steps」)[π0.7 §V-C]
总体质量1–5 的整数,5 最好[π0.7 §V-C]
失误布尔量,按动作片段,人工标注[π0.7 §V-C]
控制模式joint 或 ee[π0.7 §V-D]
带子目标图像的样本比例每 batch 25%[π0.7 §V-E]
其中子任务被丢弃30%[π0.7 §V-E]
元数据整体丢弃15%[π0.7 §V-E]
元数据各分量额外丢弃5%[π0.7 §V-E]
控制模式 dropout[π0.7 §V-E]
运行时速度提示任务 episode 长度的第 15 百分位[π0.7 §VII]
运行时质量提示恒为 5[π0.7 §VII]
运行时失误提示恒为 false[π0.7 §VII]
元数据 CFG 权重 $\beta$1.3、1.7 或 2.2[π0.7 §VII]

第 4 部分 —— 子系统:机队与遥操作

输入输出: 输入——人类意图,由操作员驱动机器人表达;输出——在真实硬件上录下来的轨迹,即同步的图像与关节位置。

复现真正开始的地方就在这里,钱也主要花在这里。这一层不存在,模型就无从训起。论文专门用了一整节来讲它跑在什么硬件上 [π0.7 §VIII]

平台

π0.7 覆盖四类平台 [π0.7 §VIII, Fig. 4]

夹爪全线平行两指 [π0.7 §VIII]。各平台统一采用 6 自由度手臂不是巧合:正因如此,一套共享的关节空间动作表示才能在不同平台之间连贯起来,撑得起迁移 [π0.7 §VIII, Fig. 4]

控制与传感

控制频率除 UR5e 的 20 Hz 外,其余一律 50 Hz [π0.7 §VIII]。传感是一路前视相机加每条手臂一路腕部相机,移动机器人再加一路后视 [π0.7 §VIII]。这恰好对应输入契约里的「最多 4 路相机」:前视、两个腕部、可选后视 [π0.7 §VI-B]

执行端刻意保持简单。模型的动作输出通过一个 PD 控制器下发;末端执行器模式下由数值逆运动学把目标末端位姿转成目标关节位置 [π0.7 §VIII]。没有学出来的底层控制器,没有力矩级策略,底下也没垫一层模型预测控制。策略输出位置目标,底下交给经典控制搞定。

这一点值得停下来想想,因为它跟很多人的直觉相反:复杂度全部集中在高层策略,栈的底部是教科书内容 [π0.7 §VIII]。**推断:**这样做让整条不依赖仿真的流水线保持可控,也让同一策略能在共享同一接口的不同本体之间移植;但论文没有明确论证这一点。

UR5e 为什么是那块硬骨头

UR5e 是跨本体的压力测试,论文对原因说得很具体:它显著更长、形态不同、重得多、关节惯量大,所以需要完全不同的操作策略和桌面摆位 [π0.7 §VIII, App. F]。团队压根没在双臂 UR5e 上采过任何叠衣数据,而且发现它总体更难遥操作,也不太适合精细抓取 [π0.7 §IX-C]

最后这个事实把整个跨本体结果的意义重新定义了。迁移到 UR5e 不只是打了个基准分——它是从一个「遥操作很痛苦」的平台上获取数据的途径。模型能迁移到新本体,就打开了在那个本体上完全自主采集数据、不需要人来遥操的可能性 [π0.7 App. F]

而且这次迁移产出了真正的涌现行为,不是照搬。在源机器人上,操作员习惯倾斜末端接近布料、先把织物压在桌面再提起;在 UR5e 上,π0.7 转而采用更契合该臂运动学的垂直抓取——这个策略在训练数据里并不存在,却更适合目标本体 [π0.7 Fig. 13]。再配合世界模型生成的子目标图像,效果进一步提升,结果图中标为 π0.7 (GC) [π0.7 §IX-C, Fig. 12]

第 4 部分超参数表

参数取值出处
控制频率50 Hz;UR5e 为 20 Hz[π0.7 §VIII]
手臂自由度各平台均为 6[π0.7 §VIII, Fig. 4]
移动操作机2 × 6 自由度臂、1–2 自由度升降、全向底盘[π0.7 Fig. 4]
静态双臂(BiPi)2 × 6 自由度臂、1 自由度夹爪[π0.7 §VIII, Fig. 4]
夹爪平行两指;UR5e 用 Robotiq[π0.7 §VIII, Fig. 4]
相机前视 + 每臂一路腕部;移动平台加后视[π0.7 §VIII]
底层控制器PD[π0.7 §VIII]
末端执行器模式数值逆运动学 → 关节目标[π0.7 §VIII]
机队规模未公开[π0.7 §VIII]
遥操作装置未公开[π0.7 §VIII]

第 5 部分 —— 子系统:数据引擎

输入输出: 输入——机队、人类标注者、公开网络;输出——一份带标注、带混合权重的训练语料,其中每条 episode 都附有「它是怎么来的」这一描述。

数据引擎:八类来源、标注、混合,以及飞轮

八类数据来源

π0.7 在八类数据上训练 [π0.7 §VI-A]

  1. 遥操作演示,覆盖静态与移动、单臂与双臂平台,场景包括实验室式、类家庭和真实家庭 [π0.7 §VI-A]
  2. 自主数据,来自大量策略评测过程 [π0.7 §VI-A]
  3. 人类干预,即策略回放中的专家纠正 [π0.7 §VI-A]
  4. π*0.6 的 RL 轨迹,作为额外样本 [π0.7 §VI-A]
  5. 开源机器人数据集 [π0.7 §VI-A]
  6. 第一人称人类视频 [π0.7 §VI-A]
  7. 非机器人网络数据——物体定位、属性预测、VQA、纯文本 [π0.7 §VI-A]
  8. 视频-语言任务,包括对自有机器人视频和网络视频的字幕生成 [π0.7 §VI-A]

注意这份清单的结构:只有前四类动了机队,其余全是杠杆——网络和视频数据维持主干的语义知识,机器人数据负责教执行 [π0.7 §VI-A]

刻意的背离:把「烂数据」留下来

常规做法是精选。π0.7 反着来,大量使用次优的机器人数据——失败的 episode、带明显失误的成功 episode、旧版模型评测时采的数据 [π0.7 §VI-A]

之所以敢这么干,全靠元数据兜底。一条标着「质量 2、失误 true」的 episode 不是被污染的训练信号,而是行为空间中某个区域的正确标注样本——模型应该表示出这个区域,然后在推理时被引导着绕开它 [π0.7 §V-C, §VII]过滤和条件化是对同一个问题的两种处理方式,π0.7 的规模化结果就是「条件化赢了」的证据 [π0.7 §IX-E, Fig. 18]

那一步「蒸馏」

数据一节里最有分量的一句话:π*0.6 在 RL 训练期间采集的数据被当作额外训练样本使用,论文称之为「一种’蒸馏’过程」[π0.7 §VI-A]

把这条链路捋一遍。π*0.6 在真实机器人上跑了真实的 RL,靠价值函数和优势条件化把专家策略推到了超越人类演示的水平 [π*0.6 §IV, §I]。这些轨迹——连同它们相较遥操作的改进——变成了 π0.7 的普通条件化训练样本。通才就这样获得了专家级行为,而自己一轮 RL 都没跑,纯粹是在带质量元数据的 RL 轨迹上做监督训练 [π0.7 §VI-A]

做过 LLM 后训练的读者应该立刻对上号了:这就是从一个 RL 调过的教师向监督学生做蒸馏,只不过多了个转折——「奖励」没有被烘焙进权重,而是作为条件变量活到了学生身上 [π*0.6 §V-B, π0.7 §V-C]

标注

上下文里的那些字段得有来源,大多来自人 [π0.7 §V-A, §V-C]

子任务切分给出语义子任务字符串 [π0.7 §V-A];质量是 1–5 评分 [π0.7 §V-C];失误标签是按动作片段的布尔量,原文说「由人类对我们的数据做粗粒度标注而来」[π0.7 §V-C];速度是唯一机械导出的字段——按 500 步分箱的 episode 长度 [π0.7 §V-C]

「粗粒度」三个字在这里很重要。这不是高精度标注工程,而是在一个巨大语料上做的一遍快速扫描,整个系统被设计成能容忍它。**未公开:**标注规范、标注者一致性、每条 episode 的标注成本,以及分歧怎么裁 [π0.7 §V-C]

但标注质量确实有一处硬依赖被记录在案。世界模型训练中,标签质量——尤其是时间切分的质量——对子目标质量影响很大 [π0.7 App. C]。片段边界决定了「达成的子目标」是什么,边界一模糊,世界模型生成的目标就是错的。

评测卫生

有一条脚注承载了极大分量:在任何以泛化为目标的评测任务中采到的自主数据,都被排除在训练之外 [π0.7 §VI-A fn. 1]

没有这条排除,飞轮就会不知不觉拿测试集训练 [π0.7 §VI-A fn. 1]。系统部署一个策略,录下它在评测中的行为,再把数据喂回训练——这就是经典的「一边污染留出任务、一边相信自己测的是泛化」。这种纪律不会出现在任何结果表里,却完全决定了那些结果有没有意义。

数据怎么组织

本小节整体为推断。 π0.7 对内部存储格式只字未提 [π0.7 §VI-A]。但从上下文字段可以反推 schema,开源生态恰好提供了一个值得讲的具体样例,也跟上下文字段暗示的结构对得上 [π0.7 §V-C]

开源那一侧按访问模式分成两条路,与上下文字段要求的 schema 对应 [π0.7 §VI-B]LeRobot 把 episode 存成 Parquet 表加 MP4 视频,配一个 meta/tasks 索引,支持 map 式随机访问——微调阶段的正确选择,因为那时数据集装得下,可以做打乱。RLDS/TFDS 则按分片流式读取,配大容量 shuffle buffer 和跨数据集的加权交织——预训练阶段的正确选择,因为那时混合语料大到建不了索引。原则可以推广:格式服从访问模式,访问模式服从规模。

比文件格式更重要的是记录 schema,而它由上下文束直接决定:episode 级的质量、速度、控制模式;片段级的子任务文本与失误标记;帧级的最多 4 路相机图像与本体感知 [π0.7 §V-C, §VI-B]。任何复现都必须把这些字段当一等公民来承载,因为训练就是条件化在它们上面的。

规模化的回报

以上全部存在的理由,就是为了得到这个结果 [π0.7 §IX-E, Fig. 18]

为什么元数据会改变规模化曲线的正负号

有了 episode 元数据,哪怕平均数据质量在下降,性能照样随数据量持续上升;没有元数据,性能反而随低质量数据的加入而下滑 [π0.7 §IX-E, Fig. 18]规模化曲线的正负号,取决于你有没有告诉模型它在看什么。

第二个消融进一步锐化了「多样性」在操作层面的含义:去掉任务多样性最高的那 20% 机器人数据,造成的伤害明显大于随机去掉 20% [π0.7 §IX-E, Fig. 18]。数据的价值并不按小时均匀分布。不常见任务构成的长尾承载了不成比例的分量——这对采集预算的分配是个明确信号:优先铺广度,别堆深度。

第 5 部分超参数表

参数取值出处
数据来源类别数8[π0.7 §VI-A]
质量标注1–5 整数[π0.7 §V-C]
失误标注按动作片段的布尔量,粗粒度[π0.7 §V-C]
速度导出方式episode 长度,500 步分箱[π0.7 §V-C]
评测卫生泛化类评测的自主数据被排除[π0.7 §VI-A fn. 1]
多样性消融去掉最多样的 20% 比随机去 20% 伤害更大[π0.7 §IX-E, Fig. 18]
π 系列预训练语料规模数万小时[π*0.6 §IV-C]
数据集小时数 / episode 数未公开[π0.7 §VI-A]
各来源混合权重未公开[π0.7 §VI-A]
标注规范与一致性未公开[π0.7 §V-C]
存储格式推断,取自开源对应物[π0.7 §VI-A]

第 6 部分 —— 子系统:模型架构

输入输出: 输入——最多 4 路相机 × 最多 6 帧历史($448\times448$)、最多 3 张子目标图像、本体感知及其历史、文本上下文;输出——50 个动作 token,构成一个动作块 [π0.7 §VI-B]

π0.7 的架构与数据流

参数预算

π0.7 的控制通路合计约 5B 参数 [π0.7 §IV, Fig. 2]。拆开看:一个 4B 的 VLM 主干,从 Gemma3 4B 初始化,里面已经包了一个 400M 的 SigLIP 类视觉编码器;再加一个 MEM 式视频历史编码器;再加一个 860M 的流匹配动作专家 [π0.7 §IV, §VI-B, Fig. 2]

对习惯了 LLM 尺度的人来说,有两点值得注意。第一,这个模型很小——总共 5B,单张 H100 就能部署 [π0.7 App. D]。瓶颈是延迟而非能力:更大的主干塞不进控制回路。第二,860M 的动作专家占了差不多五分之一,比重不小。动作生成不是挂在语言模型上的一个薄头,而是有自己目标函数、自己梯度隔离的一个正经子网络 [π0.7 §III]

控制通路旁边站着世界模型,从 BAGEL 初始化——一个 14B 的 mixture-of-transformers,采用 SuSIE 式初始化 [π0.7 §V-B, App. D]。内部把 ViT token 交给一个 7B 的 LLM 主干,VAE token 交给另一个 7B 的生成主干 [π0.7 App. C]它比它辅助的那个策略重了近三倍,而且不在控制回路里运行。

高层策略与主模型同架构,同样基于 Gemma3 4B,把观测、任务描述和过往子任务指令映射为下一条子任务 [π0.7 §V-A, App. D]

历史编码器

π0.7 的记忆能力来自历史编码器,整套继承自 MEM [π0.7 §IV]

它同时做时间空间压缩,最关键的性质是:不管输入多少帧历史,输出的 token 数是固定的——历史被压到跟单帧一样的 token 数 [π0.7 §IV, §VI-B]。这才是历史「用得起」的原因:对主干来说,多加 6 帧记忆的序列长度代价是零。

具体机制照 MEM 所述——改造后的 ViT 注意力模式:每帧内部双向空间注意力,每隔 4 层加一次跨帧因果时间注意力,只把当前时刻的表示往后传,相比标准单图 ViT 不引入任何新的可学习参数,只多一个固定的正弦时间位置编码 [MEM §III-C]。π0.7 的设定是每路相机最多 6 帧、步长 1 秒,整段历史以 $p = 0.3$ 丢弃,后视图像同样以 $p = 0.3$ 丢弃 [π0.7 §VI-B]

状态嵌入:一个小改动,理由很清楚

π0.6 把本体感知状态表示成离散化文本 token [π*0.6 §V-A]。π0.7 换成了 MEM 的做法,用线性投影把本体感知嵌入主干维度,每帧历史状态各占一个 token,帧被丢弃时对应状态 token 一并掩掉 [π0.7 §VI-B]

改的理由是序列长度。一旦引入状态历史,文本 token 方案会迅速膨胀出大量状态 token,而线性投影严格一帧一个 [MEM §III-D]。这是一条通用规则的干净例证:对单帧够用的表示,拉到序列上可能就扛不住了。 加入记忆之后每帧的编码开销要乘帧数,「无损但啰嗦」的编码方式就划不来了。

动作专家

动作专家是一个 860M 的 Transformer,以流匹配训练,用自适应 RMSNorm 注入流的时间步 [π0.7 §VI-B]。它承载 50 个动作 token,这些 token 彼此双向注意,并注意主干的激活 [π0.7 §VI-B]

动作 token 之间用双向注意力是正确的选择 [π0.7 §VI-B]:动作块是联合生成的,不是自回归生成的,块内各位置之间没有因果顺序可言。因果性是物理世界时间轴的性质,不是采样过程的性质。

注意力的精确形态

总体模式是块因果 [π0.7 §VI-B]。观测 token 和子目标图像 token 各自内部双向注意;目标 token 可以额外注意观测;其后的文本 token 用因果注意力 [π0.7 §VI-B]。当图像目标不存在时,模式与 π0.5 相同,所有带记忆能力的图像视角的嵌入之间全局双向;当目标存在时,它们在文本提示之后构成一个额外的块因果双向块 [π0.7 App. B, Fig. 19]

加上第 1 部分的那条承重约束:FAST token 只在训练时存在,且 FAST token 和流动作互不注意 [π0.7 App. B, Fig. 19]

推理侧还有一处巧妙设计。做无分类器引导时,正例和负例被打包进同一条序列,构成一棵「注意力树」,两条分支互不注意 [π0.7 App. B]。通常 CFG 意味着两次前向;这里变成了一次前向加一个掩码。世界模型用了同样的技巧,只是掩码更复杂——3 个 CFG 组而不是 2 个 [π0.7 App. B]

世界模型

世界模型的任务是生成子目标图像:给定当前观测和目标子任务,产出「近期未来应该长什么样」[π0.7 §V-B]

目标是对真值子目标做条件流匹配 [π0.7 §V-B]

$$\max_{\psi}\; \mathbb{E}\left[\, \mathcal{L}_{\mathrm{CFM}}\!\left( g^{*}_{t},\; g_{\psi}(o_t,\, \tilde{\ell}_t,\, m) \right) \right]$$

其中真值子目标 $g^{*}_{t} = o_{t_{\mathrm{end}}}$ 取自子任务标签质量特别高的片段末尾 [π0.7 §V-B]。每个训练样本包含一条子任务指令、3 路相机输入和 3 张目标图像,目标时刻取该片段的最后一帧 [π0.7 App. C]

沿用 BAGEL 的做法,相机输入同时走 ViT(负责语义理解)和 VAE(负责细粒度图像细节)两条路 [π0.7 App. C]。两条路用不同分辨率——ViT 输入 $448\times336$,VAE 输入(含目标图像)$512\times384$——因为二者 patch 大小不同,分别是 14 和 16 [π0.7 App. C]。这是只有落到实现层才会冒出来的约束的好例子:分辨率是 patch 大小的下游产物,混用两个 tokenizer 就得调和它们的网格。

第 6 部分超参数表

参数取值出处
控制通路总参数约 5B[π0.7 §IV, Fig. 2]
VLM 主干4B,来自 Gemma3 4B[π0.7 §IV, Fig. 2]
视觉编码器400M SigLIP 类,含在 4B 之内[π0.7 §IV, §VI-B]
动作专家860M,流匹配[π0.7 §IV, §VI-B]
时间步注入自适应 RMSNorm[π0.7 §VI-B]
动作 token50 个,双向,注意主干激活[π0.7 §VI-B]
历史编码器MEM 式,任意帧数输出固定 token 数[π0.7 §IV, §VI-B]
状态嵌入线性投影,每帧历史状态 1 个 token[π0.7 §VI-B]
注意力块因果;FAST ⊥ 流动作[π0.7 §VI-B, App. B, Fig. 19]
CFG 实现注意力树,单序列两分支[π0.7 App. B]
世界模型BAGEL 14B,SuSIE 式初始化[π0.7 §V-B, App. D]
世界模型子主干7B 理解 + 7B 生成[π0.7 App. C]
世界模型分辨率ViT 448×336;VAE 512×384(patch 14 / 16)[π0.7 App. C]
高层策略同架构,Gemma3 4B[π0.7 §V-A, App. D]
各本体的动作维度未公开[π0.7 §VI-B]

第 7 部分 —— 子系统:训练流水线

输入输出: 输入——带标注的语料,加上初始化权重(Gemma3 4B、SigLIP 400M、BAGEL 14B);输出——训练好的 π0.7、世界模型和高层策略 [π0.7 §V, §VI]

两个耦合的目标函数

训练在两组参数上优化两个目标函数,由一个 stop-gradient 耦合起来 [π0.7 §III]

主干吃 FAST token 交叉熵,动作专家吃流匹配;专家看得到主干激活,但梯度不回流 [π0.7 §III]。本部分剩下的内容,讲的都是「上下文里放什么」以及「多久把它抽掉一次」。

全部 dropout 与采样比率

这块内容复现时靠猜是猜不出来的,所以完整列一遍 [π0.7 §V-E, §VI-B, §VI-C]

上下文 dropout [π0.7 §V-E]

观测 dropout [π0.7 §VI-B]

子目标采样 [π0.7 §VI-C]

  • 真实子目标:$p = 0.25$ 取片段末尾(与世界模型的预测目标对齐);$p = 0.75$ 在未来 0–4 秒内均匀采 [π0.7 §VI-C]
  • 生成子目标:从世界模型采大量子目标,用来构造额外训练样本,缓解真实图像与生成图像之间的训练/测试不匹配 [π0.7 §VI-C]

最后这一条值得强调 [π0.7 §VI-C]部署时子目标来自世界模型,不是某一帧真实的未来;如果只拿真实帧训练,恰恰会在这个特性起作用的地方制造分布偏移。用「将来负责供给它的那个模型」来生成训练子目标,就把这个环闭上了。跟 RTC 是同一种纪律:在你将来部署的条件下训练。

子目标为什么只出现在四分之一的样本里

这里再强调一次,因为它是论文里最有教益的一个超参数:有了子目标图像,任务会退化成接近逆动力学,训练因此快得多 [π0.7 §V-E]

如果永远给子目标,模型就会练成一个逆动力学模型——看到目标图,往那儿插值就完事了——而永远不会发展出「仅凭观测和语言推断意图」这项更难的能力。25% 的上限是对这条捷径的刻意限流 [π0.7 §V-E]

为延迟而训练

训练期实时分块模拟 0–12 个时间步的延迟,对应 50 Hz 下 240 ms 的最大推理延迟 [π0.7 §VI-B]。跟测试期 RTC 不同,训练期变体不带来任何额外推理开销 [π0.7 App. D, ref. 108]

世界模型的训练

世界模型从 BAGEL 初始化,基本沿用同一套训练方案 [π0.7 App. C]

语料是机器人数据的一个子集,加上带高质量切分语言标签的第一人称人类视频,再混入若干开源图像编辑数据集和开源视频数据集,目的是保住模型的语义知识 [π0.7 App. C]。这种混合跟策略侧的网络协同训练是一个逻辑:生成模型必须保持通用视觉能力,不能坍缩到机器人分布上。

已记录在案的敏感性:标签质量,尤其是时间切分质量,对子目标质量影响很大 [π0.7 App. C]。因为子目标的监督信号被定义为片段末尾,所以片段边界本身就是监督信号

另有一个值得点名的好处:世界模型部分地在非机器人数据上训练,网络里的语义和物理概念可以间接流入 π0.7——通过生成的子目标图像 [π0.7 §V-B]子目标通道是网络知识抵达策略的第二条路径,它绕过了主干。

训练没告诉你的

以上全部是公开的。以下不是,复现时必须自行拿主意 [π0.7 §VI]

清单不短,也正是本部分诚实的结论:上下文配方被完整公开了;优化配方没有 [π0.7 §VI]

第 7 部分超参数表

参数取值出处
主干目标函数FAST token 交叉熵[π0.7 §III]
动作专家目标函数流匹配[π0.7 §III]
耦合方式stop-gradient;专家只读不改[π0.7 §III]
带子目标图像的样本25%[π0.7 §V-E]
其中子任务被丢弃30%[π0.7 §V-E]
元数据整体丢弃15%[π0.7 §V-E]
元数据各分量额外丢弃5%[π0.7 §V-E]
控制模式 dropout[π0.7 §V-E]
历史丢弃$p = 0.3$[π0.7 §VI-B]
后视丢弃$p = 0.3$[π0.7 §VI-B]
真实子目标采样$p = 0.25$ 片段末尾;$p = 0.75$ 未来 0–4 秒均匀[π0.7 §VI-C]
生成子目标从世界模型大量采样[π0.7 §VI-C]
RTC 模拟延迟0–12 步 = 50 Hz 下 240 ms[π0.7 §VI-B]
世界模型目标对片段末帧的条件流匹配[π0.7 §V-B]
优化器、调度、batch size未公开[π0.7 §VI]
步数、算力、耗时未公开[π0.7 §VI]

第 8 部分 —— 子系统:服务运行时

输入输出: 输入——最多 4 路相机的实时观测流加本体感知;输出——以 20 或 50 Hz 不间断下发的关节指令 [π0.7 §VII, §VIII]

服务运行时:三条异步线程

逐行走一遍 Algorithm 1

部署循环由四步构成 [π0.7 §VII, Alg. 1]

  1. 采子目标,来自世界模型:$g^{*} \sim p_{\psi}(\cdot \mid o_t,\, \tilde{\ell},\, m)$ [π0.7 §VII, Alg. 1]
  2. 组装上下文 $C = \{\ell,\, \tilde{\ell},\, g^{*},\, m,\, c\}$——总任务、子任务、子目标图像、元数据、控制模式 [π0.7 §VII, Alg. 1]
  3. 采动作块 $a_{t:t+H} \sim \pi_{\theta}(\cdot \mid o_{t-T:t},\, C)$,5 个去噪步 [π0.7 §VII, Alg. 1]
  4. 重规划:执行 $\tilde{H}$ 步后重新推理;子任务 $\tilde{\ell}$ 变了或 $\Delta$ 计时器到点时,重采子目标 [π0.7 §VII, Alg. 1]

运行时常量:5 个去噪步;50 步块中执行 15 或 25 步;子目标在语义意图变化或每 $\Delta = 4$ 秒(先到为准)刷新一次;对 episode 元数据施加 CFG 权重 $\beta \in \{1.3,\, 1.7,\, 2.2\}$ [π0.7 §VII]。4 秒这个间隔是为了跟 SuSIE 对齐 [π0.7 App. C]

异步才是真正承重的设计

子目标生成和子任务生成跑在独立线程里,VLA 推理始终用各自最新可用的结果 [π0.7 §VII, Alg. 1]

理由看算术就明白了。生成一张子目标图像要 1.25 秒——一个 14B 模型在接近 10,000 token 的序列上跑 25 步去噪,而且这还是用了 4 路张量并行(4×H100)、大矩阵乘法全部量化到 8 bit、主干注意力换上改版 SageAttention 之后的成绩 [π0.7 App. D]。与此同时,机器人在 50 Hz 下每 20 毫秒就得吃一个新动作。同步设计意味着每刷新一次子目标,机器人就得呆在那儿一秒多。

于是 π0.7 采用论文所说的「朴素异步策略」:世界模型算下一个子目标的同时,策略继续按当前子目标行动 [π0.7 App. D]过时的子目标被当作连续性的代价接受了下来——当子目标描述的是意图而不是精确设定点时,一个 4 秒前的子目标完全够用 [π0.7 §V-B]

预备知识 —— 异步为什么重要。 不用异步的话,机器人在两个动作块之间会明显停顿:伸手、僵住、伸手、僵住。除了看着像坏了之外,在动作中途停下会改变物理状态——一个在重力下完成到一半的抓取并不是一个稳定平衡态,你未必能从那个状态接着往下做。连续执行是功能需求,不是锦上添花。

端到端延迟预算

下面这几个数字把第 7 部分的训练假设闭合了 [π0.7 App. D]

  • 38 ms——最小配置,3 路相机、5 个去噪步、训练期 RTC [π0.7 App. D]
  • 127 ms——最坏情况,开了 MEM 视觉编码器并把子目标图像放入上下文 [π0.7 App. D]
  • 240 ms——策略被训练成能容忍的上限,来自 RTC 在 50 Hz 下模拟的 0–12 步延迟 [π0.7 §VI-B]

π0.7 和高层策略共用单张 NVIDIA H100;世界模型另占 4 张 [π0.7 App. D]

把三个数字放一块看,工程纪律一目了然 [π0.7 §VI-B, App. D]现实中的最坏情况大约只用了已训练容忍度的一半。记忆、子目标这些可选特性之所以用得起,恰恰是因为基线延迟先被压下去了。

第 8 部分超参数表

参数取值出处
去噪步数5[π0.7 §VII]
执行步长 $\tilde{H}$50 步中的 15 或 25[π0.7 §VII]
子目标刷新 $\Delta$4 秒,或意图改变时[π0.7 §VII, App. C]
CFG 权重 $\beta$元数据上取 1.3、1.7 或 2.2[π0.7 §VII]
速度提示任务 episode 长度第 15 百分位[π0.7 §VII]
质量提示恒为 5[π0.7 §VII]
失误提示恒为 false[π0.7 §VII]
VLA 推理硬件单张 NVIDIA H100[π0.7 App. D]
VLA 延迟最小 38 ms / 最坏 127 ms[π0.7 App. D]
世界模型硬件4×H100,4 路张量并行[π0.7 App. D]
世界模型量化大矩阵乘法全部 8 bit[π0.7 App. D]
世界模型注意力改版 SageAttention[π0.7 App. D]
子目标生成开销25 个去噪步,1.25 秒[π0.7 App. D]
世界模型序列长度接近 10,000 token[π0.7 App. D]
完整服务栈未公开[π0.7 App. D]

第 9 部分 —— 子系统:评测装置

输入输出: 输入——一个训练好的策略;输出——你真敢信的能力结论。

对 LLM 研究者来说,这是整套系统里最陌生的环节:这里没有留出集可以打分——下面每一个数字都是拿真机小时换来的 [π0.7 §IX-E]

三个指标

π0.7 报告成功率、以百分比表示的任务进度,以及以「次/小时」表示的归一化吞吐量 [π0.7 Fig. 6]

吞吐量是可能让你意外的那一个——它更像生产指标,不像研究指标。一个可靠但慢的策略,价值不如一个成功率略低但快得多的策略,因为部署时真正关心的量是单位机器人时间完成的任务数。特别值得注意的是,在多样化叠衣和装箱两项任务上,π0.7 的吞吐量超过了经过 RL 训练的专家模型 [π0.7 Fig. 6]——通才在专家的主场胜出,这是第 5 部分那个「蒸馏」论断最有力的佐证。

任务进度需要评分细则,附录 G 给每个任务出了一份 [π0.7 App. G]。这些是人工设计的部分给分量表:Take Out Trash 满分 12,Peel Fruits and Vegetables 满分 9,Make Peanut Butter Sandwich 满分 9,Turn a T-Shirt Inside Out 满分 7,Shirt Folding 满分 6 [π0.7 App. G]。其中 Shirt Folding 每完成一次符合对齐容差的折叠得 1 分,再加一个 0–3 的折叠质量分,满分 6 分算成功 [π0.7 App. G]

由此有两个推论。第一,「任务进度」不是学出来的、也不是自动算出来的——就是人对着视频按清单打分。第二,细则是逐任务定制的,跨任务比较进度分数只有归一化之后才有意义 [π0.7 App. G]

评测协议

指令跟随在 14 个场景上测,每个场景 3–6 条开放式指令,环境是 4 个没见过的厨房和 2 个没见过的卧室 [π0.7 §IX-B, Fig. 9]

跨本体迁移通过「在一台机器人上训、在另一台上测」来做,硬目标是双臂 UR5e [π0.7 §IX-C]。附录里的一项对比发现,关节空间和末端执行器控制在各任务上并没有显示出 EE 的明显优势,所以主线跨本体实验为清晰起见统一用关节空间 [π0.7 App. E, Fig. 20]

消融承载着核心论点。去掉元数据的 π0.7 和去掉评测数据的 π0.7 都会变差,尤其体现在吞吐量上 [π0.7 Fig. 7]。而图 18 的规模化与多样性结果,才是中心论断的许可证 [π0.7 §IX-E, Fig. 18]

人类基线

论文里最有意思的一项评测,是跟人的正面比较 [π0.7 App. F]

10 名处于经验前 2 百分位、在各平台平均约 375 小时遥操作经验的操作员,被要求在双臂 UR5e 上叠衬衫 [π0.7 App. F, Fig. 21]。关键是,他们之前都没有在 UR5e 上叠过衬衫——跟策略所处的「零样本」设定完全对等 [π0.7 App. F]。每人 3 次试验,共 30 次,第一次之前不给任何练习或热身,初始构型、时限和评判标准跟策略评测一模一样 [π0.7 App. F]

结果:人类操作员平均任务进度 90.9%、成功率 80.6%;π0.7 任务进度 85.6%、成功率 80% [π0.7 §IX-C, App. F, Fig. 22]

下结论之前请仔细看清楚。这不是「机器人追平人类」这么大的判断,而是一个更精确也更窄的结论:在一项灵巧任务上,在一个策略和操作员都没用它做过该任务的机器人本体上,通才策略的得分跟冷启动上手的专家遥操作员相当 [π0.7 App. F]。基线是零样本的人,不是练熟了的人。它真正的说服力在于比较的方向——这个策略正在跟生产它自己训练数据的那套机制同台竞技。

物理评测为什么这么难

每次试验都消耗真实的机器人时间,样本量小、方差大。场景无法精确复位,各次试验并不是从固定分布里做的独立抽样。还有作者自己交代的那条局限:在这个数据规模下,实际上很难明确判定哪些任务真正算「没见过」[π0.7 §IX-E]

最后这条值得尊重而不是怀疑。当语料是横跨大量任务和环境的数万小时时 [π*0.6 §IV-C],「没见过」就变成了一个关于整个训练分布的断言,而没有人能完整核验它。第 5 部分那条评测排除脚注,才是让这个断言勉强站得住的前提 [π0.7 §VI-A fn. 1]

第 9 部分数值表

项目取值出处
指标成功率;任务进度 %;归一化吞吐量[π0.7 Fig. 6]
指令跟随协议14 个场景,每个 3–6 条指令[π0.7 §IX-B, Fig. 9]
未见环境4 个厨房、2 个卧室[π0.7 §IX-B]
人类实验10 名操作员,经验前 2 百分位,约 375 小时[π0.7 App. F, Fig. 21]
人类实验流程每人 3 次,共 30 次,无热身[π0.7 App. F]
人类 vs π0.7(UR5e 叠衬衫)90.9% / 80.6% vs 85.6% / 80%[π0.7 §IX-C, Fig. 22]
评分细则满分(示例)Take Out Trash 12、Peel 9、Sandwich 9、Shirt Folding 6[π0.7 App. G]
叠衬衫质量分0–3,满分 6 记为成功[π0.7 App. G]
动作空间结论EE 无明显优势,统一用关节空间[π0.7 App. E, Fig. 20]
多样性消融最多样 20% 的影响大于随机 20%[π0.7 §IX-E, Fig. 18]
泛化落差分布内 >90%;未见组合 60–80%[π0.7 §X]
单次试验原始数据未公开[π0.7 §IX]

第 10 部分 —— 复现蓝图

输入输出: 输入——以上全部;输出——一个构建顺序、一份必须自己拿主意的清单,以及对这件事真实成本的估算。

构建顺序:什么必须先于什么存在

构建顺序

依赖关系是刚性的,而且方向跟大多数 ML 团队想开工的地方正好相反 [π0.7 §VI, §VIII]

第 1 阶段,机队与遥操作。 机器人、相机、PD 控制、逆运动学,以及操作员用来驱动它们的装置 [π0.7 §VIII]。这一层不存在,下游什么都没有。

第 2 阶段,数据引擎与标注。 跨环境采集,加上产出子任务切分、质量分、失误标记和速度分箱的标注流水线 [π0.7 §V-A, §V-C, §VI-A]

第 3 阶段,基础模型初始化。 Gemma3 4B、SigLIP 400M、BAGEL 14B [π0.7 §IV, §V-B]。这一阶段就是下载权重,是整张清单里最便宜的一步。

第 4 阶段,训练。 KI 耦合的两个目标函数、完整的上下文 dropout 调度、RTC 延迟模拟 [π0.7 §III, §V-E, §VI-B]

第 5 阶段,服务。 异步线程、去噪、分块执行、GPU 供给 [π0.7 §VII, App. D]

第 6 阶段,评测。 四个维度、三个指标、逐任务评分细则,以及跑试验的操作员 [π0.7 §IX, App. G]

然后飞轮闭合:第 6 阶段的回放与干预数据回流到第 2 阶段成为训练数据——但必须扣掉所有来自泛化类评测任务的部分 [π0.7 §VI-A, §VI-A fn. 1]

组件选型

逐模块列出 π0.7 用了什么、外部团队能拿到什么。这是系统搭建中的选型,不是代码移植 [π0.7 §IV, §V-B]

模块π0.7 的选择可获得性
VLM 主干Gemma3 4B开放权重 [π0.7 ref. 106]
视觉编码器SigLIP 类 400M,来自 Gemma3开放权重 [π0.7 §IV]
历史编码器MEM 式视频编码器方法已发表,无权重 [π0.7 ref. 37]
动作专家860M 流匹配 Transformer需从头训练 [π0.7 §VI-B]
动作 tokenizerFAST已发表且开源 [π0.7 ref. 104]
世界模型BAGEL 14B开放权重 [π0.7 ref. 105]
子目标初始化SuSIE 式已发表 [π0.7 ref. 93]
延迟处理训练期 RTC已发表 [π0.7 ref. 108]
注意力算子改版 SageAttention已发表 [π0.7 ref. 112]

这张表最扎眼的地方在于可获得的部分有多多。每一个初始化起点都是公开检查点或已发表方法。你拿不到的是数据和组织 [π0.7 §VI-A, App. A]

组织层面的现实

你真正能拿到什么:缺口清单

论文的贡献者名单分为 7 类:数据采集与运营;标注与补充数据;策略训练与研究;策略基础设施;机器人硬件;机器人基础设施;写作与插图 [π0.7 App. A]。按人头数,数据采集与运营下有 24 人,机器人硬件下有 22 人,机器人基础设施下有 10 人 [π0.7 App. A]

看清楚这个分布。最大的一组是「数据采集与运营」,第二大是「机器人硬件」。 一个按 ML 项目思路做预算的复现计划——GPU 和研究员——在量级上就估错了。组织本身是这套系统的一个组件 [π0.7 App. A]

缺口清单

下面是复现时必须在没有指引的情况下自行拿主意的全部内容 [π0.7 §VI, §VI-A, §V-A, §V-C, App. C]

缺口状态出处
数据集的小时数 / episode 数 / 轨迹数未公开[π0.7 §VI-A]
各来源混合权重未公开[π0.7 §VI-A]
优化器、学习率调度、batch size未公开[π0.7 §VI]
总步数、算力、耗时未公开[π0.7 §VI]
标注规范与标注者一致性未公开[π0.7 §V-C]
世界模型语料的规模与构成未公开[π0.7 App. C]
高层策略的训练数据与超参数未公开[π0.7 §V-A]
机队中机器人的数量未公开[π0.7 §VIII]
遥操作接口与硬件未公开[π0.7 §VIII]
各本体的动作维度未公开[π0.7 §VI-B]
单次试验的原始评测数据未公开[π0.7 §IX]
完整服务栈未公开[π0.7 App. D]
数据存储格式推断,参照 LeRobot / RLDS[π0.7 §VI-A]
π0.6 的架构细节部分可恢复[π*0.6 §V-A]

其中两条值得展开 [π0.7 ref. 42]

π0.6 只有模型卡,没有论文 [π0.7 ref. 42]。所以它的直接前任没有可引的规格说明——除了 π*0.6 顺带记下的那些:派生自 π0.5、Gemma 3 4B 基座、860M 动作专家、KI 训练、50 Hz 输出关节角与夹爪指令 [π*0.6 §V-A]翻后继论文来还原前任,这个习惯值得养成。

π0.7 没有公开权重,也没有公开代码。 openpi 仓库只放出了 π0 和 π0.5 [openpi repository]。你能做的只是从论文出发的重新实现,而不是 fork。

这件事的真实成本

把各部分暗示但没明说的话讲白了:公开细节最密集的地方,恰恰是复现最便宜的地方——架构和超参数,一次下载加一个配置文件搞定 [π0.7 §IV, §VI-B]最语焉不详的地方,恰恰是复现最贵的地方——语料、标注运营和机队 [π0.7 §VI-A, §VIII]

这不是在批评论文——它在数字公开上已经异常慷慨。这是这个领域的结构性现实:护城河在数据引擎,而数据引擎不是一种可发表的产物 [π0.7 §VI-A]


第 11 部分 —— 原则与开放问题

输入输出: 输入——完整的系统;输出——可带走的思想,以及诚实的边界。

五条值得偷走的原则

用来源信息做条件,别过滤数据。 面对质量参差的数据,本能反应是扔掉差的一半。π0.7 把它们留下并打上标签,规模化曲线因此翻了方向 [π0.7 §IX-E, Fig. 18]。凡是你手头有大量、异质、好坏不均的数据的场景,这条都用得上。

让质量成为变量,而非门槛。 一旦质量从准入条件变成输入字段,低质量数据就从有害变成有信息量,质量本身也变成了推理时可以索要的东西 [π0.7 §V-C, §VII]

让上下文在运行时挑选行为模式。 速度、质量、无失误都在部署时设定——第 15 百分位的速度、质量 5、失误 false——还能用 CFG 把 $\beta$ 一路推到 2.2 来加大力度 [π0.7 §VII]。一个训好的模型,多种行为模式,不重训就能切换。

把专家蒸馏进通才。 与其养一队任务专用策略,不如在划算的地方跑 RL,再把产出的轨迹作为条件化样本折回通才的训练集 [π0.7 §VI-A, π*0.6 §IV]。结果通才在叠衣和装箱的吞吐量上反超了那些专家 [π0.7 Fig. 6]

增加能力而不丢弃能力。 九代之后,FAST token 化、Hi Robot 的层级、KI 的防火墙、RTC 的延迟处理、MEM 的记忆,全都还活在最终系统里 [π0.7 §III, §V-A, §VI-B]

还有一条其实是「掩码 vs stop-gradient」那个区分的推论:把「一个部件看得见什么」跟「它改得了什么」分开 [π0.7 §III, App. B]。两套机制,两种失效模式;搞混了,就是知识隔离实现出错的常见方式。

开放问题

论文对自己的位置很坦白。分布内成功率超过 90%,未见任务或未见的「任务–机器人」组合停在 60–80% [π0.7 §X]。这道落差就是当前的前沿。

论文提出的方向是把可指挥性本身用于测试任务上的高效学习——通过详细的语言指导,或者通过自主 RL [π0.7 §X]。注意这个圈闭合得多漂亮:原本为吸收异质训练数据而造的条件化机制,反过来成了向一台已部署机器人教新东西的接口。

底下还压着三个更难的问题。这些是我的判断而非论文的,请当作推断,虽然每一条都建立在公开事实之上 [π0.7 §IX-E, §V-C, App. D]

评测能力追不上模型能力。 每个结论都要拿机器人小时来换,样本量始终很小,而作者自己都没法完全判定什么算真正没见过 [π0.7 §IX-E]。随着模型越来越强,区分 85% 和 90% 所需的试验量会超过任何人愿意跑的规模。

元数据质量是一处隐藏依赖。 整个论点建立在论文自己描述为「粗粒度」的一批标签之上 [π0.7 §V-C]。外界不知道这套方法在条件化开始退化之前还剩多少余量,因为一致性数据没有公开 [π0.7 §V-C]

世界模型很贵,而且不在关键路径上。 它要占 4 张 H100、每个子目标 1.25 秒,去辅助一个自己在单卡上 38 ms 就能跑完的策略 [π0.7 App. D]。在跨本体迁移上它确实挣回了这笔开销 [π0.7 §IX-C, Fig. 12],但这个体量比例本身就在呼唤一个更便宜的子目标生成方案,或一种更紧凑的集成方式。

这一切留给你什么

如果只从 π0.7 带走一件东西,带走那次重新表述,不是那个架构。架构不过是对已发表组件的一次高水平组装 [π0.7 §IV]。那次重新表述——把「这条 episode 是怎么来的」写进上下文窗口,从而把你最差的数据从包袱变成信号——才是让规模化曲线翻转方向的东西 [π0.7 §IX-E, Fig. 18]


参考文献

π 系列及其依赖,全部对照 π0.7 自己的参考文献列表核验 [π0.7 bibliography]

工作标题arXiv
π0π0: A Vision-Language-Action Flow Model for General Robot Control2410.24164 [π0.7 ref. 10]
π0-FASTFAST: Efficient Action Tokenization for Vision-Language-Action Models2501.09747 [π0.7 ref. 104]
Hi RobotHi Robot: Open-Ended Instruction Following with Hierarchical VLA Models2502.19417 [π0.7 bibliography]
π0.5π0.5: A VLA with Open-World Generalization2504.16054 [π0.7 ref. 14]
KIKnowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better2505.23705 [π0.7 ref. 103]
RTCReal-Time Execution of Action Chunking Flow Policies2506.07339 [π0.7 ref. 107]
π*0.6π*0.6: a VLA That Learns From Experience2511.14759 [π0.7 ref. 50]
MEMMEM: Multi-Scale Embodied Memory for Vision Language Action Models2603.03596 [π0.7 ref. 37]
π0.7π0.7: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities2604.15483 [π0.7 title page]

外部组件 [π0.7 bibliography]

工作作用arXiv
Gemma 3VLM 主干初始化技术报告 [π0.7 ref. 106]
BAGEL世界模型初始化2505.14683 [π0.7 ref. 105]
SuSIE子目标生成方法2310.10639 [π0.7 ref. 93]
训练期 RTCπ0.7 采用的延迟处理2512.05964 [π0.7 ref. 108]
SageAttention世界模型服务的 8 bit 注意力2410.02367 [π0.7 ref. 112]
Flow matching动作专家的目标函数2210.02747 [π0.7 ref. 102]
无分类器引导推理时的元数据引导2207.12598 [π0.7 ref. 109]

π0.6 没有 arXiv 条目——它是一张模型卡 [π0.7 ref. 42]。其架构可从 π*0.6 §V-A 部分还原。

本文所有数值均由脚本对照事实台账机械校验;正文中每一个数字都可追溯到被引的来源,论文未公开的内容一律在第 10 部分点名 [π0.7 §VI]