精读:PAD——Prediction with Action
论文:Prediction with Action: Visual Policy Learning via Joint Denoising Process
方法名:PAD,Prediction with Action Diffuser
发表:NeurIPS 2024
这篇论文和你刚读的 GR-1 非常接近:二者都认为,机器人策略不应该只预测动作,还应该学习“接下来世界会变成什么样”。区别在于:
PAD 的一句话概括是:
机器人一边“想象未来画面”,一边生成动作,而且这两件事在同一个扩散模型里共同完成。
论文认为,未来图像预测和动作生成都受到相同物理动力学支配,所以不应该像传统方法一样分开学习。
1. 论文试图解决什么问题?
1.1 传统 Diffusion Policy 只预测动作
标准 Diffusion Policy 学习的是:
p ( a t : t + H ∣ o t , l ) p(a_{t:t+H}\mid o_t, l) p ( a t : t + H ∣ o t , l )
其中:
它的优势是能够拟合多模态动作分布。例如,同一个物体可以从左边抓,也可以从右边抓,扩散模型可以保留多种可能性。
但它有一个问题:
动作是低维信号,单纯预测动作并不强迫模型真正理解场景将如何变化。
例如,机械臂执行“把红色方块放进碗里”:
后者提供了更丰富的监督信号。
1.2 两阶段方法割裂了预测与控制
UniPi、SuSIE 等方法通常采用:
当前图像 → 目标图像 → 逆动力学/低层策略 → 动作 \text{当前图像} \rightarrow \text{目标图像}
\rightarrow \text{逆动力学/低层策略}
\rightarrow \text{动作} 当前图像 → 目标图像 → 逆动力学 / 低层策略 → 动作
即先用生成模型想象目标图像,再用另一个策略根据目标图像生成动作。
问题在于:
图像生成器和动作策略分开训练;
图像成为两个模型之间的信息瓶颈;
图像生成模型内部丰富的 latent feature 没有直接用于动作预测;
图像生成错误会继续传递给低层策略。
PAD 则希望直接建模:
p ( x t + 1 : t + k I , x t + 1 : t + k A ∣ c t I , c t A , l ) p(x^{I}_{t+1:t+k},x^{A}_{t+1:t+k}
\mid c^I_t,c^A_t,l) p ( x t + 1 : t + k I , x t + 1 : t + k A ∣ c t I , c t A , l )
也就是:
x I x^I x I :未来图像;
x A x^A x A :未来机器人动作或位姿;
c t I c^I_t c t I :当前图像;
c t A c^A_t c t A :当前机器人状态;
l l l :语言指令。
图像和动作不再是串联关系,而是联合生成 关系。
2. PAD 的核心思想
PAD 建模如下联合分布:
p ( x I , x A , x E ∣ c I , c A , c E , l ) p(x_I,x_A,x_E\mid c_I,c_A,c_E,l) p ( x I , x A , x E ∣ c I , c A , c E , l )
其中:
符号 含义 c I c_I c I 当前 RGB 图像 c A c_A c A 当前机器人位姿 c E c_E c E 当前额外模态,如深度图 l l l 语言指令 x I x_I x I 未来 RGB 图像 x A x_A x A 未来动作/机器人位姿 x E x_E x E 未来额外模态
模型不是只预测一步,而是同时预测未来 k k k 步:
x I 1 : k , x A 1 : k , x E 1 : k x_I^{1:k},\quad x_A^{1:k},\quad x_E^{1:k} x I 1 : k , x A 1 : k , x E 1 : k
但真正执行时只执行第一个动作:
a t = x A 1 a_t=x_A^1 a t = x A 1
然后获取新的观测,再重新预测。这就是类似 MPC 的 receding-horizon control,滚动时域控制 。
3. 整体架构
PAD 的核心架构可以写成:
RGB → Frozen VAE image latent tokens Robot pose → MLP action token Depth → Downsample + Patchify depth tokens Language → Frozen CLIP text condition \begin{aligned}
\text{RGB}&\xrightarrow{\text{Frozen VAE}}\text{image latent tokens}\
\text{Robot pose}&\xrightarrow{\text{MLP}}\text{action token}\
\text{Depth}&\xrightarrow{\text{Downsample + Patchify}}\text{depth tokens}\
\text{Language}&\xrightarrow{\text{Frozen CLIP}}\text{text condition}
\end{aligned} RGB Frozen VAE image latent tokens Robot pose MLP action token Depth Downsample + Patchify depth tokens Language Frozen CLIP text condition
随后:
[ image tokens ; action tokens ; depth tokens ] → DiT [ ϵ ^ I ; ϵ ^ A ; ϵ ^ E ] [\text{image tokens};\text{action tokens};\text{depth tokens}]
\xrightarrow{\text{DiT}}
[\hat\epsilon_I;\hat\epsilon_A;\hat\epsilon_E] [ image tokens ; action tokens ; depth tokens ] DiT [ ϵ ^ I ; ϵ ^ A ; ϵ ^ E ]
也就是说,一个 DiT 同时预测不同模态中加入的噪声。
论文的 Figure 3 是理解方法最关键的一张图:不同模态先进入各自编码器,再形成统一 token 序列,在同一组 DiT block 内通过 self-attention 交互,最后同时恢复未来 RGB、动作和深度。
4. 输入是怎样构造的?
这是 PAD 最容易看混的部分。
4.1 当前观测作为条件
对于图像模态,当前图像经过冻结的 VAE encoder:
e I ( c I ) = E I ( c I ) e_I(c_I)=\mathcal E_I(c_I) e I ( c I ) = E I ( c I )
未来 k k k 帧图像对应的 latent 被加入扩散噪声:
z t I z_t^I z t I
作者将当前条件 latent 和未来的 noisy latent 在 channel 维度拼接:
L I = [ E I ( c I ) , z t I ] L_I=
\left[
\mathcal E_I(c_I),z_t^I
\right] L I = [ E I ( c I ) , z t I ]
假设单张图像 latent 的尺寸为:
c × d × d c\times d\times d c × d × d
预测 k k k 帧时,未来 noisy latent 的尺寸为:
k c × d × d kc\times d\times d k c × d × d
所以拼接后的输入为:
L I ∈ R ( k + 1 ) c × d × d L_I\in \mathbb R^{(k+1)c\times d\times d} L I ∈ R ( k + 1 ) c × d × d
直观上相当于:
[ 当前真实观测 , 未来噪声 , 未来噪声 , … ] [\text{当前真实观测},\text{未来噪声},\text{未来噪声},\ldots] [ 当前真实观测 , 未来噪声 , 未来噪声 , … ]
模型的任务是保留当前观测作为条件,把后面的噪声逐渐还原为未来图像。
动作和深度采用相同思想:
L A = [ E A ( c A ) , z t A ] L_A=
\left[
\mathcal E_A(c_A),z_t^A
\right] L A = [ E A ( c A ) , z t A ]
L E = [ E E ( c E ) , z t E ] L_E=
\left[
\mathcal E_E(c_E),z_t^E
\right] L E = [ E E ( c E ) , z t E ]
这种设计类似条件图像生成中的 channel concatenation。
4.2 各模态怎样变成 token?
RGB 图像
输入分辨率是 256 × 256 256\times256 256 × 256 。
冻结 VAE 将其压缩为:
32 × 32 × 4 32\times32\times4 32 × 32 × 4
在 PAD-XL/2 中,使用 2 × 2 2\times2 2 × 2 patch:
N I = 32 2 × 32 2 = 256 N_I=
\frac{32}{2}\times\frac{32}{2}
=256 N I = 2 32 × 2 32 = 256
所以图像一共产生 256 个 token。
动作
动作序列先拼成一个向量,再经过 MLP 和线性投影。
值得注意的是:
PAD 把整段机器人动作序列压缩为 1 个 action token 。
因此默认模型的 token 构成大致是:
256 image tokens + 1 action token 256\text{ image tokens}+1\text{ action token} 256 image tokens + 1 action token
深度模态加入后还会增加 16 个 depth tokens。
这会带来一个值得思考的问题:
图像在 self-attention 中拥有 256 个 token,而动作只有 1 个 token,图像的信息容量和计算占比显著更大。
作者通过动作损失权重来部分平衡这种模态不对称。
5. 为什么选择 DiT?
PAD 没有继续使用常见的 U-Net diffusion backbone,而是使用 Diffusion Transformer。
原因主要有三个。
5.1 不同模态可以直接拼成 token 序列
T = [ T I ; T A ; T E ] T=
[T_I;T_A;T_E] T = [ T I ; T A ; T E ]
通过 self-attention,图像 token 和动作 token 可以直接交互:
$$
\operatorname{Attention}(Q,K,V)
\operatorname{softmax}
\left(
\frac{QK^\top}{\sqrt d}
\right)V
于是动作 t o k e n 可以关注: − 目标物体位置; − 机械臂位置; − 未来图像变化; − 深度变化。图像 t o k e n 也可以受到动作 t o k e n 的影响。因此它不是:
于是动作 token 可以关注:
- 目标物体位置;
- 机械臂位置;
- 未来图像变化;
- 深度变化。
图像 token 也可以受到动作 token 的影响。
因此它不是:
于是动作 t o k e n 可以关注: − 目标物体位置; − 机械臂位置; − 未来图像变化; − 深度变化。图像 t o k e n 也可以受到动作 t o k e n 的影响。因此它不是:
\text{先图像预测,再动作预测}
而是:
而是:
而是:
\text{图像预测}\leftrightarrow\text{动作预测}
---
## 5.2 支持缺失模态
视频数据通常没有机器人动作:
D_{\text{video}}={I_{1:T}}
机器人数据则有图像、动作和语言:
# $$
D_{\text{robot}}
{I_{1:T},a_{1:T},l}
对于没有动作的视频,PAD:
将动作位置填充为 padding;
使用 attention mask 屏蔽这些位置;
只计算有效模态的输出和损失。
因此同一个 DiT 可以处理:
RGB-only 视频;
RGB + action;
RGB + action + depth。
这是 PAD 能够进行异构数据联合训练的关键。
5.3 可以从图像生成 DiT 初始化
PAD 使用 ImageNet 上预训练的 DiT 权重初始化。
但原 DiT 只有图像生成能力,没有语言、动作、深度模块,因此作者:
删除原来的类别 label embedding;
新增 text embedding 层并置零初始化;
动作 encoder、decoder 置零初始化;
对图像 tokenizer 权重复制 k + 1 k+1 k + 1 次,以支持当前帧和未来 k k k 帧的 channel stacking。
置零初始化的意义是:
新增加的动作和文本分支在训练初期不会严重扰乱已经学到的图像生成能力。
6. 联合扩散过程
先回顾标准扩散模型。
给定干净 latent z 0 z_0 z 0 ,前向加噪为:
z t = α ˉ t z 0 + 1 − α ˉ t ϵ , ϵ ∼ N ( 0 , I ) z_t=
\sqrt{\bar\alpha_t}z_0+
\sqrt{1-\bar\alpha_t}\epsilon,
\qquad
\epsilon\sim\mathcal N(0,I) z t = α ˉ t z 0 + 1 − α ˉ t ϵ , ϵ ∼ N ( 0 , I )
神经网络学习预测噪声:
ϵ θ ( z t , t , c ) \epsilon_\theta(z_t,t,c) ϵ θ ( z t , t , c )
其损失为:
$$
\mathcal L_{\mathrm{diff}}
\mathbb E
\left[
\left|
\epsilon-
\epsilon_\theta(z_t,t,c)
\right|_2^2
\right]
PAD 的区别在于:需要同时对多个模态去噪。
对模态 $\delta\in{I,A,E}$:
# $$
\mathcal L^\delta_{\mathrm{diff}}
\mathbb E_{\epsilon^\delta,t,C,l}
\left[
\left|
\epsilon^\delta-
\epsilon^\delta_\theta
\left(
z_t^\delta,t,C,l
\right)
\right|_2^2
\right]
其中:
C = c I , c A , c E C={c_I,c_A,c_E} C = c I , c A , c E
最终联合目标为:
$$
\boxed{
\mathcal L(\theta)
\lambda_I\mathcal L^I_{\mathrm{diff}}
+
\lambda_A\mathcal L^A_{\mathrm{diff}}
+
\lambda_E\mathcal L^E_{\mathrm{diff}}
}
分别对应:
- 图像去噪损失;
- 动作去噪损失;
- 深度去噪损失。
因此,“joint denoising”并不是把图像和动作简单地放进同一个 batch,而是:
1. 不同模态都被加噪;
2. 模态 token 在同一个 Transformer 中交互;
3. 模型同时预测各模态噪声;
4. 梯度通过共享 DiT 参数相互影响。
---
# 7. 图像预测为什么能够帮助动作?
论文给出的解释是:
## 7.1 提供高维、密集监督
动作监督可能只有几维:
a_t\in\mathbb R^4
或者:
或者:
或者:
a_t\in\mathbb R^7
但未来图像包含大量信息:
但未来图像包含大量信息:
但未来图像包含大量信息:
x_{t+1}\in\mathbb R^{H\times W\times3}
预测未来图像迫使模型学习:
- 物体运动;
- 接触关系;
- 遮挡;
- 机器人与物体的相对位置;
- 任务完成后的视觉结果。
作者认为,只使用低维动作监督容易过拟合机器人示范,而图像预测能提供更丰富的训练信号。
---
## 7.2 图像和动作共享动力学表示
设潜在环境动力学为:
s_{t+1}=f(s_t,a_t)
图像预测近似学习:
图像预测近似学习:
图像预测近似学习:
p(o_{t+1}\mid o_t,a_t)
动作策略学习:
动作策略学习:
动作策略学习:
p(a_t\mid o_t,l)
虽然 PAD 没有显式构造状态转移模型 $f$,但通过联合生成:
p(o_{t+1},a_t\mid o_t,l)
共享 DiT 必须学习能同时解释“该怎么动”和“动完会怎样”的特征。
所以 PAD 可以看成一种:
> **隐式的、面向策略学习的视觉 world model。**
但要注意,它并不是典型的 model-based RL world model,因为它没有在预测出的世界中做显式搜索、价值评估或长轨迹规划。
---
# 8. 训练流程
论文采用两阶段训练。
## 阶段一:视频预训练
作者在 BridgeData-v2 上预训练:
- 数据:约 60,000 条轨迹;
- 训练:200k steps;
- 主要学习未来图像预测先验。
## 阶段二:机器人领域适配
分别适配到:
- MetaWorld;
- 真实 Panda 机械臂。
继续训练:
- 100k steps;
- 使用机器人图像、动作和语言指令。
训练资源:
- 4 张 NVIDIA A100;
- 预训练约 2 天;
- 领域适配约 1 天。
不过这里需要对论文的措辞保持一点谨慎:
> 论文多次使用“大规模互联网视频”描述预训练数据,但主要实验实际使用的是 BridgeData-v2,它本质上是机器人操作轨迹数据,而不是 YouTube 这类通用互联网视频。
因此实验更直接地证明了:
\text{robot video pretraining}
\rightarrow
\text{robot policy improvement}
还没有充分证明:
还没有充分证明:
还没有充分证明:
\text{general web video}
\rightarrow
\text{robot control improvement}
---
## 8.1 损失权重调度
图像损失权重始终保持:
\lambda_I=1
动作和深度损失则从 0 线性增加到 2 :
动作和深度损失则从 0 线性增加到 2:
动作和深度损失则从 0 线性增加到 2 :
\lambda_A,\lambda_E:0\rightarrow2
这一设计可以理解为:
1. 训练初期先保留预训练的图像生成能力;
2. 随着训练进行,逐渐强化机器人动作学习;
3. 避免随机初始化的动作分支破坏图像表示。
这和多任务学习中的 curriculum / loss warm-up 很相似。
---
# 9. 推理与控制过程
默认配置:
k=3
即每次预测 3 个未来时间点。未来帧间隔为:
即每次预测 3 个未来时间点。
未来帧间隔为:
即每次预测 3 个未来时间点。未来帧间隔为:
i=4
可以理解为预测:
可以理解为预测:
可以理解为预测:
t+4,\quad t+8,\quad t+12
附近的状态,而不是每一个连续控制帧。每次推理执行: − 75 步 D D I M 去噪; − 同时恢复未来 3 帧图像和 3 个动作; − 只执行第一个动作; − 获得新观测; − 再进行下一轮预测。形式上:
附近的状态,而不是每一个连续控制帧。
每次推理执行:
- 75 步 DDIM 去噪;
- 同时恢复未来 3 帧图像和 3 个动作;
- 只执行第一个动作;
- 获得新观测;
- 再进行下一轮预测。
形式上:
附近的状态,而不是每一个连续控制帧。每次推理执行: − 75 步 DD I M 去噪; − 同时恢复未来 3 帧图像和 3 个动作; − 只执行第一个动作; − 获得新观测; − 再进行下一轮预测。形式上:
(\hat I_{t+1:t+k},\hat a_{t:t+k-1})
\sim
p_\theta(\cdot\mid I_t,s_t,l)
执行:
执行:
执行:
a_t=\hat a_t
然后:
然后:
然后:
I_{t+1},s_{t+1}
\leftarrow
\operatorname{EnvironmentStep}(a_t)
这是闭环控制,而不是一次生成整条轨迹后完全开环执行。
---
# 10. 实验设计
## 10.1 MetaWorld
- 50 个任务;
- 每个任务 50 条轨迹;
- 统一使用一个语言条件策略;
- 输入 RGB 和机器人状态;
- 不使用深度;
- 所有任务共享同一模型。
这比每个任务单独训练一个 policy 更困难。
### 结果
|方法|50 个任务平均成功率|
|---|--:|
|Diffusion Policy|27.9%|
|RT-1|34.6%|
|SuSIE|41.0%|
|RT-2*|52.2%|
|GR-1|57.4%|
|**PAD**|**72.5%**|
PAD 相比 GR-1 的绝对提升为:
72.5-57.4=15.1
即 ∗ ∗ 15.1 个百分点 ∗ ∗ 。相对提升为:
即 **15.1 个百分点**。
相对提升为:
即 ∗ ∗ 15.1 个百分点 ∗ ∗ 。相对提升为:
\frac{72.5-57.4}{57.4}
\approx26.3%
这就是摘要中的 26.3% relative improvement。
PAD 在 assembly、basketball、peg insert、pick-place-wall 等困难任务上的提升尤其明显,这些任务通常需要精确的物体交互和空间控制。
---
## 10.2 真实 Panda 机械臂
任务包括:
- Button Press;
- Cable Route;
- Pick;
- Place;
- Drawer Open;
- Drawer Close。
每个任务评估 50 次 rollout。
|方法|平均成功率|
|---|--:|
|Diffusion Policy|38%|
|RT-1|43%|
|SuSIE|49%|
|RT-2*|69%|
|PAD|72%|
|**PAD-Depth**|**78%**|
加入深度模态后:
78%-72%=6%
说明额外预测未来深度能够帮助模型理解距离变化和空间接近关系。
---
# 11. 最关键的消融实验
## 11.1 去掉图像预测
|模型|MetaWorld 平均成功率|
|---|--:|
|PAD|72.5%|
|PAD w/o image|43.6%|
下降:
72.5-43.6=28.9
即 ∗ ∗ 28.9 个百分点 ∗ ∗ 。这是论文最重要的证据: > P A D 的提升并不只是因为用了更大的 D i T ;图像预测任务本身对动作策略有明显帮助。不过这个实验仍不能完全证明“准确预测未来”是提升的唯一原因,因为加入图像任务也可能带来: − 更多 t o k e n ; − 更强的视觉表征学习; − 更大的有效模型容量; − 更密集的辅助监督; − 正则化效果。也就是说,实验支持:
即 **28.9 个百分点**。
这是论文最重要的证据:
> PAD 的提升并不只是因为用了更大的 DiT;图像预测任务本身对动作策略有明显帮助。
不过这个实验仍不能完全证明“准确预测未来”是提升的唯一原因,因为加入图像任务也可能带来:
- 更多 token;
- 更强的视觉表征学习;
- 更大的有效模型容量;
- 更密集的辅助监督;
- 正则化效果。
也就是说,实验支持:
即 ∗ ∗ 28.9 个百分点 ∗ ∗ 。这是论文最重要的证据: > P A D 的提升并不只是因为用了更大的 D i T ;图像预测任务本身对动作策略有明显帮助。不过这个实验仍不能完全证明 “ 准确预测未来 ” 是提升的唯一原因,因为加入图像任务也可能带来: − 更多 t o k e n ; − 更强的视觉表征学习; − 更大的有效模型容量; − 更密集的辅助监督; − 正则化效果。也就是说,实验支持:
\text{image prediction auxiliary task is useful}
但还不能严格区分究竟是:
但还不能严格区分究竟是:
但还不能严格区分究竟是:
\text{world dynamics understanding}
还是:
还是:
还是:
\text{representation regularization}
带来了主要收益。
---
## 11.2 去掉视频联合训练
|模型|MetaWorld 平均成功率|
|---|--:|
|PAD|72.5%|
|PAD w/o co-train|59.2%|
下降:
72.5-59.2=13.3
即 ∗ ∗ 13.3 个百分点 ∗ ∗ 。说明未来图像预测本身有用,而预训练视频数据还能进一步提升。结合两个消融:
即 **13.3 个百分点**。
说明未来图像预测本身有用,而预训练视频数据还能进一步提升。
结合两个消融:
即 ∗ ∗ 13.3 个百分点 ∗ ∗ 。说明未来图像预测本身有用,而预训练视频数据还能进一步提升。结合两个消融:
\begin{aligned}
\text{no image prediction}&:43.6%\
\text{image prediction without video pretraining}&:59.2%\
\text{image prediction with video pretraining}&:72.5%
\end{aligned}
可以粗略理解为:
1. 联合预测结构带来第一部分提升;
2. 视频预训练带来第二部分提升。
但这不是严格可加的因果分解。
---
# 12. Scaling 实验
论文测试了不同 DiT 尺寸和 patch size:
|模型|参数量|Token 数|GFLOPs|成功率|
|---|--:|--:|--:|--:|
|PAD-XL/8|661M|17|7.7|48.2%|
|PAD-B/2|128M|257|22.5|62.4%|
|PAD-XL/4|661M|65|29.5|64.5%|
|PAD-L/2|449M|257|79.1|68.4%|
|PAD-XL/2|661M|257|119.1|72.5%|
作者观察到成功率与 Transformer GFLOPs 有较强正相关。
但更值得注意的是:
### 参数量并不是唯一因素
PAD-XL/8 和 PAD-XL/2 参数量都是 661M,但成功率分别为:
48.2%\quad\text{vs.}\quad72.5%
差距达到:
差距达到:
差距达到:
24.3
个百分点。区别主要在视觉 t o k e n 数:
个百分点。
区别主要在视觉 token 数:
个百分点。区别主要在视觉 t o k e n 数:
17\quad\text{vs.}\quad257
这说明机器人精细控制非常依赖空间 token 分辨率。
较大的 patch 会把小物体、接触点和机械臂末端位置压缩掉。对于 peg insertion、grasping 等任务,空间细节甚至可能比参数规模更加重要。
---
# 13. PAD 与 GR-1 的区别
|维度|GR-1|PAD|
|---|---|---|
|生成方式|自回归|扩散去噪|
|图像与动作|按序列 autoregressive 预测|同时联合去噪|
|图像表示|VQGAN 离散 token|VAE 连续 latent|
|动作输出|自回归 action token|action diffusion|
|多模态融合|Transformer 序列建模|DiT token 拼接与 self-attention|
|不确定性|token 条件分布|从噪声采样形成多模态分布|
|推理速度|相对直接|需要多步 DDIM|
|主要优势|统一序列建模|高质量图像生成、联合扩散|
|主要问题|自回归误差累积|去噪速度慢|
PAD 作者认为其图像预测比 GR-1 更精确,尤其在小物体抓取、插入等任务上更有帮助。
从方法本质上说:
- GR-1 把图像和动作当作一种“多模态语言序列”;
- PAD 把图像和动作当作一个“联合生成分布”。
即:
\text{GR-1: }
p(x,a)=\prod_i p(y_i\mid y_{<i})
而 P A D 更接近:
而 PAD 更接近:
而 P A D 更接近:
\text{PAD: }
(x,a)\sim p_\theta(x,a\mid c,l)
通过 score-based denoising 对联合分布采样。
---
# 14. PAD 是不是 World Action Model?
可以把 PAD 看成 **World Action Model 的早期或局部形式**。
它具备:
- 预测未来视觉状态;
- 预测动作;
- 图像和动作共享 latent dynamics;
- 可利用无动作视频;
- 以未来预测帮助策略学习。
但它还缺少现代 WAM 常强调的部分:
1. 没有显式长时 horizon rollout;
2. 没有在预测世界中搜索多个 action proposal;
3. 没有 value、reward 或 verifier;
4. 没有失败检测与回退;
5. 没有 persistent memory;
6. 没有显式因果动力学建模;
7. 未来预测主要作为辅助训练目标,而非测试时显式规划环境。
所以更准确地说:
> PAD 是一个 **joint world prediction–action policy**,而不是完整的 model-based planning agent。
---
# 15. 论文的主要局限
## 15.1 控制频率低
推理需要 75 步 DDIM,并且同时生成高维图像与低维动作。
作者也明确承认,PAD 的控制频率不高,未来可以只利用预测图像的中间 latent,而不是完整生成像素图像。
这是非常关键的限制。
对于真实时间控制,真正需要的是:
a_t
不一定需要完整解码:
不一定需要完整解码:
不一定需要完整解码:
\hat I_{t+1}
因此更高效的方案是:
因此更高效的方案是:
因此更高效的方案是:
\text{latent world prediction}
\rightarrow
\text{action head}
而不是:
而不是:
而不是:
\text{pixel generation}
+
\text{action generation}
---
## 15.2 “预测准确”与“动作成功”的因果关系不足
论文展示了:
- PAD 图像比 GR-1 看起来更清晰;
- PAD 动作成功率更高。
但没有进行严格实验验证:
\text{image prediction quality}
\rightarrow
\text{action success}
例如可以补充:
- 每个 episode 的 LPIPS/FVD 与成功率相关性;
- 人为破坏未来图像 latent,看动作是否下降;
- 屏蔽部分未来 image token;
- 对 image latent 做 causal intervention;
- 保持模型计算量一致,仅改变预测目标;
- 分析哪些视觉 token 对 action token 的影响最大。
所以论文更多给出了相关性证据,而非严格因果证据。
---
## 15.3 视频预训练规模与多样性有限
主要使用 BridgeData-v2,仍属于机器人操作领域。
因此 PAD 尚未充分验证:
- 自然人类视频;
- egocentric 视频;
- 大规模通用互联网视频;
- 跨机器人 embodiment;
- 跨摄像头视角;
能否可靠迁移到机器人控制。
---
## 15.4 未来预测 horizon 较短
默认只有:
k=3
且主要用于局部闭环控制。
它比较擅长:
- “下一小段时间怎么动”;
- “操作后场景会怎样”。
但不一定能解决:
- 长程任务;
- 多阶段规划;
- 中间失败恢复;
- 需要记忆的操作;
- 长时因果依赖。
---
# 16. 与你的 latent causal memory 方向有什么关系?
这篇论文对你的想法很有价值,因为它提供了一个非常自然的研究问题:
> PAD 说未来图像 latent 帮助动作,但到底是哪些 latent、哪些时间步、哪些物体和哪些预测变化在帮助动作?
PAD 当前只通过联合 self-attention 隐式融合:
T_I\leftrightarrow T_A
但没有解释:
但没有解释:
但没有解释:
T_I^{(j)}
\rightarrow
a_t
哪些图像 token 对动作预测具有因果作用。
你可以沿着下面的方向扩展。
## 16.1 Latent causal attribution
对图像 latent token $z_j$ 做 intervention:
z_j\leftarrow0
或替换成反事实 l a t e n t :
或替换成反事实 latent:
或替换成反事实 l a t e n t :
z_j\leftarrow z_j’
观察动作变化:
观察动作变化:
观察动作变化:
\Delta a=
\left|
a(z)-a(z_{-j})
\right|
由此构建:
由此构建:
由此构建:
\operatorname{CausalImportance}(z_j\rightarrow a)
并将重要 token 映射回:
- 关键物体;
- 接触区域;
- 机械臂末端;
- 目标位置;
- 关键未来帧。
---
## 16.2 Causal frame selection
PAD 固定预测三个未来帧,但不同任务真正关键的预测时刻可能不同:
- 抓取:接触前的帧关键;
- 放置:释放前后的帧关键;
- 开抽屉:把手接触和拉开后的帧关键。
可以学习:
m_t=\operatorname{Select}
\left(
z_{t+1:t+k}
\right)
只保留对动作有因果贡献的未来 l a t e n t :
只保留对动作有因果贡献的未来 latent:
只保留对动作有因果贡献的未来 l a t e n t :
a_t=
\pi
\left(
o_t,
m_t
\right)
这能同时解决:
- 可解释性;
- 控制速度;
- 冗余预测;
- latent memory 存储成本。
---
## 16.3 Latent memory
PAD 每一步重新生成未来,并没有保存之前学到的关键动力学经验。
可以维护:
\mathcal M=
{(z_{\text{context}},z_{\text{causal}},a,r)}
测试时根据当前 o b s e r v a t i o n 检索:
测试时根据当前 observation 检索:
测试时根据当前 o b ser v a t i o n 检索:
m_t=\operatorname{Retrieve}(\mathcal M,o_t,l)
再用于联合预测:
再用于联合预测:
再用于联合预测:
p(x_I,x_A\mid c_I,c_A,l,m_t)
这就从 PAD 的短时联合预测,进一步走向:
> **具有因果记忆的 World Action Model。**
---
# 17. 对论文的总体评价
## 主要贡献
1. 用一个 DiT 统一预测未来图像和机器人动作;
2. 将图像生成 diffusion 与 Diffusion Policy 真正放进同一个去噪过程;
3. 支持 action 缺失的视频数据;
4. 支持 RGB、动作、深度等异构模态;
5. 在 MetaWorld 50-task 单策略设置上显著超过 GR-1;
6. 实验证明图像预测和视频预训练都具有明显作用。
## 最核心的新意
并不是“用未来图像帮助机器人”,因为 GR-1、UniPi、SuSIE 已经做过。
真正的新意是:
# $$
\boxed{
\text{future prediction}
+
\text{action generation}
\text{one joint diffusion process}
}
最值得质疑的地方
论文把性能提升解释为“学习到了物理知识”,但目前实验更直接证明的是:
joint high-dimensional auxiliary prediction + video pretraining → better imitation policy \text{joint high-dimensional auxiliary prediction}
+
\text{video pretraining}
\rightarrow
\text{better imitation policy} joint high-dimensional auxiliary prediction + video pretraining → better imitation policy
至于模型是否真正学到了可组合、可迁移、可用于规划的物理规律,证据仍然不足。
18. 最终总结
PAD 的整体计算链可以浓缩为:
( c I , c A , c E , l ) → encoding ( T I , T A , T E , T l ) (c_I,c_A,c_E,l)
\xrightarrow{\text{encoding}}
(T_I,T_A,T_E,T_l) ( c I , c A , c E , l ) encoding ( T I , T A , T E , T l )
将未来目标加噪:
( x I , x A , x E ) → ( z t I , z t A , z t E ) (x_I,x_A,x_E)
\rightarrow
(z_t^I,z_t^A,z_t^E) ( x I , x A , x E ) → ( z t I , z t A , z t E )
输入统一 DiT:
[ T I ; T A ; T E ] → joint denoising [ ϵ ^ I ; ϵ ^ A ; ϵ ^ E ] [T_I;T_A;T_E]
\xrightarrow{\text{joint denoising}}
[\hat\epsilon_I;\hat\epsilon_A;\hat\epsilon_E] [ T I ; T A ; T E ] joint denoising [ ϵ ^ I ; ϵ ^ A ; ϵ ^ E ]
联合优化:
$$
\mathcal L
\lambda_I\mathcal L_I
+
\lambda_A\mathcal L_A
+
\lambda_E\mathcal L_E
推理时:
推理时:
推理时:
(\hat x_I^{1:k},\hat x_A^{1:k})
\sim
p_\theta(\cdot\mid c_I,c_A,l)
只执行:
只执行:
只执行:
\hat x_A^1
然后重新观测并滚动规划。 ∗ ∗ 你阅读这篇论文时最应该记住的一句话是: ∗ ∗ > P A D 不把未来图像仅仅当作动作策略的目标,而是把“未来会发生什么”和“机器人应该怎么做”建模成同一个联合生成问题。
然后重新观测并滚动规划。
**你阅读这篇论文时最应该记住的一句话是:**
> PAD 不把未来图像仅仅当作动作策略的目标,而是把“未来会发生什么”和“机器人应该怎么做”建模成同一个联合生成问题。 然后重新观测并滚动规划。 ∗ ∗ 你阅读这篇论文时最应该记住的一句话是: ∗ ∗ > P A D 不把未来图像仅仅当作动作策略的目标,而是把 “ 未来会发生什么 ” 和 “ 机器人应该怎么做 ” 建模成同一个联合生成问题。