Skip to content
Go back

Learning Universal Policies via Text-Guided Video Generation

Edit page

论文定位

Learning Universal Policies via Text-Guided Video Generation,NeurIPS 2023,提出 UniPi(Universal Policy)。论文最核心的想法可以概括为:

不让策略直接预测机器人动作,而是先根据当前图像和语言指令,生成一段“任务应该如何完成”的未来视频,再从视频中反推出机器人动作。

也就是把:

状态+指令动作\text{状态}+\text{指令}\rightarrow \text{动作}

改写为:

当前图像+文本指令未来视频计划机器人动作\text{当前图像}+\text{文本指令} \rightarrow \text{未来视频计划} \rightarrow \text{机器人动作}

论文希望借助图像和语言跨任务、跨环境共享的表示空间,绕开不同机器人、不同环境具有不同状态空间和动作空间的问题。


一、先抓住整篇论文的主线

1. 论文认为传统策略有什么问题?

传统机器人策略一般写作:

π(atst,c)\pi(a_t\mid s_t,c)

其中:

问题是,不同环境的状态和动作完全不一样:

因此,一个在某种机器人上训练的动作策略,很难直接迁移到另一种机器人。

作者的关键观察是:

所以作者把:

论文把这一思想称为 policy-as-video。Figure 1 展示了语言组合泛化、多任务规划以及互联网视频知识迁移三个主要应用。


2. UniPi 的两层解耦

UniPi 可以拆成两部分:

通用视频规划器

ρ(x1:Hx0,c)\rho(x_{1:H}\mid x_0,c)

输入:

输出:

机器人专用动作解码器

π(a0:H1x0:H,c)\pi(a_{0:H-1}\mid x_{0:H},c)

它读取生成的视频轨迹,再预测实际机器人动作。

因此,作者希望做到:

语言+视频规划器跨环境共享+逆动力学模型适配具体机器人\underbrace{\text{语言+视频规划器}}_{\text{跨环境共享}} + \underbrace{\text{逆动力学模型}}_{\text{适配具体机器人}}

Figure 2 很清楚地表现了这套结构:输入图像被沿时间维复制,视频扩散模型先生成稀疏计划,时间超分辨率模块补充中间帧,最后通过 inverse dynamics 得到机器人控制信号。

这是理解整篇论文最重要的一张图。


二、UPDP:作者为什么要重新定义决策过程?

作者提出了一个替代 MDP 的概念:

Unified Predictive Decision Process

定义为:

G=X,C,H,ρG=\langle \mathcal X,\mathcal C,H,\rho\rangle

其中:

视频生成器输出:

ρ(x0,c)Δ(XH)\rho(\cdot\mid x_0,c)\in\Delta(\mathcal X^H)

即在给定当前图像和任务指令后,生成未来 (H) 帧图像的概率分布。

与 MDP 的区别

传统 MDP 显式包含:

S,A,T,R,γ\langle S,A,T,R,\gamma\rangle

需要定义:

UPDP 则试图直接学习:

当前画面完成任务的未来轨迹\text{当前画面} \rightarrow \text{完成任务的未来轨迹}

作者认为这样可以:

  1. 不显式设计 reward;

  2. 不要求不同环境共享动作空间;

  3. 允许使用没有动作标签的互联网视频;

  4. 直接在人类可理解的视频空间中规划。

这里要批判性理解

UPDP 并没有真正消除“奖励”或“最优性”。

它只是把奖励隐藏进了训练数据:

所以更准确地说:

UniPi 避免了在模型训练和推理中显式输入 reward,但仍然依赖带有成功偏好的示范数据。

从学习范式上看,它更接近语言条件的轨迹生成与模仿学习,而不是取代了整个 MDP/RL 框架。


三、视频扩散模型具体在学什么?

令未来视频为:

τ=x1,x2,,xH\tau=x_1,x_2,\ldots,x_H

模型希望学习:

p(τx0,c)p(\tau\mid x_0,c)

1. 前向加噪

扩散模型把完整视频轨迹逐渐加噪:

$$

q_k(\tau_k\mid\tau)

\mathcal N(\alpha_k\tau,\sigma_k^2I)

其中 $k\in0,1$ 表示噪声水平。 当 (k) 很大时,视频接近高斯噪声;当 (k) 较小时,视频接近原始轨迹。 ## 2. 条件去噪 训练一个条件去噪器:

s(\tau_k,k\mid c,x_0)

它根据: - 当前带噪视频; - 文本任务; - 第一帧图像; 逐渐恢复未来视频。 作者使用 classifier-free guidance: # $$ \hat s(\tau_k,k\mid c,x_0) (1+\omega)s(\tau_k,k\mid c,x_0) -\omega s(\tau_k,k)

其中 (\omega) 控制语言和第一帧条件的强度。

直观上:


四、UniPi 的三个关键设计

普通 text-to-video 模型并不能直接拿来做机器人规划。

因为普通视频生成只要求“看起来合理”,而机器人规划还要求:

UniPi 因此增加了三个关键模块。


1. First-frame conditioning

模型不仅输入文字,还显式输入当前观察 (x_0)。

作者发现,仅在扩散采样时把第一帧强行固定成当前图像效果不好,后续帧仍然会迅速偏离真实场景。因此,他们在训练阶段就让模型始终条件于第一帧。

这一步解决的是:

视频计划究竟从哪个真实世界状态出发?


2. Tiling:沿时间复制当前帧

作者把 (x_0) 沿时间维度复制:

$$x_0,x_0,\ldots,x_0$$

然后在每一个未来帧的去噪过程中,都将对应的 (x_0) 与带噪帧进行通道拼接。

直觉上相当于不停提醒生成器:

当前桌面长这样,物体原本在这些位置,不要生成另一张桌子,也不要让背景漂移。

这一设计被称为 trajectory consistency through tiling

不过需要注意:它更多保障的是视觉场景一致性,并不保证:


3. Temporal hierarchy:时间上的粗到细规划

UniPi 不是一次生成所有高帧率视频,而是两阶段:

粗粒度规划

先生成稀疏关键帧:

x0,x4,x8,x_0,x_4,x_8,\ldots

这些帧主要表达:

时间超分辨率

再在关键帧之间插入中间过程:

x0,x1,x2,x3,x4,x_0,x_1,x_2,x_3,x_4,\ldots

这样将:

自然地分层。

作者认为,相比直接生成完整长视频,这可以降低长时域规划难度,同时提高相邻帧一致性。

这里已经很接近后来 World Action Model 中常见的:

高层未来状态规划 + 低层动作实现。


五、视频如何转成动作?

生成视频以后,UniPi 训练一个小型 inverse dynamics model,把图像轨迹映射成机器人控制信号。

模拟机械臂的动作是 7 维控制量。逆动力学模型由卷积层、残差卷积、空间平均池化和 MLP 构成,使用均方误差训练。

重要的是,视频模型和 inverse dynamics 可以使用不同数据训练:

这正是 UniPi 声称能够跨机器人迁移的基础。

但所谓 “universal” 主要体现在视频规划层。换一种机器人以后,仍然通常需要:

因此它不是一个完全无需适配的通用策略。


六、执行时会不会根据失败重新规划?

论文描述了两种可能的执行方式:

Closed-loop / MPC

每执行一步,就重新观察环境,重新生成后续计划。

Open-loop

一次生成完整动作序列,然后全部执行。

作者明确说明,为了计算效率,论文实验全部使用 open-loop control

所以在这篇论文的实验里:

虽然框架理论上支持 MPC,但论文没有真正验证闭环重规划效果。

这也是 UniPi 与较新的 World Action Model 系统之间非常关键的差距。


七、实验一:组合泛化

实验设置

任务包括:

训练和测试按语言组合拆分:

每次环境中的方块、碗和托盘位置都会随机变化,训练数据为 scripted agent 生成的 20 万段视频。

例如训练可能看到:

测试要求:

模型需要组合语言中的:


结果

方法Seen PlaceSeen RelationNovel PlaceNovel Relation
State + Transformer BC19.48.211.93.7
Image + Transformer BC9.411.99.77.3
Image + TT17.412.813.29.1
Diffuser9.011.212.59.6
UniPi59.153.260.146.1

UniPi 在训练中未见的 Place 和 Relation 组合上仍然明显优于基线。生成结果也展示了模型可以根据新语言组合规划不同的抓取、染色和放置流程。

作者想通过这个实验说明什么?

直接预测动作的模型容易学成:

整句指令动作模板\text{整句指令}\rightarrow\text{动作模板}

而视频生成模型可能更容易把任务拆成:

因此语言组合能够在视觉轨迹空间中重新组合。

但结果也可能受模型规模影响,后面会讨论。


八、消融实验:真正重要的模块是什么?

First frameTiling consistencyTemporal hierarchyPlaceRelation
13.212.4
52.434.7
53.239.4
59.153.2

可以读出三个结论:

第一帧条件贡献最大

Place 从 13.2 提升到 52.4,说明机器人视频规划不能只靠文本,必须紧密锚定当前视觉状态。

Tiling 对复杂空间关系更重要

Relation 从 34.7 提升到 39.4。因为空间关系任务要求持续记住多个物体的位置。

时间层级尤其有利于复杂操作

Relation 从 39.4 提升到 53.2,增幅很大。说明关键帧规划再补充中间运动,对长流程任务很重要。

这个消融比较有说服力地证明了 UniPi 的工程设计确实有作用。


九、测试时引导:为什么说视频规划可编辑?

扩散模型的一个优势是可以在采样过程中加入额外约束。

作者举例:原始指令可能只要求把某个方块放到另一个方块附近,但测试时可以提供一个中间目标图像,引导机械臂先移动指定的方块。

可以理解为在采样分布中加入额外 prior:

p(τx0,c)p(τx0,c)h(τ)p(\tau\mid x_0,c) \quad\longrightarrow\quad p(\tau\mid x_0,c)h(\tau)

其中 (h(\tau)) 表示:

Figure 7 展示了通过插入 intermediate guidance 改变生成计划。

这也是扩散规划相对于直接行为克隆的一个优势:可以在测试阶段修改整条轨迹分布,而不一定要重新训练策略。


十、实验二:多任务迁移

作者使用 10 个机器人操作任务训练,并在 3 个新任务上测试,训练集同样包括 20 万段 scripted 视频。

测试任务包括:

结果为:

方法Place BowlPack ObjectPack Pair
State + Transformer BC9.821.71.3
Image + Transformer BC5.35.77.8
Image + TT4.919.82.3
Diffuser14.815.910.5
UniPi51.675.545.7

这里最重要的并不只是高分,而是模型能够生成带有明显多步骤结构的计划,例如:

  1. 找到多个目标物体;

  2. 分别抓取;

  3. 移动到容器;

  4. 逐个放入。

这说明生成完整未来轨迹,比只预测下一步动作更容易表达长时任务结构。


十一、实验三:互联网预训练与真实机器人视频

数据

作者先在大规模通用数据上预训练:

之后在 Bridge 机器人数据集的 7200 个 video-text pairs 上微调。

结果:

模型CLIP ↑FID ↓FVD ↓Success ↑
无预训练24.4317.75288.0272.6%
互联网预训练24.5414.54264.6677.1%

顺便指出论文正文有一个小措辞错误:它说预训练取得 “higher FID and FVD”,但 FID/FVD 是越低越好,表中也是预训练后数值更低。

这个实验不能过度解读

这里的 Success 并不是实际机械臂执行成功率。

作者训练了一个分类器,读取生成视频的最后一帧,判断视频中任务是否看起来成功。因此 72.6% 和 77.1% 是生成视频的代理成功指标,不是机器人在真实世界完成任务的成功率。

所以论文对真实世界部分真正证明的是:

互联网视频预训练可以改善机器人场景中的视频计划生成。

它没有充分证明:

互联网视频预训练可以让真实机器人稳定完成这些任务。

这两个结论差别很大。


十二、这篇论文最值得质疑的地方

1. 模型规模与 baseline 严重不对等

UniPi 的模拟视频扩散模型规模约为:

训练使用:

相比之下,Transformer BC baseline 使用的是约 10M 级 Transformer 架构。

因此 Table 1 和 Table 3 的巨大提升,不能全部归因于:

“生成视频比直接生成动作更好。”

其中可能也有相当一部分来自:

一个更严格的对比应该包括:


2. 视觉合理不等于物理可执行

视频生成模型可以生成看起来合理的画面,但可能出现:

Inverse dynamics 只能尝试解释生成视频,无法保证视频本身属于真实机器人的可实现轨迹。

这反映了一个核心问题:

visual plausibilityphysical feasibility\text{visual plausibility} \neq \text{physical feasibility}

3. 论文采用 open-loop

生成错误无法在线纠正。

尤其是长时任务里:

因此真正实用的版本应该采用:

observegenerate short videoexecute few actionsobserve again\text{observe} \rightarrow \text{generate short video} \rightarrow \text{execute few actions} \rightarrow \text{observe again}

也就是 receding-horizon video planning。


4. “Universal” 有一定宣传成分

视频规划器确实可以共享,但动作接口仍然是 embodiment-specific。

换机器人后需要重新建立:

视频变化新机器人的动作\text{视频变化}\rightarrow\text{新机器人的动作}

所以它更准确的名字可能是:

Universal visual planner with embodiment-specific control adapters。


5. 视频生成速度太慢

作者指出,高质量视频可能需要约一分钟生成。通过 diffusion distillation,初步实验可以加速约 16 倍。

这在真实闭环控制中尤其严重,因为 MPC 要不断重新生成计划。


十三、它和 World Model / World Action Model 的关系

这篇论文很容易被误认为普通 world model,但二者并不完全相同。

传统 action-conditioned world model

学习:

p(xt+1xt,at)p(x_{t+1}\mid x_t,a_t)

它回答:

在状态 (x_t) 执行动作 (a_t),接下来会发生什么?

UniPi

学习:

p(x1:Hx0,c)p(x_{1:H}\mid x_0,c)

它回答:

从当前状态出发,为了完成语言目标,未来应该呈现什么轨迹?

因此 UniPi 不是纯粹的环境动力学模型,而是一个:

目标条件的、隐式包含策略偏好的未来轨迹生成器。

训练数据都是任务执行轨迹,因此生成模型同时混合了:

作者自己也把它描述为某种“联合学习 world model 与 hierarchical planning”的方法。


十四、对你做 WAM / latent causal memory 最有价值的启发

UniPi 可以被看作一种早期的视觉式 World Action Model,但它留下了四个明显空缺。

1. 缺少因果归因

UniPi 能生成一段成功视频,却不知道:

你设想的 latent causal memory 可以把轨迹压缩为:

关键状态,关键动作,因果边,结果{\text{关键状态},\text{关键动作},\text{因果边},\text{结果}}

而不是存储或生成所有帧。

2. 缺少显式失败建模

UniPi 主要学习成功示范,没有显式比较:

τ+vs.τ\tau^+ \quad \text{vs.}\quad \tau^-

所以它缺乏“为什么这个计划会失败”的知识。

可以加入:

3. 缺少计划验证器

视频生成后直接交给 inverse dynamics,没有独立模块检查:

现代化版本可以加入:

GeneratorVerifierController\text{Generator} \rightarrow \text{Verifier} \rightarrow \text{Controller}

4. 缺少闭环记忆和修正

UniPi 每个 episode 基本是一次性生成,并没有利用之前失败的执行经验修正后续计划。

可以增加:

执行偏差因果归因写入 latent memory下一次规划检索\text{执行偏差} \rightarrow \text{因果归因} \rightarrow \text{写入 latent memory} \rightarrow \text{下一次规划检索}

这与你的 self-evolving agent / memory 方向非常契合。


十五、最后用一句话真正读懂这篇论文

UniPi 的本质不是“用视频预测动作”,而是把视频轨迹当作机器人之间共享的中间规划语言:大模型负责想象任务完成过程,小型 inverse dynamics 负责把这种想象翻译成具体机器人的动作。

它最大的贡献是提出了一个非常有前瞻性的接口:

LanguageVisual FutureAction\text{Language} \rightarrow \text{Visual Future} \rightarrow \text{Action}

它最大的不足则是:

生成出来的视觉未来⇏真实、可执行、可闭环修正的物理未来\text{生成出来的视觉未来} \not\Rightarrow \text{真实、可执行、可闭环修正的物理未来}

因此,从今天的 WAM 视角看,这篇论文最值得继承的是 video-as-plan 的统一表示;最需要补上的则是 动作条件、物理约束、因果归因、不确定性估计与闭环修正


Edit page
Share this post on:

Previous Post
GR-1
Next Post
Motus - A Unified Latent Action World Model