论文定位
Learning Universal Policies via Text-Guided Video Generation,NeurIPS 2023,提出 UniPi(Universal Policy)。论文最核心的想法可以概括为:
不让策略直接预测机器人动作,而是先根据当前图像和语言指令,生成一段“任务应该如何完成”的未来视频,再从视频中反推出机器人动作。
也就是把:
改写为:
论文希望借助图像和语言跨任务、跨环境共享的表示空间,绕开不同机器人、不同环境具有不同状态空间和动作空间的问题。
一、先抓住整篇论文的主线
1. 论文认为传统策略有什么问题?
传统机器人策略一般写作:
其中:
-
(s_t):当前状态;
-
(c):任务指令;
-
(a_t):机器人动作。
问题是,不同环境的状态和动作完全不一样:
-
Atari 是离散按键;
-
MuJoCo 是连续关节控制;
-
不同机器人机械臂的自由度也不同。
因此,一个在某种机器人上训练的动作策略,很难直接迁移到另一种机器人。
作者的关键观察是:
-
不同机器人虽然动作空间不同;
-
但它们都可以通过视频表达“接下来应该发生什么”;
-
各种任务也都可以通过自然语言表达。
所以作者把:
-
文本作为通用任务接口;
-
视频作为通用规划空间;
-
逆动力学模型作为机器人相关的动作接口。
论文把这一思想称为 policy-as-video。Figure 1 展示了语言组合泛化、多任务规划以及互联网视频知识迁移三个主要应用。
2. UniPi 的两层解耦
UniPi 可以拆成两部分:
通用视频规划器
输入:
-
当前观察图像 (x_0);
-
文本任务 (c)。
输出:
- 从 (x_1) 到 (x_H) 的未来视频轨迹。
机器人专用动作解码器
它读取生成的视频轨迹,再预测实际机器人动作。
因此,作者希望做到:
Figure 2 很清楚地表现了这套结构:输入图像被沿时间维复制,视频扩散模型先生成稀疏计划,时间超分辨率模块补充中间帧,最后通过 inverse dynamics 得到机器人控制信号。
这是理解整篇论文最重要的一张图。
二、UPDP:作者为什么要重新定义决策过程?
作者提出了一个替代 MDP 的概念:
Unified Predictive Decision Process
定义为:
其中:
-
(\mathcal X):图像观察空间;
-
(\mathcal C):文本任务空间;
-
(H):规划长度;
-
(\rho(\cdot\mid x_0,c)):条件视频生成器。
视频生成器输出:
即在给定当前图像和任务指令后,生成未来 (H) 帧图像的概率分布。
与 MDP 的区别
传统 MDP 显式包含:
需要定义:
-
状态;
-
动作;
-
环境转移;
-
奖励函数。
UPDP 则试图直接学习:
作者认为这样可以:
-
不显式设计 reward;
-
不要求不同环境共享动作空间;
-
允许使用没有动作标签的互联网视频;
-
直接在人类可理解的视频空间中规划。
这里要批判性理解
UPDP 并没有真正消除“奖励”或“最优性”。
它只是把奖励隐藏进了训练数据:
-
模拟环境中的视频由 scripted oracle 生成;
-
视频本身已经展示了如何成功完成任务;
-
模型通过模仿成功轨迹来学习。
所以更准确地说:
UniPi 避免了在模型训练和推理中显式输入 reward,但仍然依赖带有成功偏好的示范数据。
从学习范式上看,它更接近语言条件的轨迹生成与模仿学习,而不是取代了整个 MDP/RL 框架。
三、视频扩散模型具体在学什么?
令未来视频为:
模型希望学习:
1. 前向加噪
扩散模型把完整视频轨迹逐渐加噪:
$$
q_k(\tau_k\mid\tau)
\mathcal N(\alpha_k\tau,\sigma_k^2I)
其中 $k\in0,1$ 表示噪声水平。 当 (k) 很大时,视频接近高斯噪声;当 (k) 较小时,视频接近原始轨迹。 ## 2. 条件去噪 训练一个条件去噪器:s(\tau_k,k\mid c,x_0)
它根据: - 当前带噪视频; - 文本任务; - 第一帧图像; 逐渐恢复未来视频。 作者使用 classifier-free guidance: # $$ \hat s(\tau_k,k\mid c,x_0) (1+\omega)s(\tau_k,k\mid c,x_0) -\omega s(\tau_k,k)其中 (\omega) 控制语言和第一帧条件的强度。
直观上:
-
条件模型告诉模型“生成符合任务的视频”;
-
无条件模型描述一般视频分布;
-
二者做差,可以强化文本和当前场景的影响。
四、UniPi 的三个关键设计
普通 text-to-video 模型并不能直接拿来做机器人规划。
因为普通视频生成只要求“看起来合理”,而机器人规划还要求:
-
必须从真实当前状态开始;
-
场景和物体不能凭空变化;
-
相邻帧必须能对应可执行动作;
-
长时间规划不能丢失目标。
UniPi 因此增加了三个关键模块。
1. First-frame conditioning
模型不仅输入文字,还显式输入当前观察 (x_0)。
作者发现,仅在扩散采样时把第一帧强行固定成当前图像效果不好,后续帧仍然会迅速偏离真实场景。因此,他们在训练阶段就让模型始终条件于第一帧。
这一步解决的是:
视频计划究竟从哪个真实世界状态出发?
2. Tiling:沿时间复制当前帧
作者把 (x_0) 沿时间维度复制:
$$x_0,x_0,\ldots,x_0$$然后在每一个未来帧的去噪过程中,都将对应的 (x_0) 与带噪帧进行通道拼接。
直觉上相当于不停提醒生成器:
当前桌面长这样,物体原本在这些位置,不要生成另一张桌子,也不要让背景漂移。
这一设计被称为 trajectory consistency through tiling。
不过需要注意:它更多保障的是视觉场景一致性,并不保证:
-
物体严格满足物理规律;
-
机械臂运动一定可达;
-
生成的接触关系一定真实;
-
视频一定能被某个机器人执行。
3. Temporal hierarchy:时间上的粗到细规划
UniPi 不是一次生成所有高帧率视频,而是两阶段:
粗粒度规划
先生成稀疏关键帧:
这些帧主要表达:
-
机器人先移动到哪里;
-
抓住哪个物体;
-
最终把物体放到哪里。
时间超分辨率
再在关键帧之间插入中间过程:
这样将:
-
高层任务规划;
-
局部动作细化;
自然地分层。
作者认为,相比直接生成完整长视频,这可以降低长时域规划难度,同时提高相邻帧一致性。
这里已经很接近后来 World Action Model 中常见的:
高层未来状态规划 + 低层动作实现。
五、视频如何转成动作?
生成视频以后,UniPi 训练一个小型 inverse dynamics model,把图像轨迹映射成机器人控制信号。
模拟机械臂的动作是 7 维控制量。逆动力学模型由卷积层、残差卷积、空间平均池化和 MLP 构成,使用均方误差训练。
重要的是,视频模型和 inverse dynamics 可以使用不同数据训练:
-
视频规划器可以用大量视频;
-
inverse dynamics 只需要少量具体机器人的带动作轨迹。
这正是 UniPi 声称能够跨机器人迁移的基础。
但所谓 “universal” 主要体现在视频规划层。换一种机器人以后,仍然通常需要:
-
收集新机器人的动作数据;
-
重新训练或适配 inverse dynamics;
-
保证生成视频中的运动符合新机器人的可达性。
因此它不是一个完全无需适配的通用策略。
六、执行时会不会根据失败重新规划?
论文描述了两种可能的执行方式:
Closed-loop / MPC
每执行一步,就重新观察环境,重新生成后续计划。
Open-loop
一次生成完整动作序列,然后全部执行。
作者明确说明,为了计算效率,论文实验全部使用 open-loop control。
所以在这篇论文的实验里:
-
不会检测某一步是否失败;
-
不会主动回滚;
-
不会根据新观察重新生成计划;
-
视频计划一旦有误,动作误差可能持续积累。
虽然框架理论上支持 MPC,但论文没有真正验证闭环重规划效果。
这也是 UniPi 与较新的 World Action Model 系统之间非常关键的差距。
七、实验一:组合泛化
实验设置
任务包括:
-
把某种颜色的方块放进某个容器;
-
把某个方块放到另一个方块左边、右边或上面。
训练和测试按语言组合拆分:
-
70% 指令组合用于训练;
-
30% 组合只在测试出现。
每次环境中的方块、碗和托盘位置都会随机变化,训练数据为 scripted agent 生成的 20 万段视频。
例如训练可能看到:
-
red block in brown bowl;
-
yellow block in blue bowl;
测试要求:
- yellow block in brown bowl。
模型需要组合语言中的:
-
物体;
-
颜色;
-
容器;
-
空间关系。
结果
| 方法 | Seen Place | Seen Relation | Novel Place | Novel Relation |
|---|---|---|---|---|
| State + Transformer BC | 19.4 | 8.2 | 11.9 | 3.7 |
| Image + Transformer BC | 9.4 | 11.9 | 9.7 | 7.3 |
| Image + TT | 17.4 | 12.8 | 13.2 | 9.1 |
| Diffuser | 9.0 | 11.2 | 12.5 | 9.6 |
| UniPi | 59.1 | 53.2 | 60.1 | 46.1 |
UniPi 在训练中未见的 Place 和 Relation 组合上仍然明显优于基线。生成结果也展示了模型可以根据新语言组合规划不同的抓取、染色和放置流程。
作者想通过这个实验说明什么?
直接预测动作的模型容易学成:
而视频生成模型可能更容易把任务拆成:
-
哪个对象;
-
发生什么视觉变化;
-
最终空间关系是什么。
因此语言组合能够在视觉轨迹空间中重新组合。
但结果也可能受模型规模影响,后面会讨论。
八、消融实验:真正重要的模块是什么?
| First frame | Tiling consistency | Temporal hierarchy | Place | Relation |
|---|---|---|---|---|
| 否 | 否 | 否 | 13.2 | 12.4 |
| 是 | 否 | 否 | 52.4 | 34.7 |
| 是 | 是 | 否 | 53.2 | 39.4 |
| 是 | 是 | 是 | 59.1 | 53.2 |
可以读出三个结论:
第一帧条件贡献最大
Place 从 13.2 提升到 52.4,说明机器人视频规划不能只靠文本,必须紧密锚定当前视觉状态。
Tiling 对复杂空间关系更重要
Relation 从 34.7 提升到 39.4。因为空间关系任务要求持续记住多个物体的位置。
时间层级尤其有利于复杂操作
Relation 从 39.4 提升到 53.2,增幅很大。说明关键帧规划再补充中间运动,对长流程任务很重要。
这个消融比较有说服力地证明了 UniPi 的工程设计确实有作用。
九、测试时引导:为什么说视频规划可编辑?
扩散模型的一个优势是可以在采样过程中加入额外约束。
作者举例:原始指令可能只要求把某个方块放到另一个方块附近,但测试时可以提供一个中间目标图像,引导机械臂先移动指定的方块。
可以理解为在采样分布中加入额外 prior:
其中 (h(\tau)) 表示:
-
中间必须经过某个状态;
-
轨迹必须避开某一区域;
-
最终图像满足额外属性。
Figure 7 展示了通过插入 intermediate guidance 改变生成计划。
这也是扩散规划相对于直接行为克隆的一个优势:可以在测试阶段修改整条轨迹分布,而不一定要重新训练策略。
十、实验二:多任务迁移
作者使用 10 个机器人操作任务训练,并在 3 个新任务上测试,训练集同样包括 20 万段 scripted 视频。
测试任务包括:
-
Place Bowl;
-
Pack Object;
-
Pack Pair。
结果为:
| 方法 | Place Bowl | Pack Object | Pack Pair |
|---|---|---|---|
| State + Transformer BC | 9.8 | 21.7 | 1.3 |
| Image + Transformer BC | 5.3 | 5.7 | 7.8 |
| Image + TT | 4.9 | 19.8 | 2.3 |
| Diffuser | 14.8 | 15.9 | 10.5 |
| UniPi | 51.6 | 75.5 | 45.7 |
这里最重要的并不只是高分,而是模型能够生成带有明显多步骤结构的计划,例如:
-
找到多个目标物体;
-
分别抓取;
-
移动到容器;
-
逐个放入。
这说明生成完整未来轨迹,比只预测下一步动作更容易表达长时任务结构。
十一、实验三:互联网预训练与真实机器人视频
数据
作者先在大规模通用数据上预训练:
-
1400 万 video-text pairs;
-
6000 万 image-text pairs;
-
LAION-400M。
之后在 Bridge 机器人数据集的 7200 个 video-text pairs 上微调。
结果:
| 模型 | CLIP ↑ | FID ↓ | FVD ↓ | Success ↑ |
|---|---|---|---|---|
| 无预训练 | 24.43 | 17.75 | 288.02 | 72.6% |
| 互联网预训练 | 24.54 | 14.54 | 264.66 | 77.1% |
顺便指出论文正文有一个小措辞错误:它说预训练取得 “higher FID and FVD”,但 FID/FVD 是越低越好,表中也是预训练后数值更低。
这个实验不能过度解读
这里的 Success 并不是实际机械臂执行成功率。
作者训练了一个分类器,读取生成视频的最后一帧,判断视频中任务是否看起来成功。因此 72.6% 和 77.1% 是生成视频的代理成功指标,不是机器人在真实世界完成任务的成功率。
所以论文对真实世界部分真正证明的是:
互联网视频预训练可以改善机器人场景中的视频计划生成。
它没有充分证明:
互联网视频预训练可以让真实机器人稳定完成这些任务。
这两个结论差别很大。
十二、这篇论文最值得质疑的地方
1. 模型规模与 baseline 严重不对等
UniPi 的模拟视频扩散模型规模约为:
-
第一阶段 1.7B;
-
时间超分辨率模型 1.7B;
-
文本编码器使用 4.6B 参数的 T5-XXL。
训练使用:
-
256 个 TPU-v4;
-
batch size 2048;
-
训练 200 万步。
相比之下,Transformer BC baseline 使用的是约 10M 级 Transformer 架构。
因此 Table 1 和 Table 3 的巨大提升,不能全部归因于:
“生成视频比直接生成动作更好。”
其中可能也有相当一部分来自:
-
更大的模型;
-
更强的生成式预训练;
-
更高的计算投入。
一个更严格的对比应该包括:
-
参数量匹配的 action diffusion;
-
同样预训练规模的直接动作策略;
-
相同视觉 backbone;
-
相同计算预算。
2. 视觉合理不等于物理可执行
视频生成模型可以生成看起来合理的画面,但可能出现:
-
手臂穿过物体;
-
接触位置错误;
-
物体无力移动;
-
机械臂到达不可达姿态;
-
中间帧违反动力学。
Inverse dynamics 只能尝试解释生成视频,无法保证视频本身属于真实机器人的可实现轨迹。
这反映了一个核心问题:
3. 论文采用 open-loop
生成错误无法在线纠正。
尤其是长时任务里:
-
第一步抓偏一点;
-
第二步看到的真实画面就与计划视频不同;
-
后续 inverse dynamics 仍然执行原计划;
-
误差可能不断累积。
因此真正实用的版本应该采用:
也就是 receding-horizon video planning。
4. “Universal” 有一定宣传成分
视频规划器确实可以共享,但动作接口仍然是 embodiment-specific。
换机器人后需要重新建立:
所以它更准确的名字可能是:
Universal visual planner with embodiment-specific control adapters。
5. 视频生成速度太慢
作者指出,高质量视频可能需要约一分钟生成。通过 diffusion distillation,初步实验可以加速约 16 倍。
这在真实闭环控制中尤其严重,因为 MPC 要不断重新生成计划。
十三、它和 World Model / World Action Model 的关系
这篇论文很容易被误认为普通 world model,但二者并不完全相同。
传统 action-conditioned world model
学习:
它回答:
在状态 (x_t) 执行动作 (a_t),接下来会发生什么?
UniPi
学习:
它回答:
从当前状态出发,为了完成语言目标,未来应该呈现什么轨迹?
因此 UniPi 不是纯粹的环境动力学模型,而是一个:
目标条件的、隐式包含策略偏好的未来轨迹生成器。
训练数据都是任务执行轨迹,因此生成模型同时混合了:
-
世界如何变化;
-
智能体应该如何行动;
-
成功任务通常长什么样。
作者自己也把它描述为某种“联合学习 world model 与 hierarchical planning”的方法。
十四、对你做 WAM / latent causal memory 最有价值的启发
UniPi 可以被看作一种早期的视觉式 World Action Model,但它留下了四个明显空缺。
1. 缺少因果归因
UniPi 能生成一段成功视频,却不知道:
-
哪一帧是任务成功的关键;
-
哪一个动作导致最终成功;
-
哪些中间变化只是视觉相关而非因果必要。
你设想的 latent causal memory 可以把轨迹压缩为:
而不是存储或生成所有帧。
2. 缺少显式失败建模
UniPi 主要学习成功示范,没有显式比较:
所以它缺乏“为什么这个计划会失败”的知识。
可以加入:
-
成功与失败轨迹对比;
-
counterfactual action replacement;
-
failure-aware video verifier;
-
关键帧因果干预。
3. 缺少计划验证器
视频生成后直接交给 inverse dynamics,没有独立模块检查:
-
是否符合语言任务;
-
是否违反物理约束;
-
是否能被机器人执行;
-
是否与当前场景一致。
现代化版本可以加入:
4. 缺少闭环记忆和修正
UniPi 每个 episode 基本是一次性生成,并没有利用之前失败的执行经验修正后续计划。
可以增加:
这与你的 self-evolving agent / memory 方向非常契合。
十五、最后用一句话真正读懂这篇论文
UniPi 的本质不是“用视频预测动作”,而是把视频轨迹当作机器人之间共享的中间规划语言:大模型负责想象任务完成过程,小型 inverse dynamics 负责把这种想象翻译成具体机器人的动作。
它最大的贡献是提出了一个非常有前瞻性的接口:
它最大的不足则是:
因此,从今天的 WAM 视角看,这篇论文最值得继承的是 video-as-plan 的统一表示;最需要补上的则是 动作条件、物理约束、因果归因、不确定性估计与闭环修正。