Skip to content
Go back

RT-2

Edit page

hu# 📄 论文精读笔记:Google RT-2 —— 开启具身智能的 ChatGPT 时刻

论文标题: RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control 研究机构: Google DeepMind (2023) 核心标签: Embodied AIVLA架构泛化能力涌现推理Robot Learning

💡 1. 一句话总结 (TL;DR)

RT-2 证明了可以通过最简单、最暴力的方式,将机器人的底层控制动作转化为“文本 Token”。通过这种方式,直接将千亿参数的互联网视觉-语言大模型(VLM)微调成机器人的“大脑”,让机器人无缝继承大模型的常识、逻辑推理和极致的零样本泛化能力


🎯 2. 研究背景与痛点


🛠️ 3. 核心创新:VLA 架构 (Vision-Language-Action)

为了让“只会输出文本”的大模型学会“控制机械臂”,RT-2 做了两个极其巧妙的设计:

① 神来之笔:动作词元化 (Action Tokenization)

大模型只认识文本,不认识物理坐标。RT-2 直接把机器人的动作当成一门“外语”来教给大模型:

② 协同微调 (Co-Fine-Tuning)

为了防止大模型在学习机器人动作时产生“灾难性遗忘”(忘了原本的互联网常识),RT-2 将:


✨ 4. 惊艳的实验结果:泛化与涌现

因为继承了 VLM 的互联网知识,RT-2 展现出了在纯机器人数据中从未见过的能力:


🧠 5. 引入思维链 (Chain-of-Thought, CoT)

大模型最强大的思维链技术也被 RT-2 直接拿来用。在训练数据中插入一个自然语言的 Plan 步骤,让机器人在行动前先“内部思考”一下:

加上 CoT 后,机器人能够执行包含了多层逻辑嵌套的超复杂指令。


⚠️ 6. 局限性与思考 (Limitations)

尽管表现惊艳,但这篇论文也诚实地指出了当前的瓶颈:

  1. 不能“无中生有”物理技能: RT-2 继承的只是大模型的“脑力”,而非“体力”。如果机器人在训练时没做过“擦”的动作,你即使给它抹布,它也只会把抹布抓起来,无法创造出“擦拭”这个物理技能。
  2. 算力成本与延迟极高: 最大模型高达 55B(550亿参数),无法部署在机器人本地。需要挂在云端 TPU 通讯,控制频率仅为 1~5 Hz,做不了需要高频反馈的灵巧操作(如打乒乓球、接住掉落的物品)。
  3. 精细操作能力不足: 抓取特定部位(如杯子把手)、折叠衣物等依然困难。

📌 7. 个人启发 / 总结

“RT-2 是具身智能真正走向大一统架构的起点。”

以前我们认为机器人需要:感知模块 -> 规划模块 -> 控制模块。RT-2 证明了 End-to-End(端到端)的 Transformer 架构是跑得通的。只要把模态对齐(Token化),一切问题都可以转化为 Next-token prediction 的语言生成问题。

未来的核心壁垒: 既然“认知”可以直接从互联网大模型“白嫖”,那么具身智能未来的决胜局将不再是算法结构,而是高质量、多模态、包含丰富物理动作的真实世界交互数据(Robot Data)


Edit page
Share this post on:

Previous Post
RT-1
Next Post
RoboTwin 2.0