🤖 RT-1 论文核心精要总结 (Robotics Transformer 1)
论文全称: RT-1: Robotics Transformer for Real-World Control at Scale 研发团队: Robotics at Google & Everyday Robots (2022)
1. 核心思想与研究动机 (Motivation)
- 打破机器人领域的“数据孤岛”: 过去的机器人控制模型往往是为单一任务定制的“小作坊”模式。RT-1 旨在借鉴大语言模型(LLMs)的成功经验,构建一个与任务无关的、大容量的通用骨干网络。
- “海绵式”吸收能力 (Sponge Up): 证明只要给予模型足够庞大、多样的真实世界数据,Transformer 就能像海绵一样吸收通用模式,从而实现对新任务、新环境的零样本泛化 (Zero-shot Generalization)。
2. 核心模型架构 (Model Architecture)
为了解决机器人控制要求 “既要懂得多,又要反应快 (3Hz实时控制)” 的挑战,RT-1 采用了精妙的设计:
- 👁️👂 早期融合 (FiLM层): 不采用图文后置拼接,而是将语言指令提取的文本向量,通过 FiLM 机制提前注入到图像特征提取器(EfficientNet)中,让机器人的视觉“带着语言指令的目的”去过滤画面(增强抗干扰能力)。
仿射变换 Affine,一次线性变换加一次平移变换
- 🎬 6帧上下文记忆 (History Context): 输入过去的 6 帧图像而不是单帧静止图像。这一设计解决了“部分可观测性”问题,赋予模型动态感知和抵抗视觉遮挡的能力。
- 🗜️ 疯狂降维 (TokenLearner): 由于处理 6 帧图像的计算量极大,RT-1 引入 TokenLearner 模块,利用注意力机制将每张图的 81 个特征 Token 硬压缩成 8 个核心 Token,大幅降低 Transformer 的计算负担,保证了 3Hz 的实时推理速度。
- 🎯 动作离散化 (Action Tokenization): 摒弃传统的连续高斯分布回归,将 11 维动作空间切割成 256 个离散的区间(bins)。这使得模型能够处理人类演示数据中的**“多峰分布(Multi-modal distributions)”**(例如同一个杯子既可以从左抓也能从右抓),完美规避了连续回归导致“取平均值撞击物体”的灾难。
3. 大规模数据收集 (Scale & Data)
- 暴力美学: 动用 13 台真实移动机械臂,历时 17 个月,纯人工遥操作收集了 13万次 (130k) 成功片段。
- 任务广度: 支持超过 700 种自然语言指令(抓取、放置、开抽屉等),并涵盖多种不同的厨房环境、光照和桌面干扰物。
4. “吸星大法”:异构数据的吸收能力 (Absorption Properties)
RT-1 展现出了令人惊叹的跨域知识融合能力:
- 吸收仿真数据: 将基于真实世界从未见过的“虚拟物体”的仿真数据喂给模型,模型不仅没掉性能,反而让机器人在真实世界中操作这些新物体的成功率从 23% 飙升至 87%。
- 跨身体形态 (Cross-Embodiment): 混入结构完全不同、任务完全不同(仅 4 自由度、用于杂乱抓取)的 Kuka 机械臂历史数据后,当前机器人在从未训练过的杂乱抓取任务上成功率翻了近一倍。
5. 核心实验结论与长视距任务 (Key Findings & SayCan)
- 碾压式的鲁棒性: 在测试中,RT-1 取得了 97% 的已见任务成功率,并且在新任务 (76%)、复杂干扰物 (83%) 和新背景 (59%) 上的表现大幅超越 Gato 和 BC-Z 等基线模型。
- 长视距能力 (SayCan 集成): RT-1 作为底层的“小脑”肌肉策略,完美融入到了大语言模型驱动的 SayCan 框架中。在真实的厨房环境中,能够稳定地执行长达 50 个步骤的复杂任务序列(比如“帮我拿一罐可乐和一个苹果”)。
- 数据金律:多样性 > 数量: 论文通过严谨的消融实验证明,在机器人学习中,扩展“任务和环境的多样性(Diversity)”比单纯增加“数据的数量(Quantity)”对提升泛化能力更有用。
6. 论文的历史意义 (Significance)
RT-1 是机器人领域的一个重要里程碑。它用详实的数据和巧妙的架构证明了:Transformer + 离散化动作空间 + 海量多样化数据 这套从 NLP 领域借来的配方,完全可以打通机器人的底层控制,为迈向通用具身智能(Embodied AI)奠定了极其重要的基础(也是后续 RT-2 的基石)。