RoboTwin 2.0 中文精读
Paper: RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation Authors: Tianxing Chen et al. Arxiv: 2506.18088
1. 论文概览
RoboTwin 2.0 是一个面向双臂机器人(Bimanual Manipulation)的自动化数据生成平台和评测基准。
作者希望解决机器人领域长期存在的问题:
- 真实机器人数据昂贵
- 人工采集效率低
- 仿真数据泛化能力不足
- Sim-to-Real Gap 较大
整体框架:
RoboTwin-OD
+
MLLM Expert Code Generation
+
VLM Feedback Repair
+
Domain Randomization
+
50 Tasks Benchmark
+
100k+ Expert Trajectories
目标是自动生成大规模、高质量、多样化的机器人操作数据,并提升真实世界部署能力。
2. 核心贡献
Contribution 1:RoboTwin-OD
- 731 个物体
- 147 个类别
- 包含语义和操作标注
- 支持自动任务生成
Contribution 2:MLLM 驱动专家代码生成
Task Description
↓
MLLM
↓
Expert Program
↓
Simulator
↓
VLM Feedback
↓
Program Repair
无需人工编写机器人程序。
Contribution 3:五维 Domain Randomization
包括:
- Clutter
- Background
- Lighting
- Table Height
- Language Instruction
显著提高策略泛化能力。
Contribution 4:统一 Benchmark
- 50 个双臂任务
- 5 种机器人平台
- 100k+ 专家轨迹
用于训练和评测 VLA 模型。
3. RoboTwin-OD
数据规模
| 项目 | 数量 |
|---|---|
| Object Categories | 147 |
| Object Instances | 731 |
数据来源
自建数据
Image
↓
Rodin
↓
3D Mesh
生成:
- 534 个物体
Objaverse
- 153 个物体
PartNet-Mobility
- 44 个可动关节物体
例如:
- Laptop
- Drawer
- Cabinet
操作标注
每个物体包含:
Grasp Point
抓取点
Grasp Axis
抓取方向
Functional Point
功能点,例如:
- 杯把手
- 抽屉把手
- 按钮
Language Annotation
每个物体生成约 15 条语言描述:
green shoe
teal sneaker
running shoe
sports shoe
用于语言随机化。
4. 自动专家代码生成
传统方法:
人工编写代码
↓
执行任务
↓
采集轨迹
问题:
- 成本高
- 难扩展
RoboTwin 2.0:
Task Description
↓
MLLM
↓
Python Program
↓
Simulator
↓
VLM Observer
↓
Error Analysis
↓
Program Repair
↓
Re-execution
形成自动闭环。
Code Agent
负责生成机器人行为程序:
grab()
move()
place()
handover()
输入:
Move the can to the left of the pot.
输出: 机器人执行代码。
VLM Observer
当执行失败时自动分析:
Left arm failed to grasp object.
Object dropped during handover.
Wrong target position.
然后生成修复建议。
为什么有效
传统:
Code
↓
Failure
↓
Stop
RoboTwin 2.0:
Code
↓
Execution
↓
Visual Inspection
↓
Error Localization
↓
Code Repair
↓
Retry
本质类似:
Self-Refine
+
Agent Loop
+
Simulator
属于 Agentic Data Generation。
5. Domain Randomization
作者认为很多机器人策略失败的根本原因是:
Simulation is too clean.
因此引入五维随机化。
5.1 Clutter Randomization
随机放置:
- 玩具
- 杯子
- 鞋子
- 锅
- 盒子
形成杂乱桌面。
5.2 Background Randomization
作者构建:
- 11000 个背景纹理
生成流程:
1000 prompts
↓
Stable Diffusion v2
↓
20000 images
↓
Manual Filtering
↓
11000 Textures
5.3 Lighting Randomization
随机:
- 光照强度
- 光照颜色
- 光照位置
- 光源类型
模拟真实环境。
5.4 Table Height Randomization
桌面高度随机变化:
±3cm
模拟:
- 餐桌
- 实验台
- 办公桌
等不同场景。
5.5 Language Randomization
使用 MLLM 自动改写任务描述。
原始:
Move can left of pot.
生成:
Use the left arm to place the sauce can
to the left side of the gray pot.
或者:
Move the white plastic sauce can
to the left of the cooking pot.
本质:
Instruction Augmentation
提升 VLA 语言泛化能力。
6. Embodiment Adaptation
不同机器人具有不同运动学结构。
Franka
偏好:
Top-down Grasp
Piper
偏好:
Side Grasp
因此作者为物体提供:
- 多抓取点
- 多抓取方向
- 多接近轨迹
再利用 Motion Planning 自动筛选可行方案。
7. 支持的机器人平台
目前支持:
- Franka
- Piper
- UR5
- ARX-X5
- Aloha-AgileX
以及:
- Panda Gripper
- WSG Gripper
支持异构双臂组合。
8. Benchmark
任务规模
50 Tasks
示例任务:
- Handover
- Stack Bowls
- Pick Bottle
- Click Bell
- Open Laptop
训练数据
每个任务:
50 Expert Demonstrations
测试环境
Easy
干净环境
Hard
随机化环境:
- clutter
- lighting
- background
- table height
9. 自动代码生成实验
| 方法 | ASR |
|---|---|
| RoboTwin 1.0 | 47.4% |
| RoboTwin 1.0 + MM Feedback | 63.9% |
| RoboTwin 2.0 + MM Feedback | 71.3% |
提升:
+10.9%
说明视觉反馈修复机制显著有效。
10. Policy Robustness 实验
测试模型:
- ACT
- DP
- DP3
- RDT
- Pi0
加入 RoboTwin 2.0 数据后:
RDT
+31.9%
Pi0
+29.3%
说明 Domain Randomization 能显著提高泛化能力。
11. Sim-to-Real 实验
真实机器人平台:
COBOT-Magic
任务:
- Stack Bowls
- Handover Block
- Pick Bottle
- Click Bell
Baseline
训练数据:
10 条真实轨迹
RoboTwin 2.0
训练数据:
10 条真实轨迹
+
1000 条仿真轨迹
最困难场景
条件:
Unseen Background
+
Clutter
成功率:
9%
↓
42%
相对提升:
367%
这是论文最重要的实验结果。
12. Benchmark 结果
测试:
- ACT
- DP
- DP3
- RDT
- Pi0
| Model | Easy | Hard |
|---|---|---|
| RDT | 34.5 | 13.7 |
| Pi0 | 46.4 | 16.3 |
| ACT | 29.7 | 1.7 |
| DP | 28.0 | 0.6 |
| DP3 | 55.2 | 5.0 |
结论:
- 所有模型在 Hard 环境显著下降
- VLA 模型更鲁棒
- Domain Shift 仍是核心挑战
13. RoboTwin 2.0 相比 RoboTwin 1.0 的改进
| Metric | RoboTwin 1.0 | RoboTwin 2.0 |
|---|---|---|
| Prompt Tokens | 5901 | 4719 |
| Code Tokens | 1236 | 569 |
| Parallel Control | ✗ | ✓ |
| AST Similarity | 23.72% | 44.78% |
| CodeBERT Similarity | 97.72% | 98.80% |
| UnixCoder Similarity | 76.24% | 82.21% |
说明:
- 代码更短
- 结构更清晰
- 更接近人工代码
- 支持双臂并行执行
14. 论文真正的价值
作者最大的贡献并不是:
又做了一个机器人数据集
而是提出了一整套:
MLLM Task Generation
+
Automatic Expert Code
+
VLM Feedback Repair
+
Domain Randomization
+
Cross-Embodiment Adaptation
的数据生成流水线。
15. 对未来 VLA 的启示
未来机器人数据集的发展方向很可能是:
Human Teleoperation
↓
Digital Twin
↓
MLLM Generation
↓
Agentic Data Generation
↓
Automatic Self-Improvement
RoboTwin 2.0 已经展示出这一趋势。
一句话总结
RoboTwin 2.0 的核心创新在于构建了一套利用 MLLM 自动生成专家轨迹、利用 VLM 自动发现并修复错误、结合五维 Domain Randomization 和多机器人本体适配的数据生成系统,并证明这些高质量合成数据能够显著提升 VLA 模型在真实世界复杂环境中的鲁棒性与 Sim-to-Real 泛化能力。