# Sim2Real 深度调研：苏度、银河通用与触觉闭环

> 研究日期：2026-08-21  
> 研究范围：机器人操作（以抓取、精密装配、移动操作为主），不把自动驾驶与纯导航的结论直接外推到接触丰富任务。  
> 证据规则：论文、官方项目页、官方代码仓库为 A 级；高校/公司官方新闻为 B 级；采访口述为 C 级。公司自测指标均标注为“自报”，不等同于独立复现。

## 一、先说结论

1. **“要多少数据才有门槛”没有统一数字。** 单任务、结构化场景可以从 `10 个真人种子示范 → 1000 个合成示范`起步；跨任务适配常见 `1000 个仿真示范 + 10–25 个真机示范/任务`；开放词汇抓取基础模型已经进入 `10 亿帧、1 万余物体、240 类`量级。真正的门槛不是硬盘容量，而是覆盖矩阵、物理参数标定、失败样本闭环和真机验证。
2. **苏度与银河通用路线不同。** 苏度 R1 的公开样机强调纯仿真训练、零真机示范、15–25 Hz 逐步闭环和视觉/物理随机化；银河通用 GraspVLA 有论文和代码支撑，核心是大规模合成动作预训练、互联网语义共训，再用少量真机数据后训练特定偏好。
3. **苏度公开指标强，但技术透明度低。** 官方披露约 98% 首次抓取成功率、两次内接近 100%，但没有公开仿真数据规模、训练算力、数据构成、论文或可复现实验。因此它目前更像“工程系统证据”，不是“学术可复现证据”。
4. **银河通用的优势是可拆解、可复现。** SynGrasp-1B 已披露生成链：Objaverse 物体 → BoDex 稳定抓取 → cuRobo 轨迹规划 → Isaac Sim 光真实渲染与域随机化；模型代码、权重、训练与真机接口已经公开。
5. **触觉不是所有任务的必选项，但对接触丰富任务是高价值反馈通道。** 视觉足以覆盖大量自由空间运动和粗抓取；插拔、柔性材料、遮挡内操作、滑移控制与精密装配，则需要力/触觉或等价的高频接触反馈。访谈中的“10%→80%+”“省 10 倍数据”等数字目前只有口述，不能作为行业基准。
6. **全球 Sim2Real 已从“把仿真做得像真的”转向组合拳：** 高保真物理、域随机化、Real2Sim/系统辨识、表征对齐、合成数据规模化、少量真机锚定、在线残差修正、触觉闭环。领先玩家通常同时做 3–5 条，而非押注单一方法。

## 二、Sim2Real 的 gap 到底是什么

把“仿真到现实差距”拆成六层，比笼统讨论“仿真像不像”更有用：

| Gap | 典型误差 | 常见解法 | 验证指标 |
|---|---|---|---|
| 几何与资产 | 尺寸、碰撞网格、关节限制错误 | CAD/扫描、3DGS/NeRF、资产清洗、USD 统一 | 碰撞穿透、位姿误差、可达率 |
| 视觉与传感 | 材质、光照、透明/反光、相机延迟与噪声 | 光真实渲染、视觉随机化、传感器噪声模型、表征不变性 | 感知误差、OOD 成功率 |
| 动力学与接触 | 摩擦、柔性、回差、执行器响应、接触刚度 | 系统辨识、参数随机化、可微/高保真物理、残差模型 | 轨迹误差、接触力误差 |
| 动作接口 | 控制频率、延迟、action chunking、控制器差异 | 统一动作空间、时延建模、高频闭环、低层控制器 | 恢复率、扰动响应、周期时间 |
| 语义与任务 | 仿真物体类别有限、语言与动作脱节 | 互联网语义共训、开放词汇 grounding、生成式任务扩展 | 未见类别/指令成功率 |
| 部署与评测 | 仿真得分高但真机脆弱、测试泄漏 | 真机保留集、HIL/SIL、失败回灌、跨本体 benchmark | 真机成功率、损伤率、稳定运行时长 |

最重要的判断是：**Sim2Real 不是一个 gap，而是一串 gap。** 只扩大数据量，无法自动修复错误的接触模型、时间同步或动作接口。

## 三、苏度：纯仿真样机，向 Real2Sim2Real 平台扩展

### 3.1 已公开的核心做法

苏度 R1 官方页面明确写明：训练使用仿真数据，不需要真实世界示范、遥操作或手工标注；通过大规模视觉随机化覆盖光照、背景和物体变化；策略每一步都基于最新观测，以 15–25 Hz 闭环运行，而不是一次预测长动作块。[#sudo R1 官方页](https://www.sudo.ai/)

公司自报的 60 分钟连续测试结果为：约 98% 首次成功率、两次尝试内接近 100%，覆盖刚性/柔性、透明/不透明、哑光/反光物体。官方同时承认距离真正生产级仍有差距。该结果的价值在于连续运行和恢复能力，但测试对象分布、失败定义、置信区间、第三方复现尚未公开。

复旦大学 2026 年 7 月的官方报道进一步披露：苏度把技术护城河概括为 Real2Sim2Real、虚实融合的数据配比，以及仿真—数据—训练—评测—硬件的全栈闭环；WAIC demo 自报通用场景抓取 98%、工业场景 99.5%，并扩展到亚毫米装配和移动中操作。[复旦大学新闻](https://news.fudan.edu.cn/2026/0717/c235a149902/page.htm)

### 3.2 看似矛盾，实际是两个层级

- **R1 抓取模型的公开口径：** 纯仿真训练、零真机示范。
- **公司平台的后续口径：** Real2Sim2Real，并优化真实与仿真数据配比。

合理解释是：R1 用“零真机训练”证明纯仿真在开放物体抓取上的上限；平台化和工业化阶段仍会让真实测量、真实失败案例和客户场景回到仿真与训练闭环。不能把单个 demo 的纯仿真标签，外推成全公司永远不用真实数据。

### 3.3 它真正解决的 gap

1. **视觉 gap：** 大规模光照、背景、材质随机化，逼迫模型依赖稳定几何与物理线索。
2. **动作 gap：** 15–25 Hz 逐步闭环，把扰动恢复放进策略本身。
3. **空间 gap：** 将障碍感知与可行空间推理整合进学习策略，而非仅外挂碰撞规划器。
4. **系统 gap：** 自研硬件和软件有利于统一相机、时延、控制频率和执行器响应。

### 3.4 仍未公开的关键门槛

- 仿真帧数、轨迹数、对象数、类别数、任务分布。
- 仿真器、物理引擎、接触模型、执行器模型和系统辨识方法。
- 训练算力、模型规模、训练周期和成本。
- 真机测试协议、对象抽样方法、失败定义和第三方复现。
- 触觉/力传感是否进入训练与部署闭环。

因此，苏度应被归类为：**工程表现领先、方法披露不足、可复现性待补。**

## 四、银河通用：合成动作预训练 + 互联网语义 + 少量真机后训练

### 4.1 SynGrasp-1B 是它的数据底座

GraspVLA 论文和项目页披露：SynGrasp-1B 包含 10 亿帧合成抓取数据，覆盖 Objaverse 中 1 万余物体、240 个类别。生成链包括：

1. 从 Objaverse 选择和清洗物体网格；
2. 用 BoDex 生成稳定抓取；
3. 用 cuRobo 规划无碰撞抓取轨迹；
4. 在 Isaac Sim 中对材质、光照、相机、背景、初始位姿做随机化并光真实渲染；
5. 将合成动作数据与互联网 grounding 数据共同训练，补上“仿真会抓、但不认识开放世界名称”的语义 gap。

来源：[GraspVLA 论文](https://arxiv.org/abs/2505.03233)、[项目页](https://pku-epic.github.io/GraspVLA-web/)、[官方代码](https://github.com/PKU-EPIC/GraspVLA)。

### 4.2 模型如何跨越 gap

GraspVLA 把自回归视觉语言骨干与 flow-matching 动作专家放在统一的推理链中：先定位目标，再预测抓取目标与动作。合成数据提供几何和动作覆盖，互联网数据提供开放词汇语义。对特殊零件命名、密集瓶装抓取顺序、杯子抓取偏好等场景，再使用少量真机示范做后训练；论文披露部分任务收集 100 条示范，密集瓶装任务按瓶种收集 10 条。[OpenReview 论文版本](https://openreview.net/pdf?id=zEC8TOXDkH)

截至 2026-08-19，官方仓库已经提供模型服务、SynGrasp-1B 训练框架、仿真 playground 和真机控制接口；示例配置使用 8 GPU、全局 batch 384、20 万步。仓库还披露单张 NVIDIA L40S 上约 9GB 显存、编译后约 200ms 推理延迟。这是实验复现门槛，不等于完整预训练成本。

### 4.3 与苏度的本质差异

| 维度 | 苏度 R1 | 银河通用 GraspVLA |
|---|---|---|
| 主要证明 | 纯仿真策略能否直接真机闭环抓取 | 合成动作能否预训练 VLA 基础模型 |
| 数据口径 | 未披露规模 | 10 亿帧、1 万余物体、240 类 |
| 真实数据 | R1 宣称零真机示范；平台口径转向虚实融合 | 预训练纯合成；特定偏好用少量真机后训练 |
| gap 手段 | 视觉/物理随机化、高频闭环、全栈软硬件 | 光真实渲染、域随机化、语义共训、few-shot 适配 |
| 开放程度 | 暂无论文/代码/数据 | 论文、代码、权重、数据与接口已公开 |
| 当前外推边界 | 主要证据仍是抓取与受控工业 demo | 主体仍是抓取，长时序与复杂接触任务需另证 |

## 五、多少空间数据和仿真数据才构成门槛

### 5.1 不要问总量，先问覆盖矩阵

数据门槛可以写成一个更实用的乘积：

`门槛 ≈ 任务数 × 物体/场景数 × 初始状态覆盖 × 视觉变化 × 物理变化 × 失败与恢复覆盖 × 本体数`

其中任一维度接近零，大总量也可能只是重复帧。一个机器人在同一桌面拍 1 亿帧，不一定比 1000 条覆盖失败、恢复、摩擦和遮挡变化的轨迹更有价值。

### 5.2 三档可执行阈值

| 目标 | 可参考的公开量级 | 结论 |
|---|---|---|
| 单一技能 PoC | 10 条高质量真人种子示范，自动扩展到约 1000 条合成示范 | MimicGen 在多个任务展示 `10→1000`；适合验证，不代表生产级 |
| 特定任务可靠部署 | 每任务约 1000 条仿真示范 + 10–25 条真机示范，并含 OOD/失败保留集 | OT-Sim2Real 用该量级展示最高 30% 真机成功率提升；这是“少量真机锚定”参考线 |
| 开放词汇/跨物体基础能力 | 10^8–10^9 帧、10^4 物体、10^2 类别，再加互联网语义或跨本体数据 | GraspVLA 已到 10 亿帧；这是基础模型级门槛，不是所有创业公司都要复制 |

另一个极端样本是 OpenAI Dactyl：全随机化的灵巧手控制约需 100 年仿真经验，使用 6144 个 CPU 核和 8 块 GPU，在约 50 小时内采集。[OpenAI Dactyl](https://openai.com/index/learning-dexterity/)。这说明接触丰富强化学习的门槛可能以“仿真年”而非“示范条数”计，但它不能直接换算成 VLA 数据量。

MimicGen 的公开结果是：少于 200 条人类示范，自动生成超过 5 万条示范，覆盖 18 个任务；典型单任务是 10 条种子生成 1000 条数据。[MimicGen](https://mimicgen.github.io/)

OT-Sim2Real 的 NeurIPS 2025 结果是：每任务 1000 条源域仿真示范、10 条目标域示范；真实实验每任务 10–25 条真机示范，方法相对共训基线的真机成功率最高提升 30%。[项目页与论文](https://ot-sim2real.github.io/)

### 5.3 真正的玩家门槛

1. **资产与参数生产线：** 物体网格、材质、碰撞体、关节、质量、摩擦、柔性与传感器参数能否自动生成和质检。
2. **专家轨迹生产：** 规划器、强化学习、规则专家或遥操作种子能否稳定产生高质量动作，而不是只渲染漂亮视频。
3. **现实锚点：** 有无真机保留集、系统辨识、标定与失败回灌。没有锚点，仿真规模越大越可能放大错误先验。
4. **闭环评测：** 不只测“抓起来”，还测首次成功、恢复、周期时间、碰撞、损伤和长时间稳定性。
5. **数据治理：** 时间同步、动作坐标、相机外参、末端定义、触觉格式、版本和血缘能否跨本体复用。

## 六、全球 Sim2Real 的六条技术路径

### 路线 A：高保真物理 + 域随机化

不押注一个“完美仿真”，而是随机化光照、材质、相机、摩擦、质量、时延和执行器参数，让策略学习分布鲁棒性。OpenAI Dactyl 是经典案例；苏度 R1 和 GraspVLA 都沿用此思想。优点是可规模化，缺点是随机化范围选错会产生无效或过度保守策略。

### 路线 B：Real2Sim / 系统辨识 / 数字孪生

先从真实世界重建几何和外观，再估计物理参数，把现实失败带回仿真。InfiniteWorld 使用 SfM、3DGS/PGSR、TSDF 与后处理构建真实场景，并把资产统一为 USD。[论文](https://arxiv.org/abs/2412.05789)、[代码](https://github.com/pzhren/infiniteworld)。优点是场景贴近部署域，缺点是接触参数、透明/柔性物体和执行器动态仍难重建。

### 路线 C：表征与分布对齐

不强求像素完全一致，而是在任务相关特征空间对齐 sim 与 real。OT-Sim2Real 对齐观测—动作联合分布，处理仿真多、真实少的不平衡。优点是少量真机数据即可校正，缺点是需要目标域样本，且跨任务泛化仍需验证。

### 路线 D：合成数据与生成式仿真规模化

通过程序化资产、生成模型、自动任务编排和专家轨迹，将场景与技能扩展从手工工程变成数据引擎。GraspVLA、RoboGen、InfiniteWorld、DexScale、Sim2Real-VLA 属于此类。优势是长尾覆盖，风险是“生成得多”不等于“物理正确”。

### 路线 E：仿真预训练 + 少量真机共训/后训练

先在仿真获得覆盖，再用少量真机示范锁定相机、动作接口、材料和偏好。银河通用与 OT-Sim2Real 是代表。相比纯仿真，这条路线更务实；代价是需要稳定的数据采集、格式统一和防止真实小样本过拟合。

### 路线 F：在线适应、残差控制与多模态反馈

部署时让策略利用最新观测、触觉或力反馈修正动作；也可以在稳定基础策略上学习轻量残差。苏度强调 15–25 Hz 每步闭环；触觉模型则用滑移、接触形变和力变化补足视觉遮挡。优点是能救回误差，缺点是实时性、安全和传感器仿真更难。

## 七、论文与开源技术栈地图

### 7.1 仿真与资产层

| 工具 | 适用点 | 开源/官方入口 |
|---|---|---|
| NVIDIA Isaac Sim / Isaac Lab | 光真实渲染、PhysX、GPU 并行、RL/IL、USD 资产 | [Isaac Sim](https://developer.nvidia.com/isaac/sim)、[Isaac Lab](https://developer.nvidia.com/isaac/lab) |
| MuJoCo | 轻量、快速、接触动力学、系统辨识、控制研究 | [官方文档](https://mujoco.readthedocs.io/en/stable/overview.html) |
| ManiSkill / SAPIEN | GPU 并行视觉仿真、异构物体、现成操作任务与示范 | [ManiSkill](https://www.maniskill.ai/) |
| Genesis / RoboGen | 多物理仿真与生成式任务/技能扩展 | [RoboGen](https://github.com/Genesis-Embodied-AI/RoboGen) |
| InfiniteWorld | Real2Sim、3D 资产统一、开放场景与自动标注 | [代码](https://github.com/pzhren/infiniteworld) |
| EmbodiChain | 仿真、自动数据生成、训练和部署的模块化链路 | [代码](https://github.com/DexForce/EmbodiChain) |

### 7.2 数据与策略层

| 项目/论文 | 核心贡献 | 可复用资产 |
|---|---|---|
| GraspVLA / SynGrasp-1B | 10 亿帧合成抓取、开放词汇 VLA、few-shot 后训练 | [论文](https://arxiv.org/abs/2505.03233)、[代码](https://github.com/PKU-EPIC/GraspVLA) |
| MimicGen | 少量人类示范自动扩展为大规模轨迹 | [项目与代码](https://mimicgen.github.io/) |
| Open X-Embodiment / RT-X | 22 种机器人、527 技能的跨本体数据统一与正迁移 | [论文](https://arxiv.org/abs/2310.08864) |
| OT-Sim2Real | sim-real 观测—动作联合分布对齐 | [项目与代码](https://ot-sim2real.github.io/) |
| Sim2Real-VLA | 纯合成训练、affordance 高层规划 + tokenized 低层动作 | [项目](https://edem-ai.github.io/sim2realvla.github.io/) |
| RealMirror | 3DGS 重建、VLA 训练评估与零样本 Sim2Real 平台 | [代码](https://github.com/terminators2025/RealMirror) |
| Galbot SDK / MCAP→LeRobot | 银河通用本体接口和数据格式转换 | [SDK](https://github.com/GalaxyGeneralRobotics/GalbotSDK)、[转换工具](https://github.com/GalaxyGeneralRobotics/galbot-mcap2lerobot) |

### 7.3 触觉与接触层

| 项目 | 意义 | 证据边界 |
|---|---|---|
| Daimon-Infinity | 计划开源 1 万小时 VTLA 数据，首批 1000 小时 | [官方仓库](https://github.com/dmrobot-admin/Daimon-Infinity)；需核验实际可下载量与任务分布 |
| RobOmni | Daimon + Galbot 的触觉/视觉/状态多模态 benchmark，基于 Isaac Sim | [联合发布](https://www.globenewswire.com/news-release/2026/06/05/3307187/0/en/daimon-and-galbot-jointly-release-robomni-an-omni-modal-evaluation-benchmark-including-tactile-sensing-for-physical-interaction.html)；发布稿不是同行评审论文 |
| Tactile Gym 2.0 | 高分辨率视觉触觉的 Sim2Real RL 对比平台 | [论文](https://arxiv.org/abs/2207.10763) |
| VTLA | 视觉—触觉—语言—动作，面向插入等接触任务 | [论文](https://arxiv.org/abs/2505.09577)；“未见形状 90%+”需按原实验设置理解 |

## 八、把戴盟访谈放回技术坐标系

访谈最有价值的不是“视触觉一定是终局”，而是三个工程判断：

1. **视觉在接触后会失去可观测性。** 遮挡、微小配合误差、滑移、材料软硬和接触力，不一定能从外部 RGB 稳定推断。
2. **触觉的价值要通过闭环和 benchmark 证明。** 传感器分辨率只是入口；最终要看任务成功率、恢复率、损伤率和所需示范数量。
3. **数据格式和后处理管线可能比采集本身更稀缺。** 本体、相机、末端、触觉阵列和动作坐标不统一，会让“1 万小时”无法直接共训。

需要降级处理的访谈口径：

- “走孔装配 10%→80%+”“减少约 10 倍训练数据”“视觉上限 70–80%”均为嘉宾口述，缺少任务定义、样本量、基线和论文，当前只可作为待验证假设。
- “视触觉是终局”应改成：**视触觉是精密接触和柔性操作的重要路线之一；六维力、电子皮肤、关节电流、听觉与视觉也会形成多传感器组合。**
- 500 万次按压寿命、下载量和商业客户等数据，需要第三方或公开测试补证。

## 九、建议的验证方案

若要判断一家公司的 Sim2Real 是否形成护城河，建议索要同一套证据包：

1. **数据卡：** 轨迹数、有效控制步、对象/类别、任务、失败比例、随机化维度、真实/仿真配比。
2. **测试卡：** 首次成功、两次内成功、恢复率、碰撞/损伤、周期时间、连续运行时长和 95% 置信区间。
3. **保留集：** 未见对象、未见材质、未见光照、未见空间布局、未见相机位姿和未见任务组合。
4. **消融：** 去掉域随机化、真实后训练、闭环、触觉、系统辨识后分别下降多少。
5. **成本：** 每 1000 条有效轨迹的生成成本、仿真倍速、训练 GPU 时、真机校准时长和失败维护成本。
6. **可迁移性：** 换机械臂、夹爪、相机、控制频率后需要多少新数据。

## 十、最终判断

**苏度押注的是“把 gap 尽量消化在仿真与闭环系统里”；银河通用押注的是“把合成数据做成基础模型预训练资产，再用语义与少量真实数据补齐”。** 前者在系统表现上更激进，后者在数据规模与开放复现上更扎实。

对于创业玩家，最现实的进入路径不是从零复制 10 亿帧，而是：选择一个高价值任务 → 10–50 条高质量种子示范 → 自动扩展到 1000–5000 条仿真轨迹 → 10–25 条真机锚定 → 建立失败回灌 → 用触觉/力反馈攻克接触段。只有当任务数、物体数和本体数持续扩张时，才有必要进入亿帧级预训练。

触觉的战略价值也在这里：它不是替代仿真，而是为仿真提供真实接触锚点，为策略提供部署时的误差反馈，为评测提供“到底有没有碰对”的物理证据。

## 附录：证据分级与本地材料

- A 级：同行评审/预印本论文、官方项目页、官方代码仓库。
- B 级：公司官网、高校官方新闻、正式联合发布。
- C 级：采访口述、媒体转述、未披露实验协议的 demo 指标。
- 本地访谈原文、AI 总结和附图已快照到 `sources/`，SHA-256 见 `sources/SHA256SUMS.txt`。

