导读

具身智能的公开讨论常被压缩成两组口号:人形还是非人形,端到端还是分层。苏度科技 CEO 韩铮给出的答案更接近工程实践:机器人形态要服从任务、成本和可靠性;模型训练可以显式学习几何与物理结构,部署时仍由统一策略输出动作。真正决定能力的不是标签,而是数据能否覆盖接触过程、仿真是否足够可信、硬件是否允许模型稳定复现。

本文把节目中的技术主张、演示结果和商业设想分开整理。零样本抓取数据来自团队自述与现场演示,并不自动代表所有物体、环境和长程任务都达到相同成功率。

阅读主线

  • 机器人“会走”和“会操作陌生物体”为什么是难度完全不同的问题;
  • 结构化 3D 数据、物理仿真和 Sim-to-Real 各自解决什么,为什么真实视频无法独立完成训练;
  • 节目所称约 98% 零样本抓取成功率,需要放在怎样的任务和演示条件下理解;
  • “分层预训练、端到端部署”怎样绕开纯模块化与纯黑盒的二选一;
  • 苏度科技为什么先做轮式底盘、双指夹爪和开发者平台,而不直接押注人形与垂直行业。

一、机器人动手的数据根基

时间点:03:17–18:08

本节要点:开放世界中的物体操作比运动控制难得多,团队因此从 ImageNet、ShapeNet 延伸到结构化 3D 数据与 Sim-to-Real。

全栈不是口号,而是模型迭代的条件

韩铮说,团队早期以软件和机器学习为主,商业化后开始自研本体,因为不控制硬件就很难暴露模型问题、完成快速迭代。当前重点是轮式底盘与双指夹爪等更稳定、性价比更高的构型,而非为了外形先追求人形与灵巧手。

他判断,多数现实操作并不需要灵巧手;移动和操作可以阶段性解耦,但长期仍可能汇合为兼顾平地效率和复杂地形能力的通用构型。

从图像标注走向可交互的三维世界

苏昊参与 ImageNet 后又推动 ShapeNet,核心变化是让机器不只识别二维类别,还能理解物体的几何结构、关节、材质和可操作方式。机器人训练所需的 3D 数据比互联网图像稀缺,标注与验证成本也更高。

真实视频难以提供亚毫米级接触信息与完整物理参数;仿真可以系统生成极端姿态、材质和碰撞情况,再通过 Sim-to-Real 把策略迁移到现实。DALL·E 等生成模型带来的数据能力拐点,也影响了团队对创业时机的判断。

二、仿真如何跨过零样本抓取门槛

时间点:21:40–34:22

本节要点:结构化数据、经典物理法则与强化学习共同组成训练环境,团队以公开、随机场景验证新物体抓取能力。

质量、规模和物理一致性要同时成立

仿真器以物理规则为底层约束,再用强化学习让机器人经历海量试错。团队选择自建结构化 3D 数据集,以便控制几何、材质、重量和关节信息的准确性,而不是只追求数据数量。

韩铮认为,仿真不是把现实做成漂亮动画,而是要让接触、摩擦、受力和控制接口足够可信,才能减少迁移到真实机器人后的偏差。

先验证基础泛化,再串联长程任务

节目称其零样本通用抓取面对未见物体的单次成功率达到约 98%。团队还在学术会议现场使用随机环境演示,以回应 Demo 是否提前适配的质疑。

韩铮把基础 Zero-Shot 泛化看得比长流程表演更重要:如果每个原子技能不能稳定适应新物体,串联再长的任务也容易把误差逐步放大。

三、端到端与上下分层并非简单二选一

时间点:38:16–55:38

本节要点:团队在预训练中显式加入物理理解与分层结构,在部署端仍可表现为端到端执行;关键是数据和模块能否解释、复用与调试。

软硬件协同决定操作上限

团队设想的产品形态是稳定硬件、底层模型与 API 的组合,类似智能手机平台。仿真器、机器人本体和控制接口必须共同设计,否则硬件误差会让高层策略难以复现。

拧瓶盖展示了问题的复杂性:机器人不仅要靠视觉接近物体,还要理解旋转方向、几何约束、摩擦与施力变化。相比行走等运动控制,开放物体操作的难度可能高两到三个数量级。

分层预训练,端到端部署

韩铮反对把路线简化成白盒与黑盒对立。团队在预训练阶段让模型显式学习物体位置、几何、材质和动力学,使上层具有推理能力;在最终部署时,动作仍可以由统一模型端到端输出。

纯模仿学习能复现见过的动作,却可能缺乏对陌生物体的物理理解。真实遥操作数据又难以像特斯拉车队那样自然规模化,因此团队把仿真视为冷启动的必要手段,并预测上下分层会重新受到重视。

四、全球竞争与开发者生态

时间点:59:08–1:12:43

本节要点:不同公司在纯模型、本体和垂直场景之间分工,苏度选择提供通用底座,让开发者探索具体应用。

强模型与强本体仍需要真正结合

节目比较 Skild、Figure、Optimus 等公司的路线。韩铮认为,实现稳定的“动手”能力需要模型与硬件深度结合;单做大脑的公司需要可靠本体合作伙伴,而本体公司也必须补足环境理解和操作模型。

他尤其看好 Google DeepMind 与波士顿动力 Atlas 的组合,因为前者积累模型与数据能力,后者长期掌握高性能本体。亚马逊场景丰富、机器人资产众多,但跨团队和跨系统整合仍是挑战。

不押单一垂类,先做机器人时代的底座

许多团队退回仓储、工厂等垂直场景,是因为通用路线的技术和商业路径仍不清晰。苏度愿意牺牲一部分短期垂直收入,优先提供可靠硬件、三到五个基础技能和组合开发工具。

其目标是让数百乃至上千名开发者在平台上尝试不同应用,再与少数场景伙伴深度验证工具链。团队希望长期成为类似“硬件加 iOS”的底层平台,而不是亲自覆盖每个行业集成项目。

材料说明与快速回查

  • 真实视频缺少完整接触力、摩擦和材质参数;结构化 3D 数据与仿真用来补足这些监督信号。
  • 仿真价值不在视觉逼真,而在物理一致性、覆盖极端情况和可重复试错。
  • 零样本原子技能稳定后,长程任务才有可能避免误差连续放大。
  • 分层训练可以提高可解释性、调试性和数据复用,最终动作仍可由统一模型端到端产生。
  • 硬件误差、控制接口和动作表达会直接限制模型泛化,所谓“全栈”首先是迭代闭环。
  • 平台路线能让外部开发者寻找场景,也承担需求分散、商业回报较慢的风险。

本文依据节目转写重编。约 98% 的单次抓取成功率、难度数量级和玩家比较均来自嘉宾陈述,未在本文中作独立技术复现;对 Figure、Optimus、Skild、Google DeepMind、波士顿动力与亚马逊的评价属于嘉宾的行业判断。