- 应用 :
- 技术 :
英伟达又放了个大招:拍一段视频,自动生成机器人训练仿真环境

这是思维AI社的第83篇原创
全文约2380字,阅读时长预计8分钟
6月底,具身智能圈有篇论文挺炸的,英伟达GEAR实验室联合斯坦福、佐治亚理工放出来一个叫SimFoundry的东西。
我看完第一反应是——机器人训练数据的生产方式,可能要变天了。


先给你说清楚它到底能干啥
一句话:给它一段真实世界的视频,它自动给你生成一个能交互、能训练、能评测的机器人仿真环境。
不是那种3D重建完只能看的模型,是正儿八经能跑物理引擎、能放机器人进去做任务、甚至能无限生成新场景的"活环境"。
你品品这个事的分量。
以前做机器人仿真,一个场景得美术+技术美术+物理工程师折腾好几天甚至几周,才能搞出一个能用的仿真环境。
现在呢?拿手机拍一段视频,扔进去,等一会儿,出来一个完整的、物理正确的、能交互的仿真场景。
成本从"周"直接降到"分钟"。
而且更狠的是,它不只是重建一个一模一样的场景,还能自动生成"数字表亲"——就是保持功能不变,但物体外观、布局、任务都换了的新场景。
换句话说,一段视频进去,不是出来一个场景,而是出来几乎无限多的训练场景。
这就不是"省人力"了,这是把数据生产的底层逻辑给换了。
它是怎么做到的?三阶段流水线
SimFoundry的思路其实挺清晰的,拆成了三步:提取 → 生成 → 增强。

第一步:提取(Extraction)——把场景"拆开"看明白
输入一段普通RGB视频,系统先做深度估计,恢复出三维点云。然后用视觉语言模型(VLM)和分割模型,把场景里的物体一个一个识别、分割出来。
有意思的是它怎么处理遮挡的。每提取一个物体,就用图像修复把它从画面里"擦掉",然后继续找下一个,像剥洋葱一样把场景拆解得明明白白。
第二步:生成(Generation)——搭出数字孪生
对每个提取出来的物体,用2D-to-3D模型生成三维网格,再用FoundationPose之类的模型恢复真实位姿。抽屉、柜门这种有关节的物体,它还能自动推导关节结构。
然后补上质量、摩擦力这些物理属性,生成碰撞模型,修复穿模问题,最后导出成IsaacLab之类物理引擎能直接跑的仿真场景。
到这一步,一个和真实场景几乎一模一样的"数字孪生"就建好了。
第三步:增强(Augmentation)——这才是真正的杀招
SimFoundry最核心的创新其实是"数字表亲"(Digital Cousins)。从三个维度扩展:
物体表亲:换外观换形状,但功能不变。比如马克杯换成玻璃杯,都是"能装液体的杯子"
场景表亲:调整物体布局或者加新东西,生成新场景
任务表亲:根据场景里物体的功能,自动推导出新的机器人操作任务
这一下就把"一段视频=一个场景"的限制打破了。一段真实视频进去,能自动扩展出大量保持相同行为语义的新物体、新场景、新任务。
你想想,以前要给机器人准备多样化训练数据多难,得人工设计各种场景变体。
现在SimFoundry全自动给你生成了,而且生成的都是"有物理意义、功能一致"的变体,不是乱改的。
效果到底怎么样?数据说话
论文里给了几组实验数据,我挑几个最有说服力的:
策略评测:仿真和真实的相关性0.911
这个数字是什么概念?此前最好的方法PolaRiS只有0.314,SimFoundry直接干到了0.911,提升了快三倍。
0.91的皮尔逊相关系数,意味着你在仿真里测出来的策略排名,和真实世界里的排名几乎一致。
这就太重要了——以前大家不敢信仿真结果,怕在仿真里表现好的策略到真机就拉胯。现在SimFoundry可以相对靠谱地预测真实表现,不用每次都上真机测了。
零样本迁移:仿真训练,真机96%成功率
只用SimFoundry生成的仿真数据训练,不看任何真实数据,然后直接放到真实机器人上跑——多步操作任务成功率96%,未见物体的任务也有92%。
这个结果在以前是不敢想的。纯仿真训练能在真实机器人上拿到这么高的成功率,说明仿真环境的保真度已经到了一个新水平。
数字表亲真的有用吗?答案是非常有用
论文做了对比实验:只用数字孪生训练 vs 加上数字表亲一起练。结果是,加了物体表亲平均提升17%,加场景表亲提升21%,加任务表亲直接提升40%。
任务表亲这个40%的提升最有意思。
它说明什么?说明机器人泛化能力的瓶颈,很大程度上是"见过的任务类型太少"。而SimFoundry能自动生成新任务,就从根上解决了这个问题。

对VLA模型的加持:从28%提到46%
还有一组实验,用SimFoundry的数据去微调VLA模型,13个任务的平均成功率从28%干到了46%,几乎翻了一倍。在7个完全没见过的任务上,更是从0%直接拉到了29%。
这就不只是"仿真工具"了,而是VLA模型的数据增强引擎。
这件事背后真正的意义
为什么说SimFoundry重要?它不又是一个"3D重建工具",它的定位完全不一样。
以前大家聊具身智能的数据,主要是两条路:一条是真实世界采集,贵、慢、危险;一条是仿真生成,快、便宜、安全,但建环境成本高、场景多样性不够、sim-to-real gap大。
SimFoundry相当于在两条路之间架了一座桥。
用真实世界的视频当"种子",然后在仿真里无限扩种。既保留了真实世界的物理真实性,又有仿真的可扩展性和低成本。
而且注意它的作者阵容:英伟达GEAR实验室,加上李飞飞团队、佐治亚理工、德州奥斯汀、多伦多大学。这不是什么小团队的试水工作,是这个领域里最顶级的团队一起推的方向。
再结合英伟达近期的一系列动作——Cosmos 3世界模型、GR00T机器人基础模型、Isaac仿真平台、还有前不久ICRA上的8篇论文——你会发现,英伟达正在把具身智能的整条栈都配齐:
基础模型:Cosmos 3(世界模型)+ GR00T(机器人基础模型)
仿真平台:Isaac Sim / Isaac Lab
数据生产:SimFoundry
训练优化:各种策略学习算法
边缘部署:Jetson AGX Thor
SimFoundry补的是"数据生产"这关键一环。有了它,仿真数据不再依赖人工建模,而是可以从真实世界视频里"长"出来,而且越生越多,越生越多样。
说起来具身智能这两年的进展,真的有点像2022年那会儿的大语言模型——基础模型有了,但数据成了最大瓶颈。LLM的爆发离不开互联网上海量的文本数据,机器人呢?真实世界的数据太贵太少了。
SimFoundry这类Real-to-Sim技术,很可能就是具身智能领域的"互联网数据"——用真实世界的种子,在虚拟世界里规模化生产训练数据。
一段视频进去,无限场景出来。
如果这个方向跑通了,机器人训练数据的成本会掉一个数量级,策略迭代的速度会上一个数量级。那时候,具身智能的"GPT时刻"也许就真的不远了。
当然,现在还早。SimFoundry目前也只在桌面级操作场景验证了效果,要扩展到更复杂的人形机器人、工业场景,还有很长的路要走。
但方向这个东西,比速度更重要。
我是觉得,这个方向值得重点盯着。


文章内容均来源于公开信息整理
工作之余随便写写分享,仅代表个人观点
原文标题 : 英伟达又放了个大招:拍一段视频,自动生成机器人训练仿真环境
最新活动更多
扫码关注公众号
发表评论
登录
手机
验证码
手机/邮箱/用户名
密码
立即登录即可访问所有OFweek服务
还不是会员?免费注册
忘记密码其他方式
请输入评论内容...
请输入评论/评论长度6~500个字
暂无评论
暂无评论