订阅
    纠错
    加入自媒体

    英伟达又放了个大招:拍一段视频,自动生成机器人训练仿真环境

    2026-07-06 10:52
    思维AI社
    关注

    这是思维AI社的第83篇原创

    全文约2380字,阅读时长预计8分钟

    6月底,具身智能圈有篇论文挺炸的,英伟达GEAR实验室联合斯坦福、佐治亚理工放出来一个叫SimFoundry的东西。

    我看完第一反应是——机器人训练数据的生产方式,可能要变天了。

    先给你说清楚它到底能干啥

    一句话:给它一段真实世界的视频,它自动给你生成一个能交互、能训练、能评测的机器人仿真环境。

    不是那种3D重建完只能看的模型,是正儿八经能跑物理引擎、能放机器人进去做任务、甚至能无限生成新场景的"活环境"。

    你品品这个事的分量。

    以前做机器人仿真,一个场景得美术+技术美术+物理工程师折腾好几天甚至几周,才能搞出一个能用的仿真环境。

    现在呢?拿手机拍一段视频,扔进去,等一会儿,出来一个完整的、物理正确的、能交互的仿真场景。

    成本从"周"直接降到"分钟"。

    而且更狠的是,它不只是重建一个一模一样的场景,还能自动生成"数字表亲"——就是保持功能不变,但物体外观、布局、任务都换了的新场景。

    换句话说,一段视频进去,不是出来一个场景,而是出来几乎无限多的训练场景。

    这就不是"省人力"了,这是把数据生产的底层逻辑给换了。

    它是怎么做到的?三阶段流水线

    SimFoundry的思路其实挺清晰的,拆成了三步:提取 → 生成 → 增强。

    第一步:提取(Extraction)——把场景"拆开"看明白

    输入一段普通RGB视频,系统先做深度估计,恢复出三维点云。然后用视觉语言模型(VLM)和分割模型,把场景里的物体一个一个识别、分割出来。

    有意思的是它怎么处理遮挡的。每提取一个物体,就用图像修复把它从画面里"擦掉",然后继续找下一个,像剥洋葱一样把场景拆解得明明白白。

    第二步:生成(Generation)——搭出数字孪生

    对每个提取出来的物体,用2D-to-3D模型生成三维网格,再用FoundationPose之类的模型恢复真实位姿。抽屉、柜门这种有关节的物体,它还能自动推导关节结构。

    然后补上质量、摩擦力这些物理属性,生成碰撞模型,修复穿模问题,最后导出成IsaacLab之类物理引擎能直接跑的仿真场景。

    到这一步,一个和真实场景几乎一模一样的"数字孪生"就建好了。

    第三步:增强(Augmentation)——这才是真正的杀招

    SimFoundry最核心的创新其实是"数字表亲"(Digital Cousins)。从三个维度扩展:

    物体表亲:换外观换形状,但功能不变。比如马克杯换成玻璃杯,都是"能装液体的杯子"

    场景表亲:调整物体布局或者加新东西,生成新场景

    任务表亲:根据场景里物体的功能,自动推导出新的机器人操作任务

    这一下就把"一段视频=一个场景"的限制打破了。一段真实视频进去,能自动扩展出大量保持相同行为语义的新物体、新场景、新任务。

    你想想,以前要给机器人准备多样化训练数据多难,得人工设计各种场景变体。

    现在SimFoundry全自动给你生成了,而且生成的都是"有物理意义、功能一致"的变体,不是乱改的。

    效果到底怎么样?数据说话

    论文里给了几组实验数据,我挑几个最有说服力的:

    策略评测:仿真和真实的相关性0.911

    这个数字是什么概念?此前最好的方法PolaRiS只有0.314,SimFoundry直接干到了0.911,提升了快三倍。

    0.91的皮尔逊相关系数,意味着你在仿真里测出来的策略排名,和真实世界里的排名几乎一致。

    这就太重要了——以前大家不敢信仿真结果,怕在仿真里表现好的策略到真机就拉胯。现在SimFoundry可以相对靠谱地预测真实表现,不用每次都上真机测了。

    零样本迁移:仿真训练,真机96%成功率

    只用SimFoundry生成的仿真数据训练,不看任何真实数据,然后直接放到真实机器人上跑——多步操作任务成功率96%,未见物体的任务也有92%。

    这个结果在以前是不敢想的。纯仿真训练能在真实机器人上拿到这么高的成功率,说明仿真环境的保真度已经到了一个新水平。

    数字表亲真的有用吗?答案是非常有用

    论文做了对比实验:只用数字孪生训练 vs 加上数字表亲一起练。结果是,加了物体表亲平均提升17%,加场景表亲提升21%,加任务表亲直接提升40%。

    任务表亲这个40%的提升最有意思。

    它说明什么?说明机器人泛化能力的瓶颈,很大程度上是"见过的任务类型太少"。而SimFoundry能自动生成新任务,就从根上解决了这个问题。

    对VLA模型的加持:从28%提到46%

    还有一组实验,用SimFoundry的数据去微调VLA模型,13个任务的平均成功率从28%干到了46%,几乎翻了一倍。在7个完全没见过的任务上,更是从0%直接拉到了29%。

    这就不只是"仿真工具"了,而是VLA模型的数据增强引擎。

    这件事背后真正的意义

    为什么说SimFoundry重要?它不又是一个"3D重建工具",它的定位完全不一样。

    以前大家聊具身智能的数据,主要是两条路:一条是真实世界采集,贵、慢、危险;一条是仿真生成,快、便宜、安全,但建环境成本高、场景多样性不够、sim-to-real gap大。

    SimFoundry相当于在两条路之间架了一座桥。

    用真实世界的视频当"种子",然后在仿真里无限扩种。既保留了真实世界的物理真实性,又有仿真的可扩展性和低成本。

    而且注意它的作者阵容:英伟达GEAR实验室,加上李飞飞团队、佐治亚理工、德州奥斯汀、多伦多大学。这不是什么小团队的试水工作,是这个领域里最顶级的团队一起推的方向。

    再结合英伟达近期的一系列动作——Cosmos 3世界模型、GR00T机器人基础模型、Isaac仿真平台、还有前不久ICRA上的8篇论文——你会发现,英伟达正在把具身智能的整条栈都配齐:

    基础模型:Cosmos 3(世界模型)+ GR00T(机器人基础模型)

    仿真平台:Isaac Sim / Isaac Lab

    数据生产:SimFoundry

    训练优化:各种策略学习算法

    边缘部署:Jetson AGX Thor

    SimFoundry补的是"数据生产"这关键一环。有了它,仿真数据不再依赖人工建模,而是可以从真实世界视频里"长"出来,而且越生越多,越生越多样。

    说起来具身智能这两年的进展,真的有点像2022年那会儿的大语言模型——基础模型有了,但数据成了最大瓶颈。LLM的爆发离不开互联网上海量的文本数据,机器人呢?真实世界的数据太贵太少了。

    SimFoundry这类Real-to-Sim技术,很可能就是具身智能领域的"互联网数据"——用真实世界的种子,在虚拟世界里规模化生产训练数据。

    一段视频进去,无限场景出来。

    如果这个方向跑通了,机器人训练数据的成本会掉一个数量级,策略迭代的速度会上一个数量级。那时候,具身智能的"GPT时刻"也许就真的不远了。

    当然,现在还早。SimFoundry目前也只在桌面级操作场景验证了效果,要扩展到更复杂的人形机器人、工业场景,还有很长的路要走。

    但方向这个东西,比速度更重要。

    我是觉得,这个方向值得重点盯着。

    图片

    文章内容均来源于公开信息整理

    工作之余随便写写分享,仅代表个人观点

           原文标题 : 英伟达又放了个大招:拍一段视频,自动生成机器人训练仿真环境

    声明: 本文由入驻维科号的作者撰写,观点仅代表作者本人,不代表OFweek立场。如有侵权或其他问题,请联系举报。

    发表评论

    0条评论,0人参与

    请输入评论内容...

    请输入评论/评论长度6~500个字

    您提交的评论过于频繁,请输入验证码继续

    暂无评论

    暂无评论

      人工智能 猎头职位 更多
      扫码关注公众号
      OFweek人工智能网
      获取更多精彩内容
      文章纠错
      x
      *文字标题:
      *纠错内容:
      联系邮箱:
      *验 证 码:

      粤公网安备 44030502002758号