近日,谷歌宣布推出两款全新的机器人模型 —— Gemini Robotics 1.5 和 Gemini Robotics-ER 1.5,在机器人智能化和通用性上实现了重要突破。
两款模型将通过先进的思维来解锁智能体验:
Gemini Robotics 1.5 – 视觉-语言-动作 (VLA) 模型能够将视觉信息和指令转化为机器人执行任务的运动指令。该模型在采取行动之前会进行思考,并展示其执行过程,帮助机器人更清晰地评估和完成复杂任务。它还能迁移学习,加速技能学习。
Gemini Robotics-ER 1.5 – 视觉语言模型 (VLM) 能够推理物理世界,原生调用数字工具,并创建详细的多步骤计划来完成任务。该模型目前在空间理解基准测试中达到了最佳性能。
为物理任务解锁 Agent 新体验
如今,大多数日常任务都需要上下文信息和多个步骤才能完成,这对于当今的机器人来说极具挑战性。
今年早些时候,谷歌已将 Gemini 的多模态理解能力应用到机器人领域,推动机器人能感知、思考、计划和执行复杂任务。此次发布的新模型进一步提升了这一能力。
Gemini Robotics-ER 1.5 能够像高级大脑一样协调机器人的活动。该模型擅长在物理环境中进行规划和做出逻辑决策。它拥有先进的空间理解能力,能够以自然语言进行交互,预估机器人的成功率和进度,并且能够原生调用 Google 搜索等工具来查找信息或使用任何第三方用户定义的函数。
除此之外,Gemini Robotics-ER 1.5 会为每个步骤提供自然语言指令,然后由 Gemini Robotics 1.5 利用其视觉和语言理解能力直接执行具体操作。它还能帮助机器人思考其动作,从而更好地解决语义复杂的任务,甚至可以用自然语言解释其思考过程,使其决策更加透明。
Gemini Robotics 1.5 和 Gemini Robotics-ER 1.5 均基于核心 Gemini 模型系列构建,并已使用不同的数据集进行微调,以专注于各自的任务。结合使用时,它们可以提升机器人泛化能力,使其能够处理更长的任务和更多样化的环境。
学术测试中达到最佳性能
团队对 Gemini Robotics-ER 1.5 在包括具身推理问答 (ERQA) 和 Point-Bench 在内的 15 个学术基准进行了评估,衡量该模型在指点、图像问答和视频问答方面的表现。
评估结果显示,Gemini Robotics-ER 1.5在 15 个学术体现推理基准测试中取得了最高的综合性能,超过 ChatGPT-5、ChatGPT-5-mini。
Gemini Robotics-ER 1.5 展示了包括物体检测和状态估计、分割掩码、指向、轨迹预测和任务进度估计和成功检测。
学习能力优越
Gemini Robotics 1.5 不仅可以简单地翻译指令或计划,现在还可以在采取行动之前进行思考。这意味着它可以生成自然语言的内部推理和分析序列,以执行需要多个步骤或更深入的语义理解的任务。
在这个多层次的思考过程中,视觉-语言-动作模型可以决定将较长的任务转换为机器人能够成功执行的更简单的短片段。它还能帮助模型泛化以解决新任务,并使其对环境变化更具鲁棒性。
Gemini Robotics 1.5 还展现出卓越的迁移学习能力。它能够将从一个机器人学到的动作迁移到另一个机器人,而无需针对每个新实例专门定制模型。这一突破加速了新行为的学习,帮助机器人变得更加智能、更加实用。
通过引入代理功能,Gemini Robotics 1.5 超越了仅响应命令的模型,创建了真正能够推理、规划、主动使用工具并进行泛化的系统。
谷歌将通过 Google AI Studio 中的 Gemini API 向开发者提供 Gemini Robotics-ER 1.5。更多有关使用下一代物理代理进行构建的信息,请访问开发者博客:
https://developers.googleblog.com/en/building-the-next-generation-of-physical-agents-with-gemini-robotics-er-15/
参考资料:https://deepmind.google/discover/blog/gemini-robotics-15-brings-ai-agents-into-the-physical-world/
发表评论
登录
手机
验证码
手机/邮箱/用户名
密码
立即登录即可访问所有OFweek服务
还不是会员?免费注册
忘记密码其他方式
请输入评论内容...
请输入评论/评论长度6~500个字
暂无评论
暂无评论