工具介绍
功能:GO-1 是一个视觉-语言-动作模型,能够根据多视角图像、语言指令和机器人状态预测精确的动作序列,适用于各种机器人操控任务,如抓取、放置和复杂操作。
特色:采用创新的 ViLLA 架构,引入隐式动作标记来弥合语义鸿沟;基于 InternVL-2B 构建多模态理解层;支持长时序规划和复杂任务;开源且兼容 LeRobot 数据格式,便于微调和部署。
适用人群:适合人工智能研究人员、机器人工程师、学术机构以及任何对具身智能和机器人学习感兴趣的开发者。
价格说明:GO-1 是完全开源免费的模型,遵循 CC BY-NC-SA 4.0 许可证,用户可以自由下载、使用和修改,但需遵守非商业性使用条款。