关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
最近讨论AI对人工的替代时,好像一直有一个观点是蓝领工人更难被替代,其实这一点我是不大敢苟同的。毕竟生产线上机器人不断替代人工的事情一直是在不断发生的,只是在开放环境和不确认任务中的替代更难一点,但是并非不可能。
这不,李飞飞团队发布了号称具有“具身智能”的机器人控制模型,Voxposer;在开放环境中可以直接用自然语言对机器人下令执行未经训练的任务,看最后的benchmark大概能有70%的成功率。
▶实现步骤:
-首先,使用相机来采集RGB-D图像和自然语言指令,以获取环境信息。
-接下来,利用大型语言模型(LLM)编写代码,并与视觉语言模型(VLM)进行交互生成3D Value Map,即操作指示地图。
-这个3D Value Map包括Affordance Map和Constraint Map,用于标记行动位置和方式。
-然后,使用动作规划器将生成的3D地图作为目标函数合成操作轨迹。
-与传统方法相比较,该方法不需要额外的预训练,并且通过大型模型引导机器人与环境交互解决了数据稀缺问题。
此外,在掌握基本流程后,由于其零样本能力特点,它可以适用于任何给定任务。
▶论文地址:
https://voxposer.github.io/voxposer.pdf
▶项目主页:
https://voxposer.github.io/ (代码施工中)
▶拓展阅读:
https://mp.weixin.qq.com/s/XleXS_5shzZNiOSxUFZfgQ
这不,李飞飞团队发布了号称具有“具身智能”的机器人控制模型,Voxposer;在开放环境中可以直接用自然语言对机器人下令执行未经训练的任务,看最后的benchmark大概能有70%的成功率。
▶实现步骤:
-首先,使用相机来采集RGB-D图像和自然语言指令,以获取环境信息。
-接下来,利用大型语言模型(LLM)编写代码,并与视觉语言模型(VLM)进行交互生成3D Value Map,即操作指示地图。
-这个3D Value Map包括Affordance Map和Constraint Map,用于标记行动位置和方式。
-然后,使用动作规划器将生成的3D地图作为目标函数合成操作轨迹。
-与传统方法相比较,该方法不需要额外的预训练,并且通过大型模型引导机器人与环境交互解决了数据稀缺问题。
此外,在掌握基本流程后,由于其零样本能力特点,它可以适用于任何给定任务。
▶论文地址:
https://voxposer.github.io/voxposer.pdf
▶项目主页:
https://voxposer.github.io/ (代码施工中)
▶拓展阅读:
https://mp.weixin.qq.com/s/XleXS_5shzZNiOSxUFZfgQ