关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
最近讨论AI对人工的替代时,好像一直有一个观点是蓝领工人更难被替代,其实这一点我是不大敢苟同的。毕竟生产线上机器人不断替代人工的事情一直是在不断发生的,只是在开放环境和不确认任务中的替代更难一点,但是并非不可能。
这不,李飞飞团队发布了号称具有“具身智能”的机器人控制模型,Voxposer;在开放环境中可以直接用自然语言对机器人下令执行未经训练的任务,看最后的benchmark大概能有70%的成功率。
▶实现步骤:
-首先,使用相机来采集RGB-D图像和自然语言指令,以获取环境信息。
-接下来,利用大型语言模型(LLM)编写代码,并与视觉语言模型(VLM)进行交互生成3D Value Map,即操作指示地图。
-这个3D Value Map包括Affordance Map和Constraint Map,用于标记行动位置和方式。
-然后,使用动作规划器将生成的3D地图作为目标函数合成操作轨迹。
-与传统方法相比较,该方法不需要额外的预训练,并且通过大型模型引导机器人与环境交互解决了数据稀缺问题。
此外,在掌握基本流程后,由于其零样本能力特点,它可以适用于任何给定任务。
▶论文地址:
https://voxposer.github.io/voxposer.pdf
▶项目主页:
https://voxposer.github.io/ (代码施工中)
▶拓展阅读:
https://mp.weixin.qq.com/s/XleXS_5shzZNiOSxUFZfgQ
这不,李飞飞团队发布了号称具有“具身智能”的机器人控制模型,Voxposer;在开放环境中可以直接用自然语言对机器人下令执行未经训练的任务,看最后的benchmark大概能有70%的成功率。
▶实现步骤:
-首先,使用相机来采集RGB-D图像和自然语言指令,以获取环境信息。
-接下来,利用大型语言模型(LLM)编写代码,并与视觉语言模型(VLM)进行交互生成3D Value Map,即操作指示地图。
-这个3D Value Map包括Affordance Map和Constraint Map,用于标记行动位置和方式。
-然后,使用动作规划器将生成的3D地图作为目标函数合成操作轨迹。
-与传统方法相比较,该方法不需要额外的预训练,并且通过大型模型引导机器人与环境交互解决了数据稀缺问题。
此外,在掌握基本流程后,由于其零样本能力特点,它可以适用于任何给定任务。
▶论文地址:
https://voxposer.github.io/voxposer.pdf
▶项目主页:
https://voxposer.github.io/ (代码施工中)
▶拓展阅读:
https://mp.weixin.qq.com/s/XleXS_5shzZNiOSxUFZfgQ
总体而言,模型会更注意开头的文本
准确性方面,有时上下文更长的Claude100k表现不如 ChatGPT16k
利用ChatDoc/ChatPDF 来获取信息并帮助模型筛选信息块、或重新排序信息块也能提升效果
最后,价格高贵的GPT4效果拔群😂
https://arxiv.org/pdf/2307.03172.pdf https://t.co/oL91J2TVAm
和其他图像普遍使用的扩散型模型不同,CM3Leon基于Transformer,使其计算和训练都更为高效。
最大的模型有 70 亿个参数,2倍于 Dalle2。
通过指令调优,还支持通过文本编辑图像。
https://ai.meta.com/blog/generative-ai-text-images-cm3leon/ https://t.co/HKMj1CIJDF
和Claude 2 进行专业性对话, 大致关于某类新产品的市场前景、竞争格局(主要玩家、里程碑、SWOT等数据分析),陆续跨越了数个小时,持续深度对话。感觉十分美妙~
简直如同和10个优秀的产品实习生(+联网能力)交流,高价值内容实在太多,心流不断涌现;当然,认知带宽的压力明显给到了人类这一边。
(其中一个比GPT-4 的优势开始明晰起来,Claude 2 的数据是截止2023年初的,商业方面的「洞见」常常会挺不一样)
简直如同和10个优秀的产品实习生(+联网能力)交流,高价值内容实在太多,心流不断涌现;当然,认知带宽的压力明显给到了人类这一边。
(其中一个比GPT-4 的优势开始明晰起来,Claude 2 的数据是截止2023年初的,商业方面的「洞见」常常会挺不一样)