关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
对 agent 的一个暴论:现有 (multi) agent workflow 的模式没有太大价值。Agent 今年(在以吴恩达老师为首的各类大佬的吹捧下)热度很高,但现有的这些所谓的 (multi) agent workflow,本质上是把一个大任务拆分成很多个子任务,每个子任务都有明确的 input 和 output,自己定义一些变量和接口,把这些子任务串起来。这种方式很像是早期的自动驾驶,把感知和规控分开解,或者是上一代的语音助手,把语音转文字、LLM、语音合成这些工作流串起来。
终极的解决方案应该不是这个样子的。现有的 (multi) agent workflow,速度慢先不说,最大的问题还是在接口的地方把信息降维了。这些 input / output 的接口和变量,本质上都是把信息降维到人能理解的维度,这是以高维信息的损失为代价的。每多一层 workflow,损失的信息就多了一次。面对简单问题时, (multi) agent workflow 或许是可行的,但它注定无法解决复杂问题。就好比Waymo 用感知+规控的架构,搭配高精地图,能够在凤凰城和三藩市勉强把本地 L4 跑通,但很难 scale 成一个通用的解法。只有 Tesla 端到端的方案才是自动驾驶的未来。
因此,现有的 (multi) agent workflow方式注定只是一个中间状态,类似自动驾驶中感知+规控+高精地图的拼凑。而最终想要解决复杂问题,需要靠基础模型的进化。当模型能力足够强之后,应该是可以端到端的解决问题。你可以在 prompt 里提示它去使用某些工具,或者采用某些步骤,但应该不需要人为去把 workflow 拆出来。
Agent 的概念依旧重要,但应该回归它更加 native 的定义,即每一个 Agent 应该是独立的智能体,拥有自己的 memory, planning, tool use 等能力,能够端到端地解决问题,而不是需要人类按照自己的理解一口口地把饭喂到嘴里。一个 Agent 就应该是一辆独立的L5 Autopilot 的汽车,而不是一堆弱智 L2 Workflow 凑出来的所谓 multi agents 辅助驾驶杂牌军团。这听起来就很不优雅。
终极的解决方案应该不是这个样子的。现有的 (multi) agent workflow,速度慢先不说,最大的问题还是在接口的地方把信息降维了。这些 input / output 的接口和变量,本质上都是把信息降维到人能理解的维度,这是以高维信息的损失为代价的。每多一层 workflow,损失的信息就多了一次。面对简单问题时, (multi) agent workflow 或许是可行的,但它注定无法解决复杂问题。就好比Waymo 用感知+规控的架构,搭配高精地图,能够在凤凰城和三藩市勉强把本地 L4 跑通,但很难 scale 成一个通用的解法。只有 Tesla 端到端的方案才是自动驾驶的未来。
因此,现有的 (multi) agent workflow方式注定只是一个中间状态,类似自动驾驶中感知+规控+高精地图的拼凑。而最终想要解决复杂问题,需要靠基础模型的进化。当模型能力足够强之后,应该是可以端到端的解决问题。你可以在 prompt 里提示它去使用某些工具,或者采用某些步骤,但应该不需要人为去把 workflow 拆出来。
Agent 的概念依旧重要,但应该回归它更加 native 的定义,即每一个 Agent 应该是独立的智能体,拥有自己的 memory, planning, tool use 等能力,能够端到端地解决问题,而不是需要人类按照自己的理解一口口地把饭喂到嘴里。一个 Agent 就应该是一辆独立的L5 Autopilot 的汽车,而不是一堆弱智 L2 Workflow 凑出来的所谓 multi agents 辅助驾驶杂牌军团。这听起来就很不优雅。
OpenAI 很鸡贼,提前一天开发布会,让 Google I/O 的气势弱了很多。再加上 Ilya 的官宣离职又分走了不少流量。果然今早一早起来,媒体的报道和用户的关注相比昨天要少得多。
但实际上,个人觉得 Google I/O 还是有不少看点。最大的感觉是:Google 在AI 发展的进度上真正追平了 OpenAI。无论是音视频实时助手,还是视频生成,基本上都能够和 OpenAI 同步发布,效果类似(当然 Veo 比Sora晚了三个月,效果看起来还是要稍逊)。甚至 Gemini 1.5 Pro 的 2 million 窗口,LLM 与 Google 原生搜索的结合,以及与智能眼镜等硬件的集成,相比 OpenAI 来说还要更领先一些。整体上,感觉 Google 这头巨兽算是彻底醒过来了,开始处于某种进攻的态势。(当然,实际全面发布时间是个问题。The Information 说 Google 现在在 AI 上的风格是先立牌坊,然后慢慢挤牙膏兑现。)
Google 的这个多模态助手 Astra,尽管在语音的表现力上不如昨天的 ChatGPT,情绪没有那么丰满和 dramatic,但是在延迟响应、实时语义理解上是不输的,尤其是还结合了记忆,感觉上甚至更加实用。
相比之下,OpenAI 昨天的发布会,以及最近的一系列动作,比如传说中和苹果合作,似乎都有“提升用户体验,进而拼命扩大用户量”的感觉,不知道是不是切身感受到了 Google 的威胁,在战略上做出的选择。或许 OpenAI 已经意识到了,单单靠自己很难跨越鸿沟,GPTs 的失败就是例子。
当然,Google 也有自己的问题,当下最大的风险就是如何应对 LLM 在搜索结果中带来的商业化挑战。发布会上,搜索的第一条结果换成了 LLM 的结果,体验上看似变好了,但对商业化的影响是巨大的。这种左右互搏,处理不好就会是自掘坟墓,处理好了就会迎来第二曲线。至少从股价来看,感觉华尔街对于这次 I/O 的故事并不是非常 buy in,还在继续观察。
但实际上,个人觉得 Google I/O 还是有不少看点。最大的感觉是:Google 在AI 发展的进度上真正追平了 OpenAI。无论是音视频实时助手,还是视频生成,基本上都能够和 OpenAI 同步发布,效果类似(当然 Veo 比Sora晚了三个月,效果看起来还是要稍逊)。甚至 Gemini 1.5 Pro 的 2 million 窗口,LLM 与 Google 原生搜索的结合,以及与智能眼镜等硬件的集成,相比 OpenAI 来说还要更领先一些。整体上,感觉 Google 这头巨兽算是彻底醒过来了,开始处于某种进攻的态势。(当然,实际全面发布时间是个问题。The Information 说 Google 现在在 AI 上的风格是先立牌坊,然后慢慢挤牙膏兑现。)
Google 的这个多模态助手 Astra,尽管在语音的表现力上不如昨天的 ChatGPT,情绪没有那么丰满和 dramatic,但是在延迟响应、实时语义理解上是不输的,尤其是还结合了记忆,感觉上甚至更加实用。
相比之下,OpenAI 昨天的发布会,以及最近的一系列动作,比如传说中和苹果合作,似乎都有“提升用户体验,进而拼命扩大用户量”的感觉,不知道是不是切身感受到了 Google 的威胁,在战略上做出的选择。或许 OpenAI 已经意识到了,单单靠自己很难跨越鸿沟,GPTs 的失败就是例子。
当然,Google 也有自己的问题,当下最大的风险就是如何应对 LLM 在搜索结果中带来的商业化挑战。发布会上,搜索的第一条结果换成了 LLM 的结果,体验上看似变好了,但对商业化的影响是巨大的。这种左右互搏,处理不好就会是自掘坟墓,处理好了就会迎来第二曲线。至少从股价来看,感觉华尔街对于这次 I/O 的故事并不是非常 buy in,还在继续观察。
尝试了一下,Wegic 这个 AI 网页生成工具也太好了。
通过对话来生成和修改页面门槛确实低了很多。整体网站设计和 IP 都太好了。 IP 尤其可爱。
而且生成的网站从内容和美观度上都很好,内容也很丰富。如果补齐一下能力的话可能是 Framer 一个很强力的对手。
这里尝试:https://wegic.ai/
通过对话来生成和修改页面门槛确实低了很多。整体网站设计和 IP 都太好了。 IP 尤其可爱。
而且生成的网站从内容和美观度上都很好,内容也很丰富。如果补齐一下能力的话可能是 Framer 一个很强力的对手。
这里尝试:https://wegic.ai/
关于【宇树】新出的机器人unitree G1
有两个比较吸引人的点,完成度相对较高和相对较低的价格
1. 先说最大的差别,就是腿是不是反弓,人形机器人的腿有两种不同的形式,一种是鸵鸟腿,一种是人腿。宇树在自己的H1产品中就使用了人腿形的机器人。
2. 反弓最大的优势是在电机的集成度上,也就是可以把电机最大程度的集约到核心区域。这样对于电机的性能要求会有所降低。
3. 但是宇树的核心就在于电机的性能和性价比很不错。
4. 所以这也是机器人公司的盈利手段,人形机器人相比于真的有什么产品力而言。卖电机的收益也不会小。
5. 很多人会觉得这样的机器人如果会做饭用在家里还是不错的,但是我们主要到宇树最后的小字,不要靠的太近,这也是刚体机器人的一个重要安全隐患,电机容易抽搐和发疯,随时随地给你来一个地板动作也不是不可能。
6. 所以具身智能(人形机器人),的投资大头还是我们熟悉的汽车产业。
7. 机械臂的大规模发展,资金就是来源于汽车产业。而现在的机器人学,基本上是建立在机械臂的基础上的。所以与其说咱看到一个两条腿,两个胳膊的机器人,不如说是四条机械臂连在一起(划掉)
8. 最后一个不成熟地展望,具身智能,会成为载人航天,尤其是载人登月,的先驱。相比于地球的环境,月球的低重力环境,和比较严酷的环境,更加适合机器人选手。
有两个比较吸引人的点,完成度相对较高和相对较低的价格
1. 先说最大的差别,就是腿是不是反弓,人形机器人的腿有两种不同的形式,一种是鸵鸟腿,一种是人腿。宇树在自己的H1产品中就使用了人腿形的机器人。
2. 反弓最大的优势是在电机的集成度上,也就是可以把电机最大程度的集约到核心区域。这样对于电机的性能要求会有所降低。
3. 但是宇树的核心就在于电机的性能和性价比很不错。
4. 所以这也是机器人公司的盈利手段,人形机器人相比于真的有什么产品力而言。卖电机的收益也不会小。
5. 很多人会觉得这样的机器人如果会做饭用在家里还是不错的,但是我们主要到宇树最后的小字,不要靠的太近,这也是刚体机器人的一个重要安全隐患,电机容易抽搐和发疯,随时随地给你来一个地板动作也不是不可能。
6. 所以具身智能(人形机器人),的投资大头还是我们熟悉的汽车产业。
7. 机械臂的大规模发展,资金就是来源于汽车产业。而现在的机器人学,基本上是建立在机械臂的基础上的。所以与其说咱看到一个两条腿,两个胳膊的机器人,不如说是四条机械臂连在一起(划掉)
8. 最后一个不成熟地展望,具身智能,会成为载人航天,尤其是载人登月,的先驱。相比于地球的环境,月球的低重力环境,和比较严酷的环境,更加适合机器人选手。
抖音“午夜狂暴哈士奇狗”这个小姐姐一直在发跟 ChatGPT 谈赛博恋爱的视频。
比如这个跟 ChatGPT 去海边约会,上个版本 GPT 还无法看到他看到的海边的景色,没办法看到她专门化了妆。
但这个版本她应该可以完全把 GPT 当成异地恋的男友约会了。配合新的情绪识别和面部表情识别,都不敢想有多强。
比如这个跟 ChatGPT 去海边约会,上个版本 GPT 还无法看到他看到的海边的景色,没办法看到她专门化了妆。
但这个版本她应该可以完全把 GPT 当成异地恋的男友约会了。配合新的情绪识别和面部表情识别,都不敢想有多强。
我身边唯一一个在OpenAI工作的同学,是个女生,北京四中的,跟我一样都是北京人考到复旦的,大学就在我隔壁寝室楼。
对她的印象一直就是安安静静的,笑容不多,也常听别人说她不好相处、性格阴郁、傲慢。有一次一起坐校车聊起来,她说她是高考失利才来的复旦,这对她是很大的打击。
你知道我这种大水货考生第一反应是,“啊?复旦还不满意啊?挺好的了!不就只比清北差吗?”
后来的日子里听说她大三就转到美国本科去了,在社交媒体上慢慢了解她也有个学CS的哥哥,目前的作品水准也是探索人类边界那种level。看着她毕业之后去了Meta,前一阵说离开了Meta,我还想说什么公司能吸引她这样的女生加入?再一看是OpenAI。
更高兴的是前一阵看她还冻了卵,也分享了很多作为女性和准母亲的体验。
在今天这个日子里想默默祝福她。
你做到了,世界的舞台是属于你的。
对她的印象一直就是安安静静的,笑容不多,也常听别人说她不好相处、性格阴郁、傲慢。有一次一起坐校车聊起来,她说她是高考失利才来的复旦,这对她是很大的打击。
你知道我这种大水货考生第一反应是,“啊?复旦还不满意啊?挺好的了!不就只比清北差吗?”
后来的日子里听说她大三就转到美国本科去了,在社交媒体上慢慢了解她也有个学CS的哥哥,目前的作品水准也是探索人类边界那种level。看着她毕业之后去了Meta,前一阵说离开了Meta,我还想说什么公司能吸引她这样的女生加入?再一看是OpenAI。
更高兴的是前一阵看她还冻了卵,也分享了很多作为女性和准母亲的体验。
在今天这个日子里想默默祝福她。
你做到了,世界的舞台是属于你的。
但是公司的 Mac 是因特尔的没办法启动,各位可以M 系列的可以试试能不呢启动,这个是从官方下的。
链接: https://pan.baidu.com/s/1gs5twNMxtKE9BuYCVMYxyg?pwd=m3ua 提取码: m3ua
OpenAI春季发布会结束,快速记录下我看到的和理解的更新,首先总的来说,去年3月份OpenAI是发布了惊艳世界的GPT-4,但这次,他们不是发布一个更强大的模型,而是做了很多工程优化,把产品做得更好用,更容易和生活、工作结合了。具体来说,更新包括:
1. 新发布GPT-4o模型,这是个比GPT-4快100%以上的模型,对免费用户开放,后续免费用户也可获得GPTs、browring、图像理解、代码解释器等原本只有Plus付费用户才具有的功能;
2. 发布ChatGPT电脑客户端,这个客户端也可用语音对话,并且也非常快捷地通过复制、分享电脑屏幕等方式让ChatGPT进入到你正在处理的任务语境中去,可以认为ChatGPT成为了一个你工作全局的copilot,辅助excel、ppt、写代码等都不再话下(老罗圆梦);
3. 语音能力升级,不再需要等待几秒再获得回复,实时性超强,可以随时打断,而且不是简单的语音转文字的处理模式,能理解语气、语调,充当有情感的对话助手,以及作为实时的同声传译都毫无问题(我想到了《Her》)
4. 可在使用语音对话的同时,开启摄像头,让ChatGPT实时看到你所在的环境以及你看到的信息,这种可用性的提升能增加大量的使用场景,比如提供教学、博物馆导览、辅助视障人士等等,不过从测试细节看,这也并不是一个有视频理解能力的多模态模型,而是通过每隔几秒钟自动截图让ChatGPT理解的方式实现的。
整体来说就是,没有更强的模型,但是大量的工程优化会让ChatGPT能进入更多人的生活,帮助现有用户完成更多场景的任务,又有一堆AI应用公司难免了。
1. 新发布GPT-4o模型,这是个比GPT-4快100%以上的模型,对免费用户开放,后续免费用户也可获得GPTs、browring、图像理解、代码解释器等原本只有Plus付费用户才具有的功能;
2. 发布ChatGPT电脑客户端,这个客户端也可用语音对话,并且也非常快捷地通过复制、分享电脑屏幕等方式让ChatGPT进入到你正在处理的任务语境中去,可以认为ChatGPT成为了一个你工作全局的copilot,辅助excel、ppt、写代码等都不再话下(老罗圆梦);
3. 语音能力升级,不再需要等待几秒再获得回复,实时性超强,可以随时打断,而且不是简单的语音转文字的处理模式,能理解语气、语调,充当有情感的对话助手,以及作为实时的同声传译都毫无问题(我想到了《Her》)
4. 可在使用语音对话的同时,开启摄像头,让ChatGPT实时看到你所在的环境以及你看到的信息,这种可用性的提升能增加大量的使用场景,比如提供教学、博物馆导览、辅助视障人士等等,不过从测试细节看,这也并不是一个有视频理解能力的多模态模型,而是通过每隔几秒钟自动截图让ChatGPT理解的方式实现的。
整体来说就是,没有更强的模型,但是大量的工程优化会让ChatGPT能进入更多人的生活,帮助现有用户完成更多场景的任务,又有一堆AI应用公司难免了。