关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
对 agent 的一个暴论:现有 (multi) agent workflow 的模式没有太大价值。Agent 今年(在以吴恩达老师为首的各类大佬的吹捧下)热度很高,但现有的这些所谓的 (multi) agent workflow,本质上是把一个大任务拆分成很多个子任务,每个子任务都有明确的 input 和 output,自己定义一些变量和接口,把这些子任务串起来。这种方式很像是早期的自动驾驶,把感知和规控分开解,或者是上一代的语音助手,把语音转文字、LLM、语音合成这些工作流串起来。
终极的解决方案应该不是这个样子的。现有的 (multi) agent workflow,速度慢先不说,最大的问题还是在接口的地方把信息降维了。这些 input / output 的接口和变量,本质上都是把信息降维到人能理解的维度,这是以高维信息的损失为代价的。每多一层 workflow,损失的信息就多了一次。面对简单问题时, (multi) agent workflow 或许是可行的,但它注定无法解决复杂问题。就好比Waymo 用感知+规控的架构,搭配高精地图,能够在凤凰城和三藩市勉强把本地 L4 跑通,但很难 scale 成一个通用的解法。只有 Tesla 端到端的方案才是自动驾驶的未来。
因此,现有的 (multi) agent workflow方式注定只是一个中间状态,类似自动驾驶中感知+规控+高精地图的拼凑。而最终想要解决复杂问题,需要靠基础模型的进化。当模型能力足够强之后,应该是可以端到端的解决问题。你可以在 prompt 里提示它去使用某些工具,或者采用某些步骤,但应该不需要人为去把 workflow 拆出来。
Agent 的概念依旧重要,但应该回归它更加 native 的定义,即每一个 Agent 应该是独立的智能体,拥有自己的 memory, planning, tool use 等能力,能够端到端地解决问题,而不是需要人类按照自己的理解一口口地把饭喂到嘴里。一个 Agent 就应该是一辆独立的L5 Autopilot 的汽车,而不是一堆弱智 L2 Workflow 凑出来的所谓 multi agents 辅助驾驶杂牌军团。这听起来就很不优雅。
终极的解决方案应该不是这个样子的。现有的 (multi) agent workflow,速度慢先不说,最大的问题还是在接口的地方把信息降维了。这些 input / output 的接口和变量,本质上都是把信息降维到人能理解的维度,这是以高维信息的损失为代价的。每多一层 workflow,损失的信息就多了一次。面对简单问题时, (multi) agent workflow 或许是可行的,但它注定无法解决复杂问题。就好比Waymo 用感知+规控的架构,搭配高精地图,能够在凤凰城和三藩市勉强把本地 L4 跑通,但很难 scale 成一个通用的解法。只有 Tesla 端到端的方案才是自动驾驶的未来。
因此,现有的 (multi) agent workflow方式注定只是一个中间状态,类似自动驾驶中感知+规控+高精地图的拼凑。而最终想要解决复杂问题,需要靠基础模型的进化。当模型能力足够强之后,应该是可以端到端的解决问题。你可以在 prompt 里提示它去使用某些工具,或者采用某些步骤,但应该不需要人为去把 workflow 拆出来。
Agent 的概念依旧重要,但应该回归它更加 native 的定义,即每一个 Agent 应该是独立的智能体,拥有自己的 memory, planning, tool use 等能力,能够端到端地解决问题,而不是需要人类按照自己的理解一口口地把饭喂到嘴里。一个 Agent 就应该是一辆独立的L5 Autopilot 的汽车,而不是一堆弱智 L2 Workflow 凑出来的所谓 multi agents 辅助驾驶杂牌军团。这听起来就很不优雅。
OpenAI 很鸡贼,提前一天开发布会,让 Google I/O 的气势弱了很多。再加上 Ilya 的官宣离职又分走了不少流量。果然今早一早起来,媒体的报道和用户的关注相比昨天要少得多。
但实际上,个人觉得 Google I/O 还是有不少看点。最大的感觉是:Google 在AI 发展的进度上真正追平了 OpenAI。无论是音视频实时助手,还是视频生成,基本上都能够和 OpenAI 同步发布,效果类似(当然 Veo 比Sora晚了三个月,效果看起来还是要稍逊)。甚至 Gemini 1.5 Pro 的 2 million 窗口,LLM 与 Google 原生搜索的结合,以及与智能眼镜等硬件的集成,相比 OpenAI 来说还要更领先一些。整体上,感觉 Google 这头巨兽算是彻底醒过来了,开始处于某种进攻的态势。(当然,实际全面发布时间是个问题。The Information 说 Google 现在在 AI 上的风格是先立牌坊,然后慢慢挤牙膏兑现。)
Google 的这个多模态助手 Astra,尽管在语音的表现力上不如昨天的 ChatGPT,情绪没有那么丰满和 dramatic,但是在延迟响应、实时语义理解上是不输的,尤其是还结合了记忆,感觉上甚至更加实用。
相比之下,OpenAI 昨天的发布会,以及最近的一系列动作,比如传说中和苹果合作,似乎都有“提升用户体验,进而拼命扩大用户量”的感觉,不知道是不是切身感受到了 Google 的威胁,在战略上做出的选择。或许 OpenAI 已经意识到了,单单靠自己很难跨越鸿沟,GPTs 的失败就是例子。
当然,Google 也有自己的问题,当下最大的风险就是如何应对 LLM 在搜索结果中带来的商业化挑战。发布会上,搜索的第一条结果换成了 LLM 的结果,体验上看似变好了,但对商业化的影响是巨大的。这种左右互搏,处理不好就会是自掘坟墓,处理好了就会迎来第二曲线。至少从股价来看,感觉华尔街对于这次 I/O 的故事并不是非常 buy in,还在继续观察。
但实际上,个人觉得 Google I/O 还是有不少看点。最大的感觉是:Google 在AI 发展的进度上真正追平了 OpenAI。无论是音视频实时助手,还是视频生成,基本上都能够和 OpenAI 同步发布,效果类似(当然 Veo 比Sora晚了三个月,效果看起来还是要稍逊)。甚至 Gemini 1.5 Pro 的 2 million 窗口,LLM 与 Google 原生搜索的结合,以及与智能眼镜等硬件的集成,相比 OpenAI 来说还要更领先一些。整体上,感觉 Google 这头巨兽算是彻底醒过来了,开始处于某种进攻的态势。(当然,实际全面发布时间是个问题。The Information 说 Google 现在在 AI 上的风格是先立牌坊,然后慢慢挤牙膏兑现。)
Google 的这个多模态助手 Astra,尽管在语音的表现力上不如昨天的 ChatGPT,情绪没有那么丰满和 dramatic,但是在延迟响应、实时语义理解上是不输的,尤其是还结合了记忆,感觉上甚至更加实用。
相比之下,OpenAI 昨天的发布会,以及最近的一系列动作,比如传说中和苹果合作,似乎都有“提升用户体验,进而拼命扩大用户量”的感觉,不知道是不是切身感受到了 Google 的威胁,在战略上做出的选择。或许 OpenAI 已经意识到了,单单靠自己很难跨越鸿沟,GPTs 的失败就是例子。
当然,Google 也有自己的问题,当下最大的风险就是如何应对 LLM 在搜索结果中带来的商业化挑战。发布会上,搜索的第一条结果换成了 LLM 的结果,体验上看似变好了,但对商业化的影响是巨大的。这种左右互搏,处理不好就会是自掘坟墓,处理好了就会迎来第二曲线。至少从股价来看,感觉华尔街对于这次 I/O 的故事并不是非常 buy in,还在继续观察。
尝试了一下,Wegic 这个 AI 网页生成工具也太好了。
通过对话来生成和修改页面门槛确实低了很多。整体网站设计和 IP 都太好了。 IP 尤其可爱。
而且生成的网站从内容和美观度上都很好,内容也很丰富。如果补齐一下能力的话可能是 Framer 一个很强力的对手。
这里尝试:https://wegic.ai/
通过对话来生成和修改页面门槛确实低了很多。整体网站设计和 IP 都太好了。 IP 尤其可爱。
而且生成的网站从内容和美观度上都很好,内容也很丰富。如果补齐一下能力的话可能是 Framer 一个很强力的对手。
这里尝试:https://wegic.ai/
关于【宇树】新出的机器人unitree G1
有两个比较吸引人的点,完成度相对较高和相对较低的价格
1. 先说最大的差别,就是腿是不是反弓,人形机器人的腿有两种不同的形式,一种是鸵鸟腿,一种是人腿。宇树在自己的H1产品中就使用了人腿形的机器人。
2. 反弓最大的优势是在电机的集成度上,也就是可以把电机最大程度的集约到核心区域。这样对于电机的性能要求会有所降低。
3. 但是宇树的核心就在于电机的性能和性价比很不错。
4. 所以这也是机器人公司的盈利手段,人形机器人相比于真的有什么产品力而言。卖电机的收益也不会小。
5. 很多人会觉得这样的机器人如果会做饭用在家里还是不错的,但是我们主要到宇树最后的小字,不要靠的太近,这也是刚体机器人的一个重要安全隐患,电机容易抽搐和发疯,随时随地给你来一个地板动作也不是不可能。
6. 所以具身智能(人形机器人),的投资大头还是我们熟悉的汽车产业。
7. 机械臂的大规模发展,资金就是来源于汽车产业。而现在的机器人学,基本上是建立在机械臂的基础上的。所以与其说咱看到一个两条腿,两个胳膊的机器人,不如说是四条机械臂连在一起(划掉)
8. 最后一个不成熟地展望,具身智能,会成为载人航天,尤其是载人登月,的先驱。相比于地球的环境,月球的低重力环境,和比较严酷的环境,更加适合机器人选手。
有两个比较吸引人的点,完成度相对较高和相对较低的价格
1. 先说最大的差别,就是腿是不是反弓,人形机器人的腿有两种不同的形式,一种是鸵鸟腿,一种是人腿。宇树在自己的H1产品中就使用了人腿形的机器人。
2. 反弓最大的优势是在电机的集成度上,也就是可以把电机最大程度的集约到核心区域。这样对于电机的性能要求会有所降低。
3. 但是宇树的核心就在于电机的性能和性价比很不错。
4. 所以这也是机器人公司的盈利手段,人形机器人相比于真的有什么产品力而言。卖电机的收益也不会小。
5. 很多人会觉得这样的机器人如果会做饭用在家里还是不错的,但是我们主要到宇树最后的小字,不要靠的太近,这也是刚体机器人的一个重要安全隐患,电机容易抽搐和发疯,随时随地给你来一个地板动作也不是不可能。
6. 所以具身智能(人形机器人),的投资大头还是我们熟悉的汽车产业。
7. 机械臂的大规模发展,资金就是来源于汽车产业。而现在的机器人学,基本上是建立在机械臂的基础上的。所以与其说咱看到一个两条腿,两个胳膊的机器人,不如说是四条机械臂连在一起(划掉)
8. 最后一个不成熟地展望,具身智能,会成为载人航天,尤其是载人登月,的先驱。相比于地球的环境,月球的低重力环境,和比较严酷的环境,更加适合机器人选手。
抖音“午夜狂暴哈士奇狗”这个小姐姐一直在发跟 ChatGPT 谈赛博恋爱的视频。
比如这个跟 ChatGPT 去海边约会,上个版本 GPT 还无法看到他看到的海边的景色,没办法看到她专门化了妆。
但这个版本她应该可以完全把 GPT 当成异地恋的男友约会了。配合新的情绪识别和面部表情识别,都不敢想有多强。
比如这个跟 ChatGPT 去海边约会,上个版本 GPT 还无法看到他看到的海边的景色,没办法看到她专门化了妆。
但这个版本她应该可以完全把 GPT 当成异地恋的男友约会了。配合新的情绪识别和面部表情识别,都不敢想有多强。
我身边唯一一个在OpenAI工作的同学,是个女生,北京四中的,跟我一样都是北京人考到复旦的,大学就在我隔壁寝室楼。
对她的印象一直就是安安静静的,笑容不多,也常听别人说她不好相处、性格阴郁、傲慢。有一次一起坐校车聊起来,她说她是高考失利才来的复旦,这对她是很大的打击。
你知道我这种大水货考生第一反应是,“啊?复旦还不满意啊?挺好的了!不就只比清北差吗?”
后来的日子里听说她大三就转到美国本科去了,在社交媒体上慢慢了解她也有个学CS的哥哥,目前的作品水准也是探索人类边界那种level。看着她毕业之后去了Meta,前一阵说离开了Meta,我还想说什么公司能吸引她这样的女生加入?再一看是OpenAI。
更高兴的是前一阵看她还冻了卵,也分享了很多作为女性和准母亲的体验。
在今天这个日子里想默默祝福她。
你做到了,世界的舞台是属于你的。
对她的印象一直就是安安静静的,笑容不多,也常听别人说她不好相处、性格阴郁、傲慢。有一次一起坐校车聊起来,她说她是高考失利才来的复旦,这对她是很大的打击。
你知道我这种大水货考生第一反应是,“啊?复旦还不满意啊?挺好的了!不就只比清北差吗?”
后来的日子里听说她大三就转到美国本科去了,在社交媒体上慢慢了解她也有个学CS的哥哥,目前的作品水准也是探索人类边界那种level。看着她毕业之后去了Meta,前一阵说离开了Meta,我还想说什么公司能吸引她这样的女生加入?再一看是OpenAI。
更高兴的是前一阵看她还冻了卵,也分享了很多作为女性和准母亲的体验。
在今天这个日子里想默默祝福她。
你做到了,世界的舞台是属于你的。