关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
GPT-4o 速度提升以后太爽了,配合交互草图,很快就写出了对应的 Select 组件。

用的软件是:https://makereal.tldraw.com/
吴恩达新写的提示工程技巧,主要的内容就四步:

1. 快速撰写简单的提示并测试其效果。

2.根据结果的不足,逐步丰富和细化提示,这可能导致更长、更详细的提示,甚至是“大型提示”。

3. 如果效果仍不理想,可以考虑应用少样本或多样本学习策略(如果适用),或偶尔进行微调。

4. 如果问题仍未解决,可将任务拆分为子任务,采用智能体工作流程。

来源:https://www.deeplearning.ai/the-batch/issue-249/
通义千问会发表情,也会回复大笑的“哈哈”。还是蛮有意思的。几乎感觉不到对面是个机器人。
对话宇树科技王兴兴,造出 9.9 万元人形机器人的 90 后偏才

很有特点的一位创始人。

每天 24 小时一直想就行了,你睡觉时间多想想,突然就会有灵感了。
一个产品,如果能够利用七宗罪中的一宗,就能够获得良好的效果。
对 agent 的一个暴论:现有 (multi) agent workflow 的模式没有太大价值。Agent 今年(在以吴恩达老师为首的各类大佬的吹捧下)热度很高,但现有的这些所谓的 (multi) agent workflow,本质上是把一个大任务拆分成很多个子任务,每个子任务都有明确的 input 和 output,自己定义一些变量和接口,把这些子任务串起来。这种方式很像是早期的自动驾驶,把感知和规控分开解,或者是上一代的语音助手,把语音转文字、LLM、语音合成这些工作流串起来。

终极的解决方案应该不是这个样子的。现有的 (multi) agent workflow,速度慢先不说,最大的问题还是在接口的地方把信息降维了。这些 input / output 的接口和变量,本质上都是把信息降维到人能理解的维度,这是以高维信息的损失为代价的。每多一层 workflow,损失的信息就多了一次。面对简单问题时, (multi) agent workflow 或许是可行的,但它注定无法解决复杂问题。就好比Waymo 用感知+规控的架构,搭配高精地图,能够在凤凰城和三藩市勉强把本地 L4 跑通,但很难 scale 成一个通用的解法。只有 Tesla 端到端的方案才是自动驾驶的未来。

因此,现有的 (multi) agent workflow方式注定只是一个中间状态,类似自动驾驶中感知+规控+高精地图的拼凑。而最终想要解决复杂问题,需要靠基础模型的进化。当模型能力足够强之后,应该是可以端到端的解决问题。你可以在 prompt 里提示它去使用某些工具,或者采用某些步骤,但应该不需要人为去把 workflow 拆出来。

Agent 的概念依旧重要,但应该回归它更加 native 的定义,即每一个 Agent 应该是独立的智能体,拥有自己的 memory, planning, tool use 等能力,能够端到端地解决问题,而不是需要人类按照自己的理解一口口地把饭喂到嘴里。一个 Agent 就应该是一辆独立的L5 Autopilot 的汽车,而不是一堆弱智 L2 Workflow 凑出来的所谓 multi agents 辅助驾驶杂牌军团。这听起来就很不优雅。
“雇”了个机器人🤖,我们上班,它勤勤恳恳在家打扫卫生哈哈,解放人类!每天到家地面干干净净,真棒👏🏻
OpenAI 很鸡贼,提前一天开发布会,让 Google I/O 的气势弱了很多。再加上 Ilya 的官宣离职又分走了不少流量。果然今早一早起来,媒体的报道和用户的关注相比昨天要少得多。

但实际上,个人觉得 Google I/O 还是有不少看点。最大的感觉是:Google 在AI 发展的进度上真正追平了 OpenAI。无论是音视频实时助手,还是视频生成,基本上都能够和 OpenAI 同步发布,效果类似(当然 Veo 比Sora晚了三个月,效果看起来还是要稍逊)。甚至 Gemini 1.5 Pro 的 2 million 窗口,LLM 与 Google 原生搜索的结合,以及与智能眼镜等硬件的集成,相比 OpenAI 来说还要更领先一些。整体上,感觉 Google 这头巨兽算是彻底醒过来了,开始处于某种进攻的态势。(当然,实际全面发布时间是个问题。The Information 说 Google 现在在 AI 上的风格是先立牌坊,然后慢慢挤牙膏兑现。)

Google 的这个多模态助手 Astra,尽管在语音的表现力上不如昨天的 ChatGPT,情绪没有那么丰满和 dramatic,但是在延迟响应、实时语义理解上是不输的,尤其是还结合了记忆,感觉上甚至更加实用。

相比之下,OpenAI 昨天的发布会,以及最近的一系列动作,比如传说中和苹果合作,似乎都有“提升用户体验,进而拼命扩大用户量”的感觉,不知道是不是切身感受到了 Google 的威胁,在战略上做出的选择。或许 OpenAI 已经意识到了,单单靠自己很难跨越鸿沟,GPTs 的失败就是例子。

当然,Google 也有自己的问题,当下最大的风险就是如何应对 LLM 在搜索结果中带来的商业化挑战。发布会上,搜索的第一条结果换成了 LLM 的结果,体验上看似变好了,但对商业化的影响是巨大的。这种左右互搏,处理不好就会是自掘坟墓,处理好了就会迎来第二曲线。至少从股价来看,感觉华尔街对于这次 I/O 的故事并不是非常 buy in,还在继续观察。
新的谷歌搜索演示,真狠啊,在核心产品上做这么大的改动。

几乎完全用AI重构了谷歌搜索的产品形态。搜索-总结-生成。
尝试了一下,Wegic 这个 AI 网页生成工具也太好了。

通过对话来生成和修改页面门槛确实低了很多。整体网站设计和 IP 都太好了。 IP 尤其可爱。

而且生成的网站从内容和美观度上都很好,内容也很丰富。如果补齐一下能力的话可能是 Framer 一个很强力的对手。

这里尝试:https://wegic.ai/
AGI-X闭门会第32场,北京
具身智能 & 大模型
关于【宇树】新出的机器人unitree G1

有两个比较吸引人的点,完成度相对较高和相对较低的价格

1. 先说最大的差别,就是腿是不是反弓,人形机器人的腿有两种不同的形式,一种是鸵鸟腿,一种是人腿。宇树在自己的H1产品中就使用了人腿形的机器人。
2. 反弓最大的优势是在电机的集成度上,也就是可以把电机最大程度的集约到核心区域。这样对于电机的性能要求会有所降低。
3. 但是宇树的核心就在于电机的性能和性价比很不错。
4. 所以这也是机器人公司的盈利手段,人形机器人相比于真的有什么产品力而言。卖电机的收益也不会小。
5. 很多人会觉得这样的机器人如果会做饭用在家里还是不错的,但是我们主要到宇树最后的小字,不要靠的太近,这也是刚体机器人的一个重要安全隐患,电机容易抽搐和发疯,随时随地给你来一个地板动作也不是不可能。
6. 所以具身智能(人形机器人),的投资大头还是我们熟悉的汽车产业。
7. 机械臂的大规模发展,资金就是来源于汽车产业。而现在的机器人学,基本上是建立在机械臂的基础上的。所以与其说咱看到一个两条腿,两个胳膊的机器人,不如说是四条机械臂连在一起(划掉)
8. 最后一个不成熟地展望,具身智能,会成为载人航天,尤其是载人登月,的先驱。相比于地球的环境,月球的低重力环境,和比较严酷的环境,更加适合机器人选手。
抖音“午夜狂暴哈士奇狗”这个小姐姐一直在发跟 ChatGPT 谈赛博恋爱的视频。

比如这个跟 ChatGPT 去海边约会,上个版本 GPT 还无法看到他看到的海边的景色,没办法看到她专门化了妆。

但这个版本她应该可以完全把 GPT 当成异地恋的男友约会了。配合新的情绪识别和面部表情识别,都不敢想有多强。
Back to Top