关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
梳理了一下昨晚谷歌 Pixel 硬件发布会的所有 AI 内容:#ai创造营#

1. 所有 Pixel 10 手机均搭载 Google Tensor G5 芯片,可以本地运行 Gemini Nano 模型。
2. Magic Cue 功能支持将所有谷歌应用的信息串联起来,在合适的地方建议你在 Messages 应用中一键分享。
3. Voice Translate 会利用端侧模型实时翻译通话内容,并模仿对方音色,但目前不支持翻译中文。
4. Call Screen 的 Take a Message 功能为错过或拒接来电提供实时转录,并根据留言建议下一步操作,内容会放在通话笔记中。
5. Gemini Live 更新:摄像头共享时 Gemini 可高亮物品,Gemini APP 现支持用 Veo3 生成视频。
6. NotebookLM 与 Pixel 截图和录音应用整合,检测到适合加入笔记的内容会建议收藏到 NotebookLM。
7. 新的笔记应用 Pixel Journal 帮助记录身心健康和目标进展,设备端 AI 提供写作提示和洞见。
8. 录音机应用可根据哼唱生成与自己氛围相符的独特曲目。
9. 新的 Pixel Watch 4 有 Gemini 驱动的健身教练能力,提供主动健身与睡眠指导及按需建议,通过“抬腕交谈”唤出 Gemini 交流。

顺便总结一下谷歌硬件发布会代表的几个趋势:

1. 手机系统的所有自带软件全部 AI 化,而且功能都非常实用;
2. 除了手机之外的其他硬件产品也全部加上了 Gemini 的对话和沟通能力;
3. 两个重点发力的 AI 软件场景是 AI 健康教练和 AI 修图&拍摄指导;
4. AI 功能不再局限于主动触发,会自动在合适的场景下弹出和给出建议;
5. 多个系统 APP 之间的 AI 能力可以联动,输出的信息可以相互流转;
6. 端侧模型大量使用,覆盖了所有模态,AI 照片修改和100 倍数码变焦细节补充以及通话实时翻译&文本建议。
AI探索指南
Siri 的智商停留在14年前,想让苹果做一个能控制手机系统和软件的 Agent? 目测五年内搞不出来,想都别想了。 但上周智谱的朋友跟说,他们让 AutoGLM 邪修了一套方案。 竟然给每个 iPhone 配了一台云安卓。。。 就这样, 安卓上能操控各家 App 的通用智能体,iPhone 用户也可以玩了。 听到这个方案的我大为震撼,我买安卓备用机的钱就这么都省了? 周日的时候抱着强烈的好奇心,就去现场看了一下 iPhone 上的邪修 AutoGLM。 AutoGLM 能操作云手机,让我们看到了手机 Agent…
9. Agent 操作的账号有会被一些网站比如小红书识别为机器人,这可能会引发封号风险,所以 Agent 虽然可以自动化,但任务安排上也要有活人感,不要安排一些连续点赞之类的任务
10. 云手机和云电脑的资源不足,一大早7点就没资源了,这比上班地铁还拥挤,也能看出目前是实验功能

问题真的不少,要完美解决这些问题,我预测至少还需要一年。
Siri 的智商停留在14年前,想让苹果做一个能控制手机系统和软件的 Agent?
目测五年内搞不出来,想都别想了。
但上周智谱的朋友跟说,他们让 AutoGLM 邪修了一套方案。
竟然给每个 iPhone 配了一台云安卓。。。
就这样, 安卓上能操控各家 App 的通用智能体,iPhone 用户也可以玩了。
听到这个方案的我大为震撼,我买安卓备用机的钱就这么都省了?
周日的时候抱着强烈的好奇心,就去现场看了一下 iPhone 上的邪修 AutoGLM。

AutoGLM 能操作云手机,让我们看到了手机 Agent 的具体形态。
只要你一句话安排任务,AutoGLM 就能在后台开启多个云手机和云电脑,同步协作,共同完成目标。
它支持了抖音、小红书、美团、京东等 40+ 高频应用,平时点外卖、订机票、查房源、预约健康服务,它都能搞定。
办公场景中,做调研、写PPT、做短视频,也都能搞定。

实际体验下来,这个方向非常前沿,非常未来。
同时也暴露了非常多的问题,在下面展开讲讲:

虽然手机 Agent 这个技术方向非常好,但仍然处于非常早期的实验阶段。
因此当前阶段仍有如下问题:

1. 任务成功率太低了,十次成功一次,要真正的C端可用,至少得到50%成功率
2. 意图理解和界面理解的水平都不够,在猫砂任务里,第一次完成了,第二次我想录个屏,它就没去订单里找,而是直接在主页搜了猫砂。
3. 任务经常莫名奇妙就终止了,模型认为自己完成了任务,所以没有报错信息,作为用户有点懵。
4. Agent 只会往前操作,不会返回上一步,不会重启app。在开启新话题的时候,手机还停留在上一个app内,Agent 这时候就不会了。
5. Agent 在操作电脑和手机的时候,遇到价格弹窗、广告弹窗,就直接干懵了,不像人能精准地找到x按钮,当然这部分人类产品经理也有一定的责任
6. 手机版的Agent只会用几十个固定的app,目前还不会用浏览器做开放任务,比如让它逛nga查游戏资料,它会说自己还没学会
7. 在购买类任务里,添加购物车要确认、订单支付也要自己来,无法实现完全自动化,比如每三个月采购一次猫砂这种任务,如果还需要确认就没失去了自动化的意义,目前还没有能兼顾安全性和便捷性的方案
8. Agent 在使用手机的过程中需要用户接管输入登录等信息,可能存在一定隐私泄露风险,这部分需要根据自己的情况来权衡方便和隐私
承诺给 @Xinran.Z 社区投稿的信源清单总算有个雏形了!

把我最近一年看过的各种AI相关的播客、Newsletter、公众号中比较有帮助的都整理了一下(X的还没整理),(🔗好像会被屏,放在评论区了)

希望能帮助到更多想获得一手信息的人🫰

纯人肉整理,必有缺漏,后续慢慢完善~
Google 发布会直接就深夜秀了,太会玩了。
AI探索指南
前几天参加了一下智谱 AutoGLM 2.0的闭门会,同时试用了一下,发现这次的手机 Agent 可用性已经相当好了 - 应该是世界上首个手机通用 Agent - 操作全在云手机&云电脑上运行 - 全平台覆盖的客户端 - 可以实现跨应用自动操作 这里是详细的测试和分析:https://mp.weixin.qq.com/s/BjjUGBi1kuHDwz5U_h7y9Q 日常一个事情我觉得用手机的时候是非常低效的。 在约朋友的时候经常不知道去哪吃,而且在北京通勤时间巨长,40 分钟路程都算短的,找餐厅…
它默认会读取平台的前三个或者 5 个搜索结果,如果你觉得少的话可以在提示词要求他读取更多信息。

AutoGLM 给出了详细的结果京东的优惠和拼多多的价格都有,还有大致的评价。

除了我们正常人这种需要跨多个 APP 进行信息整理和决策的任务以外,我还有一个场景就是帮爸妈设置手机。

比如,我妈想看某个剧集的话,光是找到这个剧,然后点到对应的集数都要越过很多的障碍,有了 AutoGLM 我们完全可以直接把这些加到收藏或者已经观看那里让他继续看就行。

在测试的时候,AutoGLM 做正常人的操作是没啥问题的,但是由于国内几大巨头的反爬机制非常强大。

AutoGLM 最需要克服的反而是各种无限弹出的验证码和强制下线等操作。

手机 Agent 化目前来看从模型能力和用户需求上都是不可避免的发展方向,模型能力现在完全可以胜任了,剩下就是生态建设了。

希望国内的 AI 公司和几个互联网巨头早日磨合出一个安全又稳定的手机 Agent 运行环境,毕竟不只是人可以创造价值,Agent 也可以,而且 Agent 的时间是无限的。
前几天参加了一下智谱 AutoGLM 2.0的闭门会,同时试用了一下,发现这次的手机 Agent 可用性已经相当好了

- 应该是世界上首个手机通用 Agent
- 操作全在云手机&云电脑上运行
- 全平台覆盖的客户端
- 可以实现跨应用自动操作

这里是详细的测试和分析:https://mp.weixin.qq.com/s/BjjUGBi1kuHDwz5U_h7y9Q

日常一个事情我觉得用手机的时候是非常低效的。

在约朋友的时候经常不知道去哪吃,而且在北京通勤时间巨长,40 分钟路程都算短的,找餐厅要在大众点评,看通勤时间要在高德还得转发给朋友一起挑餐厅,非常浪费时间,现在 AutoGLM 可以一次搞定了。
这个任务非常复杂,Agent 需要跨两个 APP 进行多次点击和搜索操作,没想到 AutoGLM 执行的很好。

首先他需要打开大众点评,然后切换城市到北京-搜索798 艺术区-筛选人均消费价格,挨个点击搜索结果记录信息。
只是在这一个APP 上就需要起码点 20 次。

然后他需要打开高德地图,找到灰的几乎看不到的开屏广告跳过按钮,开始分别查询望京到 798 和回龙观到 798 的路线和时间,最后还得查询 798 到三里屯的时间。

在高德的操作看起来会比在大众点评的更加复杂,首先是点击次数更多,然后就是高德的界面内容真的又多又杂非常考验模型的多模态内容识别能力

再经过几十次的点击和七八次的文本输入后 AutoGLM 非常快速而且准确的完成了任务,给出了餐厅的选择以及不同时间段和地点的通勤时间。

这里有个给智谱的小建议,GLM 的回复有点杂了,感觉他需要更加细致的整理信息,比如先把最为确定的餐厅信息和通勤时间告诉我,然后再说他推测的出行安排,事实和推理分开这样比较好。

男生日常购买一些必需品和商品的时候跟女生差别比较大,又需要比价,不然亏,但是又懒得去购物软件上不断的挑选和对比。这个时候就可以让 AutoGLM 出马了。

我直接让他执行了一个我日常购买电子设备的常见流程,搜索京东和拼多多关于大疆无人机的价格信息然后汇总。

智谱 Auto GLM 智能体手机的使用过程科幻感非常强,你只需要语音输入或者打字之后,他就会直接启动云端的手机开始执行任务。

首次启动会让你登录账号,后面就不需要了,然后你就看着他非常快的输入内容-查看搜索结果-分析详情页内容并且汇总,而且可以跨多个应用执行任务。
老罗的视频播客,第一期嘉宾是理想
一上来,没有嘉宾介绍,没有主播寒暄,没有插科打诨
就直接提问李想7岁之前家庭
李想也直接讲了个姥爷的中国教父的故事
这个故事对他的性格和后面的创业都有很大的影响
可以说是奠定了他乐观精神的人生底色

这三分钟已经很神了
超越中国 99% 的播客
具身智能时代原住民
疗愈
AI
机器人
貌似不相干的一组词

客户群体是什么
现在的年轻人都那么脆弱么

自己或者找一帮搭子
去跑山 去攀岩 去hiking 去gym
去拥抱大自然 去挑战自我
不好么

非要在家里抱着这么个玩意儿?
听她整天在你耳边哼哼唧唧?
你真的要和这种玩意儿过一辈子?
今天做了个非常重要的决定,准备开始做露脸的视频。小红书,视频号,推特,一起使用。

原因还挺多的,一方面可以传递更多的想法,吸引到同频的资源和人,但更多是想把内容/产品理念传递更好,把浮躁和噪音降低,也是正式把个人 build in public。

一直有容貌,音色,五音各方面的一些焦虑,但anyway总是要突破这样的瓶颈,也希望把更优质的内容呈现出来,让 AI 能够离我们的用户和关注者更近。

今天和团队创意的 leader 聊,我自己身上还有挺多不同寻常的点值得讲讲:

为什么从码/数学转到市场(笑称到文科天坑)
为什么选择 ai startup
数学/cs和市场营销的联系在哪里
年龄和现有经验是如何制衡的,现在受到的偏见
我除了 ai 市场 还做过什么(eg. 中国第一个学生电音节,社交破壁艺术展,支教,三八展....)

当然,对于创业,ai,agent,市场,肯定是主要的主题。

今天晚上刚好听了@生姜iris @orange.ai 在waytoagi 讲 listenhub 的部分直播,说到团队搭建,以及 cto 学 ai 前端发现不行的很多小故事,到拿融资,搞架构,其实大家在创业过程中有非常多类似的经历,这些experience本身是更适合通过视频/音频的多模态媒介传递的,会比纯文字图片更贴合心境,带有情绪,富有感染力。

所以准备克服掉容貌/音色/不太敢露脸的焦虑,开始这个尝试了。

当然,还有要坚持健身减肥了,以及不会 ai 数字人了(狗头
基本明示了 Nano Banana 模型是谷歌的,并且会在今晚发布#ai创造营#
Back to Top