关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
办公室的新成员
这个眼神,磨人的小妖精...
梳理了一下昨晚谷歌 Pixel 硬件发布会的所有 AI 内容:#ai创造营#

1. 所有 Pixel 10 手机均搭载 Google Tensor G5 芯片,可以本地运行 Gemini Nano 模型。
2. Magic Cue 功能支持将所有谷歌应用的信息串联起来,在合适的地方建议你在 Messages 应用中一键分享。
3. Voice Translate 会利用端侧模型实时翻译通话内容,并模仿对方音色,但目前不支持翻译中文。
4. Call Screen 的 Take a Message 功能为错过或拒接来电提供实时转录,并根据留言建议下一步操作,内容会放在通话笔记中。
5. Gemini Live 更新:摄像头共享时 Gemini 可高亮物品,Gemini APP 现支持用 Veo3 生成视频。
6. NotebookLM 与 Pixel 截图和录音应用整合,检测到适合加入笔记的内容会建议收藏到 NotebookLM。
7. 新的笔记应用 Pixel Journal 帮助记录身心健康和目标进展,设备端 AI 提供写作提示和洞见。
8. 录音机应用可根据哼唱生成与自己氛围相符的独特曲目。
9. 新的 Pixel Watch 4 有 Gemini 驱动的健身教练能力,提供主动健身与睡眠指导及按需建议,通过“抬腕交谈”唤出 Gemini 交流。

顺便总结一下谷歌硬件发布会代表的几个趋势:

1. 手机系统的所有自带软件全部 AI 化,而且功能都非常实用;
2. 除了手机之外的其他硬件产品也全部加上了 Gemini 的对话和沟通能力;
3. 两个重点发力的 AI 软件场景是 AI 健康教练和 AI 修图&拍摄指导;
4. AI 功能不再局限于主动触发,会自动在合适的场景下弹出和给出建议;
5. 多个系统 APP 之间的 AI 能力可以联动,输出的信息可以相互流转;
6. 端侧模型大量使用,覆盖了所有模态,AI 照片修改和100 倍数码变焦细节补充以及通话实时翻译&文本建议。
AI探索指南
Siri 的智商停留在14年前,想让苹果做一个能控制手机系统和软件的 Agent? 目测五年内搞不出来,想都别想了。 但上周智谱的朋友跟说,他们让 AutoGLM 邪修了一套方案。 竟然给每个 iPhone 配了一台云安卓。。。 就这样, 安卓上能操控各家 App 的通用智能体,iPhone 用户也可以玩了。 听到这个方案的我大为震撼,我买安卓备用机的钱就这么都省了? 周日的时候抱着强烈的好奇心,就去现场看了一下 iPhone 上的邪修 AutoGLM。 AutoGLM 能操作云手机,让我们看到了手机 Agent…
9. Agent 操作的账号有会被一些网站比如小红书识别为机器人,这可能会引发封号风险,所以 Agent 虽然可以自动化,但任务安排上也要有活人感,不要安排一些连续点赞之类的任务
10. 云手机和云电脑的资源不足,一大早7点就没资源了,这比上班地铁还拥挤,也能看出目前是实验功能

问题真的不少,要完美解决这些问题,我预测至少还需要一年。
Siri 的智商停留在14年前,想让苹果做一个能控制手机系统和软件的 Agent?
目测五年内搞不出来,想都别想了。
但上周智谱的朋友跟说,他们让 AutoGLM 邪修了一套方案。
竟然给每个 iPhone 配了一台云安卓。。。
就这样, 安卓上能操控各家 App 的通用智能体,iPhone 用户也可以玩了。
听到这个方案的我大为震撼,我买安卓备用机的钱就这么都省了?
周日的时候抱着强烈的好奇心,就去现场看了一下 iPhone 上的邪修 AutoGLM。

AutoGLM 能操作云手机,让我们看到了手机 Agent 的具体形态。
只要你一句话安排任务,AutoGLM 就能在后台开启多个云手机和云电脑,同步协作,共同完成目标。
它支持了抖音、小红书、美团、京东等 40+ 高频应用,平时点外卖、订机票、查房源、预约健康服务,它都能搞定。
办公场景中,做调研、写PPT、做短视频,也都能搞定。

实际体验下来,这个方向非常前沿,非常未来。
同时也暴露了非常多的问题,在下面展开讲讲:

虽然手机 Agent 这个技术方向非常好,但仍然处于非常早期的实验阶段。
因此当前阶段仍有如下问题:

1. 任务成功率太低了,十次成功一次,要真正的C端可用,至少得到50%成功率
2. 意图理解和界面理解的水平都不够,在猫砂任务里,第一次完成了,第二次我想录个屏,它就没去订单里找,而是直接在主页搜了猫砂。
3. 任务经常莫名奇妙就终止了,模型认为自己完成了任务,所以没有报错信息,作为用户有点懵。
4. Agent 只会往前操作,不会返回上一步,不会重启app。在开启新话题的时候,手机还停留在上一个app内,Agent 这时候就不会了。
5. Agent 在操作电脑和手机的时候,遇到价格弹窗、广告弹窗,就直接干懵了,不像人能精准地找到x按钮,当然这部分人类产品经理也有一定的责任
6. 手机版的Agent只会用几十个固定的app,目前还不会用浏览器做开放任务,比如让它逛nga查游戏资料,它会说自己还没学会
7. 在购买类任务里,添加购物车要确认、订单支付也要自己来,无法实现完全自动化,比如每三个月采购一次猫砂这种任务,如果还需要确认就没失去了自动化的意义,目前还没有能兼顾安全性和便捷性的方案
8. Agent 在使用手机的过程中需要用户接管输入登录等信息,可能存在一定隐私泄露风险,这部分需要根据自己的情况来权衡方便和隐私
承诺给 @Xinran.Z 社区投稿的信源清单总算有个雏形了!

把我最近一年看过的各种AI相关的播客、Newsletter、公众号中比较有帮助的都整理了一下(X的还没整理),(🔗好像会被屏,放在评论区了)

希望能帮助到更多想获得一手信息的人🫰

纯人肉整理,必有缺漏,后续慢慢完善~
Google 发布会直接就深夜秀了,太会玩了。
AI探索指南
前几天参加了一下智谱 AutoGLM 2.0的闭门会,同时试用了一下,发现这次的手机 Agent 可用性已经相当好了 - 应该是世界上首个手机通用 Agent - 操作全在云手机&云电脑上运行 - 全平台覆盖的客户端 - 可以实现跨应用自动操作 这里是详细的测试和分析:https://mp.weixin.qq.com/s/BjjUGBi1kuHDwz5U_h7y9Q 日常一个事情我觉得用手机的时候是非常低效的。 在约朋友的时候经常不知道去哪吃,而且在北京通勤时间巨长,40 分钟路程都算短的,找餐厅…
它默认会读取平台的前三个或者 5 个搜索结果,如果你觉得少的话可以在提示词要求他读取更多信息。

AutoGLM 给出了详细的结果京东的优惠和拼多多的价格都有,还有大致的评价。

除了我们正常人这种需要跨多个 APP 进行信息整理和决策的任务以外,我还有一个场景就是帮爸妈设置手机。

比如,我妈想看某个剧集的话,光是找到这个剧,然后点到对应的集数都要越过很多的障碍,有了 AutoGLM 我们完全可以直接把这些加到收藏或者已经观看那里让他继续看就行。

在测试的时候,AutoGLM 做正常人的操作是没啥问题的,但是由于国内几大巨头的反爬机制非常强大。

AutoGLM 最需要克服的反而是各种无限弹出的验证码和强制下线等操作。

手机 Agent 化目前来看从模型能力和用户需求上都是不可避免的发展方向,模型能力现在完全可以胜任了,剩下就是生态建设了。

希望国内的 AI 公司和几个互联网巨头早日磨合出一个安全又稳定的手机 Agent 运行环境,毕竟不只是人可以创造价值,Agent 也可以,而且 Agent 的时间是无限的。
Back to Top