关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
🚀 重磅:Google Bard 带来了超强的Extension系统

正面应战 ChatGPT 的 Plugins 生态,Bard 官方刚刚宣布推出了一个超大版本,正式推出其插件系统 Extension。

通过全新 Bard Extension 系统,你可以整合自己的谷歌旗下插件,从 Google Workspace(Doc、Gmail 、 Drive和 Maps等)到 Youtube、Google Flights 等,与 Bard 深度对话。

极富想象力的地方在于,它可以帮助你基于个性化数据,随时与Bard 发起定制讨论。例如,深度交流你的邮件内容、Youtube 内容,以及制定个性化旅行方案。

例如,谷歌Bard 负责人Jack Krawczyk表示,他近期常使用Bard 分析自己孩子即将返校上新学期的提示, 配合搜索更好做进一步探索和准备。 (当然,Workspace 已经有海量的企业级用户)

在我看来,这是不仅是 Google AI 的超大里程碑,也是AI 军备竞赛再一次升级:相比 ChatGPT 的 Plugins 步步为营, Bard 谷歌系 Extension 全线开炮,能否一战成名,打开新生态的格局?相当值得期待。

现已实装上线, 去试试全新 Bard吧~
重┊🐟模语AI Beta版,内 测 开 启
磅┊💥全新AGI多模态营销助手
发┊💬诚邀有如下需求的品牌主
布╰┈┈┈🔓开启全新体验

1️⃣需要每天在不同的平台发布合适的营销内容
2️⃣根据品牌产品知识库,生成专属内容
3️⃣结合实时热点进行创作
4️⃣自动生成手持商品图,种草买家秀,网红打卡图
5️⃣符合品牌调性的专属代言人

😎内测阶段定向发放50个邀请码,包含一个为期30天的试用账号,内置2位AI模特,附赠1万模粒!
FlknGKz18UqUgAqvQBb_RkuvcJUov3.jpg
513.1 KB
FrcrYD7uYIwebl-3d6KRWmot0s2nv3.jpg
521.5 KB
FgzCgllFPRdAmAcOdBNQNGPQcIeWv3.jpg
524.5 KB
FtBku15FJ6khw2K0a0c8I9EQG-d0v3.jpg
552.3 KB
勇敢 dodo 不怕困难!(๑•̀ㅂ•́)و✧
让我的脑子变大!

我是无情的机器人!
拿到了motiff的试用权限,自己试用了一下,聊下感受:
好的体验:
1、有沉浸感的教学,所以上手比较快
2、组件比较丰富,基本覆盖手机APP的相关场景
3、效率提升明显
4、有一个想象力的空间是学习设计师原来的UI图,生成与设计师风格相符的图;

局限性:
1、当前支持手机设备的UI图设计,当然从创业角度以手机为切入点没有问题;
2、暂不支持icon,希望能够通过语言描述,生成对应的icon;
3、设计师是否愿意上传自己的图给平台,这个平台需要好好考虑。

一个人就是一个团队的愿景将不再遥远,目前全流程都能打通了;
1、产品经理有PM-AI:https://www.pm-ai.cn/
2、UI设计师有motiff:https://www.motiff.com/
3、开发人员有编程助手:太多了,就不一一列出来了,可以去我的知识库查阅:https://qp6cun00qk.feishu.cn/wiki/ZFrbwliFLikUKtkR45Dck5Y6nPe?table=tblmh1ARXz00c82O&view=vewFuUQgvn

最后,AI只是生产力工具,不要沉迷于生产力工具而忘记了去解决真正的用户需求。
关注我的朋友应该都相信AI可以真正提高工作效率,那么使用AI和不用AI工作的人工作效率会差多少呢,今天哈佛商学院的一篇论文给出了一些参考,他们研究发现:
在工作中使用AI可以带来工作效率的显着的改善。使用AI的被测试者比没有使用AI的被测试者平均多完成了 12.2% 的任务,完成任务的速度提高了 25.1% ,并且产生的结果质量提高了 40%。

同时他们还发现了一些其他的有趣结论:

类似GPT-4这样的模型是有一个能力的边界的,在边界内的任务他们可以处理的很好,边界外的任务则会搞得一塌糊涂但是没有人知道这类AI具体的能力边界。
他们分了三组一组不使用AI另一组使用AI,第三组使用AI的同时给与一定的培训,使用AI的两组任务完成效率和质量都远高于没有使用AI的组。
AI对工作能力越差的被测试者的提升越大,能力越强提高越小。所以高级人才和低级人才的差距会被快速拉平。
过于依赖AI可能会适得其反,反倒降低工作效率和质量,因为这些人无法区分AI的能力边界。

他们还为人类和AI协作的两种方式起了名字:
半人马:强调人与AI紧密结合,但是各司其职,人类主导整个流程,根据任务的性质合理调配人类和AI资源。。这种模式充分利用了人类的智慧与判断力以及AI的计算与生成能力。
机械人:人与AI的高度融合,在细节上形成循环迭代的优化过程,最终实现人机一体化。这种模式充分发挥了人类的灵活性和AI的生成能力。

我感觉这两种方式更像是现在人类跟AI合作的两个阶段:第一种大概知道AI的能力边界,可以简单的使用和复用AI输出的结果提升自己的工作能力。第二种机械人可以熟练的使用AI深入探索AI能力更加精细化的更AI协作和AI一起创作内容。
AI探索指南
最近在看 MetaGPT 的框架,拿到 AgentStore 测试名额。感觉提示词这部分存在着一直以来很普遍的问题:忽略细节。这也是我在社交媒体上看到各路 Prompter 分享 Role 的一个尚待优化的点。 我举个例子,错误示范: 你是一个 xx 专家,你很 blabla; 又或者,请检查 xx 是否有错误,是否存在 yy 问题。 我这里说的“错”不是指自己用 GPT 的场景,而是针对于构建自动化处理任务的 Agent 这个任务来说。 ------ 这两个错误真的是非常典型,而且本质上是一个问题。你把…
所谓的“常识信息”,不是指 1+1=2。常识指的每一个人的不同工作背景下观察到的独特而平常的细节。

比如刚刚上面文档的很多东西,都叫常识信息,你做一个 PPT,现场的发布环境,荧幕是其他工作人员搞定?还是由我来搞定和考虑细节?如果只是投影仪,那么颜色发灰这些问题要不要考虑……

所以,要想发挥 GPT Prompt 的威力(Agent),有两个点需要考量:

1️⃣ 专家“脑子里想的具体的东西”,而不仅仅是“你是一个 xx 专家”。后者是站在客户的角度。至少目前为止对于这种 Chain 的思想,大模型还不足以面对复杂的生产流程。
2️⃣ 进一步服务,持久地沟通。Few-shot 在单个环节输出结果不理想的情况下是必要的,但是单论对话无法从中心向外分化太远。必然需要在 1️⃣ 的前提下,量身定制每个环节,以及考虑是否需要 Few-shot,需要什么样的 Few-shot。另外,角色自动处理的好处是简化掉中间繁琐的流程,但应当在缺乏必要的信息前阻塞。这种自动化的流程需要以最大化的效率让用户尽可能少地 prompt,就像病人和医生的关系。病人 prompt:你是一个医疗专家;医生 prompt:反问 + 脑子里想的具体决策🌲
最近在看 MetaGPT 的框架,拿到 AgentStore 测试名额。感觉提示词这部分存在着一直以来很普遍的问题:忽略细节。这也是我在社交媒体上看到各路 Prompter 分享 Role 的一个尚待优化的点。

我举个例子,错误示范:
你是一个 xx 专家,你很 blabla;
又或者,请检查 xx 是否有错误,是否存在 yy 问题。

我这里说的“错”不是指自己用 GPT 的场景,而是针对于构建自动化处理任务的 Agent 这个任务来说。

------

这两个错误真的是非常典型,而且本质上是一个问题。你把 GPT 想象为一个依靠 Prompt 进行选择性表达或是从中心点向四周分化的细胞。你会发现从底层能力上看,通过实验来看它就是没法分化太远(我是说目前),原因有两个。

你看 MetaGPT 文档第一句话说的是什么?

Code = SOP(Team) is the core philosophy. We materialize SOP and apply it to teams composed of LLMs.

SOP 是如何体现的?我换个问法好了,当你找某个方面的专家帮你做事 / 给予服务的时候,我们期望的其实就和上面一样 👆

我们不是这个方面的专家,期待的自然是专家能自行判断一些事情,或者说他知道该如何反过来 prompt 你(而不是一直你单方面 prompt),不妨回忆一下「询前表单」。

我之前和 @小江在想 在一个班一起学 PPT 定制设计。这个是小江之前写的:如何又好又快地解决 PPT https://wandering.feishu.cn/wiki/wikcnoz21ZQKZyCSfsxDANeKo3f 当然,还有一些沟通方面的我放在了截图里 👇

你可以看到文档里几乎所有的信息都可以被精简和提炼为一个个 Instructions. 可能是制作的哲理(风格),也可能是不同场景和生产环节的具体要求。

一个专家应该有他自己的判断。

相应地,当客户没有提供清楚所需要的必要的材料的时候,任务就不可能顺利进行。这个时候必然会由专家反过来提问客户说:「关于 xxx,我们还缺少 yyy 材料;以及 zzz 我们是否需要进一步沟通一下,因为在我看来,zzz 存在两种不同的方向,到底是 aaa 还是 bbb,我需要进一步确认品牌对于 ccc 的考量 blabla。」
🔄这张图描述了一个智能体如何处理、分析和响应外部信息的流程。

1. Perception
- 这是认知流程的第一步。系统通过某种方式(如传感器、摄像头、麦克风等)对外部世界进行感知。

2. Inputs
- 感知到的信息被输入到系统中。在这个上下文中,输入是:“Look at the sky, do you think it will rain tomorrow?”

3. Environment
- 系统所在的环境或上下文。这可能涉及到当前的天气条件、时间、日期等。

4. TXT, Brain, Storage, Memory, Knowledge
- 这些都是系统内部的组件或资源。
- TXT指文本信息的输入。
- Brain指的是主要的处理单元或逻辑中心。
- Storage和Memory用来存储长期和短期的数据。
- Knowledge系统已有的信息库。

5. Summary, Recall, Learn, Retrieve
- 这些都是系统如何处理和管理其存储的数据和信息的方式。
- Summary是对输入信息的摘要。
- Recall和Retrieve是从存储中获取信息的操作。
- Learn指的是系统如何从新的数据中学习。

6. Reasoning from the current weather, Decision Making, Planning
- 这描述了系统如何处理输入信息、如何做决策,并如何计划其动作。

7. Agent, Action/Reasoning, Text, Tools, Calling API ...
- 这些描述了系统如何实际执行其决策。
- Agent是执行动作的实体。
- Action/Reasoning是基于其决策的具体动作。
- Tools和Calling API是系统如何与外部世界互动或获取额外信息的方法。

8. Embodiment
- 这指的是系统在物理世界中的实体或表示。例如,一个机器人的“身体”。

最后的输出是:“Here is your umbrella.” 这意味着基于所有这些处理和决策,系统认为明天有可能下雨,所以它决定给你一把雨伞。

总的来说,这个系统描述的是一个简化的模型,展示了是一个AI agent如何从感知信息开始,经过一系列内部处理和决策,最终做出响应的过程。
⛰️ AI 洞察:除了 ChatGPT, 新世界还涌现了哪些重磅新玩家?

近期一份来自硅谷知名投资机构 a16z的数据和报告,统计了Top 50 AIGC 领域的新秀,能够从整个生态视角看到不少全新的视角。

一些核心发现和行业洞察:

- 在 Top10 中,ChatGPT 是目前的王者,代表整个名单流量的 60%。Character.ai紧随其后,占 ChatGPT 流量的 21%。剩下的前10名呢? Bard、Poe、Quillbot、Photoroom、Civitai、Midjourney 、Hugginface以及 Perlexity。

- 与主流社交和视频类产品相比, AI 类新服务也仍然相当小。结合 Web + 移动流量,ChatGPT 的规模与 Reddit、LinkedIn 和 Twitch 大致相同,仍远低于传统“巨头”。

- 反过来说,新进的 Top 50中 80%都是近一年内出现的独立新产品,只有 5%属于巨头投资。(图 3 是它们融资情况的数量分布)

- 另一个重要的信号:排行榜单中有大批 GPT 驱动的创新。专有模型、微调和基于 API 的几大创新模式目前平分秋色。

- 还有一个明显特征,它们大多数都是 Web优先, 移动流量相对较少。 ChatGPT 虽然在 5 月份推出App 端, 但是占整体的 2% 不到;Poe 只有 5% 左右,Perplexity、Runway等都更低。 当然也有例外,Character.ai 移动端占比 46%,而 Photoroom 达到了 80%。(图4 有详细的展示)

- 就大类别来看,「通用助理」型产品(ChatGPT、Bard、Poe)占流量的 70%。另外两个类别正在发生变化:「伴侣型」现在占 13%,「内容生成 」占 10%;内容编辑占3.7% 和模型中心占2.3%共占位列前五。

- 从用户使用场景不难发现,移动端占比高的几位,具有更高的娱乐属性。 根据 Sensor Tower 数据,CharacterAI 平均每个用户每月访问 38 次,这一数字超过了 Instagram、FB 和 TikTok。

- 新公司如何获取增长?几乎是口碑式的。Reddit、Discord、新闻通讯等都是 「免费」获取流量的渠道。 而且,名单上 90% 的已经有了某种收入,其中绝大多数选择了订阅。
Back to Top