关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
好的体验:
1、有沉浸感的教学,所以上手比较快
2、组件比较丰富,基本覆盖手机APP的相关场景
3、效率提升明显
4、有一个想象力的空间是学习设计师原来的UI图,生成与设计师风格相符的图;
局限性:
1、当前支持手机设备的UI图设计,当然从创业角度以手机为切入点没有问题;
2、暂不支持icon,希望能够通过语言描述,生成对应的icon;
3、设计师是否愿意上传自己的图给平台,这个平台需要好好考虑。
一个人就是一个团队的愿景将不再遥远,目前全流程都能打通了;
1、产品经理有PM-AI:https://www.pm-ai.cn/
2、UI设计师有motiff:https://www.motiff.com/
3、开发人员有编程助手:太多了,就不一一列出来了,可以去我的知识库查阅:https://qp6cun00qk.feishu.cn/wiki/ZFrbwliFLikUKtkR45Dck5Y6nPe?table=tblmh1ARXz00c82O&view=vewFuUQgvn
最后,AI只是生产力工具,不要沉迷于生产力工具而忘记了去解决真正的用户需求。
在工作中使用AI可以带来工作效率的显着的改善。使用AI的被测试者比没有使用AI的被测试者平均多完成了 12.2% 的任务,完成任务的速度提高了 25.1% ,并且产生的结果质量提高了 40%。
同时他们还发现了一些其他的有趣结论:
类似GPT-4这样的模型是有一个能力的边界的,在边界内的任务他们可以处理的很好,边界外的任务则会搞得一塌糊涂但是没有人知道这类AI具体的能力边界。
他们分了三组一组不使用AI另一组使用AI,第三组使用AI的同时给与一定的培训,使用AI的两组任务完成效率和质量都远高于没有使用AI的组。
AI对工作能力越差的被测试者的提升越大,能力越强提高越小。所以高级人才和低级人才的差距会被快速拉平。
过于依赖AI可能会适得其反,反倒降低工作效率和质量,因为这些人无法区分AI的能力边界。
他们还为人类和AI协作的两种方式起了名字:
半人马:强调人与AI紧密结合,但是各司其职,人类主导整个流程,根据任务的性质合理调配人类和AI资源。。这种模式充分利用了人类的智慧与判断力以及AI的计算与生成能力。
机械人:人与AI的高度融合,在细节上形成循环迭代的优化过程,最终实现人机一体化。这种模式充分发挥了人类的灵活性和AI的生成能力。
我感觉这两种方式更像是现在人类跟AI合作的两个阶段:第一种大概知道AI的能力边界,可以简单的使用和复用AI输出的结果提升自己的工作能力。第二种机械人可以熟练的使用AI深入探索AI能力更加精细化的更AI协作和AI一起创作内容。
所谓的“常识信息”,不是指 1+1=2。常识指的每一个人的不同工作背景下观察到的独特而平常的细节。
比如刚刚上面文档的很多东西,都叫常识信息,你做一个 PPT,现场的发布环境,荧幕是其他工作人员搞定?还是由我来搞定和考虑细节?如果只是投影仪,那么颜色发灰这些问题要不要考虑……
所以,要想发挥 GPT Prompt 的威力(Agent),有两个点需要考量:
1️⃣ 专家“脑子里想的具体的东西”,而不仅仅是“你是一个 xx 专家”。后者是站在客户的角度。至少目前为止对于这种 Chain 的思想,大模型还不足以面对复杂的生产流程。
2️⃣ 进一步服务,持久地沟通。Few-shot 在单个环节输出结果不理想的情况下是必要的,但是单论对话无法从中心向外分化太远。必然需要在 1️⃣ 的前提下,量身定制每个环节,以及考虑是否需要 Few-shot,需要什么样的 Few-shot。另外,角色自动处理的好处是简化掉中间繁琐的流程,但应当在缺乏必要的信息前阻塞。这种自动化的流程需要以最大化的效率让用户尽可能少地 prompt,就像病人和医生的关系。病人 prompt:你是一个医疗专家;医生 prompt:反问 + 脑子里想的具体决策🌲
比如刚刚上面文档的很多东西,都叫常识信息,你做一个 PPT,现场的发布环境,荧幕是其他工作人员搞定?还是由我来搞定和考虑细节?如果只是投影仪,那么颜色发灰这些问题要不要考虑……
所以,要想发挥 GPT Prompt 的威力(Agent),有两个点需要考量:
1️⃣ 专家“脑子里想的具体的东西”,而不仅仅是“你是一个 xx 专家”。后者是站在客户的角度。至少目前为止对于这种 Chain 的思想,大模型还不足以面对复杂的生产流程。
2️⃣ 进一步服务,持久地沟通。Few-shot 在单个环节输出结果不理想的情况下是必要的,但是单论对话无法从中心向外分化太远。必然需要在 1️⃣ 的前提下,量身定制每个环节,以及考虑是否需要 Few-shot,需要什么样的 Few-shot。另外,角色自动处理的好处是简化掉中间繁琐的流程,但应当在缺乏必要的信息前阻塞。这种自动化的流程需要以最大化的效率让用户尽可能少地 prompt,就像病人和医生的关系。病人 prompt:你是一个医疗专家;医生 prompt:反问 + 脑子里想的具体决策🌲
我举个例子,错误示范:
❌ 你是一个 xx 专家,你很 blabla;
❌ 又或者,请检查 xx 是否有错误,是否存在 yy 问题。
我这里说的“错”不是指自己用 GPT 的场景,而是针对于构建自动化处理任务的 Agent 这个任务来说。
------
这两个错误真的是非常典型,而且本质上是一个问题。你把 GPT 想象为一个依靠 Prompt 进行选择性表达或是从中心点向四周分化的细胞。你会发现从底层能力上看,通过实验来看它就是没法分化太远(我是说目前),原因有两个。
你看 MetaGPT 文档第一句话说的是什么?
Code = SOP(Team) is the core philosophy. We materialize SOP and apply it to teams composed of LLMs.
SOP 是如何体现的?我换个问法好了,当你找某个方面的专家帮你做事 / 给予服务的时候,我们期望的其实就和上面一样 👆
我们不是这个方面的专家,期待的自然是专家能自行判断一些事情,或者说他知道该如何反过来 prompt 你(而不是一直你单方面 prompt),不妨回忆一下「询前表单」。
我之前和 @小江在想 在一个班一起学 PPT 定制设计。这个是小江之前写的:如何又好又快地解决 PPT https://wandering.feishu.cn/wiki/wikcnoz21ZQKZyCSfsxDANeKo3f 当然,还有一些沟通方面的我放在了截图里 👇
你可以看到文档里几乎所有的信息都可以被精简和提炼为一个个 Instructions. 可能是制作的哲理(风格),也可能是不同场景和生产环节的具体要求。
一个专家应该有他自己的判断。
相应地,当客户没有提供清楚所需要的必要的材料的时候,任务就不可能顺利进行。这个时候必然会由专家反过来提问客户说:「关于 xxx,我们还缺少 yyy 材料;以及 zzz 我们是否需要进一步沟通一下,因为在我看来,zzz 存在两种不同的方向,到底是 aaa 还是 bbb,我需要进一步确认品牌对于 ccc 的考量 blabla。」
1. Perception
- 这是认知流程的第一步。系统通过某种方式(如传感器、摄像头、麦克风等)对外部世界进行感知。
2. Inputs
- 感知到的信息被输入到系统中。在这个上下文中,输入是:“Look at the sky, do you think it will rain tomorrow?”
3. Environment
- 系统所在的环境或上下文。这可能涉及到当前的天气条件、时间、日期等。
4. TXT, Brain, Storage, Memory, Knowledge
- 这些都是系统内部的组件或资源。
- TXT指文本信息的输入。
- Brain指的是主要的处理单元或逻辑中心。
- Storage和Memory用来存储长期和短期的数据。
- Knowledge系统已有的信息库。
5. Summary, Recall, Learn, Retrieve
- 这些都是系统如何处理和管理其存储的数据和信息的方式。
- Summary是对输入信息的摘要。
- Recall和Retrieve是从存储中获取信息的操作。
- Learn指的是系统如何从新的数据中学习。
6. Reasoning from the current weather, Decision Making, Planning
- 这描述了系统如何处理输入信息、如何做决策,并如何计划其动作。
7. Agent, Action/Reasoning, Text, Tools, Calling API ...
- 这些描述了系统如何实际执行其决策。
- Agent是执行动作的实体。
- Action/Reasoning是基于其决策的具体动作。
- Tools和Calling API是系统如何与外部世界互动或获取额外信息的方法。
8. Embodiment
- 这指的是系统在物理世界中的实体或表示。例如,一个机器人的“身体”。
最后的输出是:“Here is your umbrella.” 这意味着基于所有这些处理和决策,系统认为明天有可能下雨,所以它决定给你一把雨伞。
总的来说,这个系统描述的是一个简化的模型,展示了是一个AI agent如何从感知信息开始,经过一系列内部处理和决策,最终做出响应的过程。
- 总的来说,大多数类别仍然 「悬而未决」,第一名比第二名领先不到 2 倍。去中心化的趋势不断显现,针对特定用例的产品越来越多。例如image gen、LeonardoAi((游戏向)正在与 Midjourney 共同成长。
更多详细内容,见a16z 的长篇报道 https://a16z.com/how-are-consumers-using-generative-ai/
AI 生态还在以加速繁荣,山峰以看不见的方式还在快速攀升。
更多详细内容,见a16z 的长篇报道 https://a16z.com/how-are-consumers-using-generative-ai/
AI 生态还在以加速繁荣,山峰以看不见的方式还在快速攀升。
【机器人畅想】
如果有一个机器人,可以帮忙切菜做饭洗碗、扫地拖地、给我端来热水泡脚、给我去烤箱热好石头做灸法、累了给我按摩、买菜时可以进入超市帮我提重物、出行的时候可以帮我收行李、按时提醒我吃维生素,甚至出行的时候可以变身成行李箱、不需要我拎手提箱可以自己走路,那该有多好!
问题:你最期待的3个机器人功能是什么?目前有多少已经实现了?
如果有一个机器人,可以帮忙切菜做饭洗碗、扫地拖地、给我端来热水泡脚、给我去烤箱热好石头做灸法、累了给我按摩、买菜时可以进入超市帮我提重物、出行的时候可以帮我收行李、按时提醒我吃维生素,甚至出行的时候可以变身成行李箱、不需要我拎手提箱可以自己走路,那该有多好!
问题:你最期待的3个机器人功能是什么?目前有多少已经实现了?
前几天拿到测试资格,试了一下HeyGen的数字人,藏师傅豁出去了真人出镜,哈哈。录得时候眼睛在看稿子所以角度不太对,将就一下。
各位可以跟其他类似产品的对比一下。视频很清晰面部变化和嘴形也没那么违和。我这是用手机摄像头录制的30秒视频。如果两分钟的话效果可能还会更好。
没有用克隆声音,因为他不支持中文,英语需要念好多,我口语实在不行。
Invalid media: video
各位可以跟其他类似产品的对比一下。视频很清晰面部变化和嘴形也没那么违和。我这是用手机摄像头录制的30秒视频。如果两分钟的话效果可能还会更好。
没有用克隆声音,因为他不支持中文,英语需要念好多,我口语实在不行。
Invalid media: video