关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
分享一下自己的微信助手的 AI 工作流:
在构建AI 工作流时,有个很大的感知是,目前的 AI 离普通人(非行业从业者)的想象还挺远,媒体信息会不断地宣扬 AI 多么多么厉害,但实际应用在一个真实的场景时,会出现各种问题,很难达到可用的状态。
例如我输入一段英文,AI 怎么判断你想要的是翻译,还是基于内容的讨论?怎么判断你说的一句话是一个待办还是一篇笔记?
这些都是目前的 AI 无法做到的,所以我在搭建这个微信助手时,把它的范围定在“处理日常简单且高频的事项”。
通过workflow,使 AI 变得没那么性感,但输出变得稳定,然后通过工具(API)来使它实现更多的功能。
附件图片是完整的工作流,只将一些隐私信息遮挡了下。
#AI工作流
在构建AI 工作流时,有个很大的感知是,目前的 AI 离普通人(非行业从业者)的想象还挺远,媒体信息会不断地宣扬 AI 多么多么厉害,但实际应用在一个真实的场景时,会出现各种问题,很难达到可用的状态。
例如我输入一段英文,AI 怎么判断你想要的是翻译,还是基于内容的讨论?怎么判断你说的一句话是一个待办还是一篇笔记?
这些都是目前的 AI 无法做到的,所以我在搭建这个微信助手时,把它的范围定在“处理日常简单且高频的事项”。
通过workflow,使 AI 变得没那么性感,但输出变得稳定,然后通过工具(API)来使它实现更多的功能。
附件图片是完整的工作流,只将一些隐私信息遮挡了下。
#AI工作流
我们没有设计师,所有的设计稿都是通过 tldraw 画出原型,然后直接交由前端开发产出初始版本,并在这个基础上进行优化 & 迭代。
在确定了整套 design system 的前提下,这种方式可以让我们更加 focus 在产品上,并以非常快的速度进行迭代。
Midjourney 早上发布了一个新功能,挺好玩的。
可以基于提示词生成完全随机的图像风格。
使用方式:在提示词后添加 --sref random,如果找到了喜欢的风格可以通过 --sref url 将风格迁移到新图片上。
下面是/imagine a field of flowers --sref random运行 64 次的结果。
可以基于提示词生成完全随机的图像风格。
使用方式:在提示词后添加 --sref random,如果找到了喜欢的风格可以通过 --sref url 将风格迁移到新图片上。
下面是/imagine a field of flowers --sref random运行 64 次的结果。
今天和团队一起肝了两周的豆包客户端 AI 划词功能终于上线了,她能帮你在选中文字后能提供AI 搜索、翻译、解释、总结等各类 AI 辅助功能,让桌面上的其他应用都提前接入 AI 。 当前完全免费,大家阔以来试试,给些反馈...
下载地址:https://www.doubao.com/download/desktop
下载地址:https://www.doubao.com/download/desktop
顺丰的机器人打电话这么先进了吗?是可以对话的那种,我猜应该是抓取了关键词?
刚给我打电话,我一听是机器人本来想挂的,但是又怕他一直打,机器人问我快递员没联系上我,是否继续联系我配送,我以为会给个是or 不是,然后按1or 2 的选择,但是没有,它就等着我回答,我就说放快递柜,它竟然说:好的,之后会帮您放快递柜?
刚给我打电话,我一听是机器人本来想挂的,但是又怕他一直打,机器人问我快递员没联系上我,是否继续联系我配送,我以为会给个是or 不是,然后按1or 2 的选择,但是没有,它就等着我回答,我就说放快递柜,它竟然说:好的,之后会帮您放快递柜?
对 Agents 有兴可以看看,一篇论文了解 Agents 。
详细介绍了 Agents 的主要分类、定义以及设计 Agents 系统的时候需要注意的问题。
✱ Agents 的分类:
单一Agent架构:这些架构由一个语言模型驱动,并将自行执行所有推理、规划和工具执行。
多Agent架构:这些架构涉及两个或更多代理,每个代理可以利用相同的语言模型或一组不同的语言模型。这些代理可能可以访问相同的工具或不同的工具。每个代理通常有自己的人物形象。
多Agent架构又可分为垂直架构和水平架构:
垂直架构:在这种结构中,一个代理人充当领导者,其他代理人直接向他们汇报。
水平架构:在这种结构中,所有代理都被视为平等的一部分,并参与关于任务的一组讨论。
✱ 有效Agents的两个关键考虑因素:
推理和规划:
AI代理要有效地与复杂环境互动、做出自主决策并在各种任务中协助人类,它们需要强大的推理能力。
规划,需要强大的推理能力,通常分为五种主要方法:任务分解、多计划选择、外部模块辅助规划、反思和完善以及记忆增强规划。
有效工具调用:
代理抽象相对于提示基础语言模型的一个关键优势是代理能够通过调用多个工具来解决复杂问题。
这些工具使代理能够与外部数据源交互,从现有 API 发送或检索信息等。需要大量工具调用的问题通常与需要复杂推理的问题相辅相成。
论文地址:https://arxiv.org/abs/2404.11584
自从传出Emad辞职起我就对他未来做什么充满了好奇(以及想看能不能投点)。几周前我们联系上了Emad,大家一起讨论了一下去中心化AI,之后我又研究了他的过去的一些发言,最终整理出了这些东西。
TLDR -
▪AI作为下一个时代最重要的基础设施,不能由少数机构掌控。
▪每个国家都需要自己的国家AI,否则会面临文化消失的风险。
▪Emad会启动一系列公司,作为BootLoader去启动一个个国家和行业的AI模型。
▪国家AI对应国家数据集,它应由集体参与,凝聚集体智慧,被集体治理。
▪这个方式很难追求AGI,但足够作出好用的开源小模型,极大削弱单一大模型的统治地位。
▪小模型是私有化部署的关键。当个人也能很轻易的把出色的模型部署在手机和电脑,我们就迎来了一个平权的AI时代。
▪Web3技术是这一切成为可能的关键。
▪具体怎么做,我猜Emad自己也还没琢磨清楚并形成清晰的执行计划。