关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
这一波生成式AI浪潮在我的知识体系中,第一次看到的相对完整且偏行业(而非技术向)的梳理是去年9月红杉美国发的那篇:《Generative AI: A Creative New World》
这里https://www.sequoiacap.com/article/generative-ai-a-creative-new-world/
当时红杉给出了很多观点以及画了好几张直到今天你依然可以在各种关于AI的演讲中会出现的偏行业Maps性质的图片(图1,图2);

然后时隔一年,红杉美国最近又发了这个文章系列的更新:《
Generative AI’s Act Two》
https://www.sequoiacap.com/article/generative-ai-act-two/

文章的内容质量还是很高的,我简单总结下:

1、定义了ACT 1是发现了新的“锤子”---基础模型,现在在向ACT 2(端到端的解决问题)演进;
2、重新画了行业地图(图3),并且按照2C\2B\2内容生产者的框架重新划分;
3、增加了LLM开发者生态的行业地图;(图4)
4、回溯了之前判断中的错误:发展速度比所有人预期的都快、瓶颈不是客户需求而是GPU、应用和底层模型并未分离、竞争的急速加剧、大家伙们并没有落下、壁垒在客户而不是数据;
5、当然也确定了之前一些推论是正确的:生成式AI是一件大事、杀手级应用出现(ChatGPT\Character AI\Midjourney)、开发者很关键、大模型能力持续进化、版权/道德/伦理问题;
6、从月留存和用户活跃(DAU/MAU)数据对比,现在的AI应用相较于古典web2的那些大家伙们还有比较大的差距,他们需要持续的“证明价值”,以度过“awkward teenage years.”;

以及英文不好的同学可以看译稿,这里:
https://mp.weixin.qq.com/s/e2bOOnRfuV36WylWLidLxw
(国内的自媒体生态啊,也是真的够卷的了……)
现在的打电话机器人
除了ai
还有识别-匹配复读语音型的了
好家伙
——大家对机器人有什么常见误解?
——大众好像认为,人形机器儿就应该有一个脑袋、两个脚,其实不一定的。

?机器人就机器人,那你不像人为什么要叫人形机器人?
直接驱动技术能否替代减速器?
DALL·E 3 集成到 ChatGPT 中的使用体验,太丝滑了,太智能了。
完全自然语言对话,就能创建图像,修改图像。

Invalid media: video
Open AI悄咪咪整了个大的,DALL·E 3发布了!相较于2代它有这些提升:

➜图像的生成质量有了非常大的提高,风格与Adobe Firefly类似。
➜DALL·E 3可以准确地表示具有特定对象的场景以及它们之间的关系。
➜在图像内以及手等人体细节中生成文本时,DALL·E 3 比 DALL·E 2 有了显着改进。
➜DALL·E 3 是构建在GPT-3.5之上的,你不会写提示词不要紧,GPT-3.5会帮你优化你的提示,也可以通过对话来修改生成的图像。
➜最后DALL·E 3将会在10月初向Plus用户和企业版用户提供,也会提供对应的API。

这里查看相关细节:https://openai.com/dall-e-3
震撼升级:Dall·E 3 即将登陆 ChatGPT Plus 和企业版

你没有看错,这是全新升级的 Dall·E 3 (文本到图像模型)在 ChatGPT 内的「深度对话」体验。不要因为这个「润物细无声」的演示视频而低估了它。

这不仅仅是对 Midjourney 的回应,更是人机对话、与 AI 共同创作的范式升级,因为它更懂你。

在我看来,这是 GPT-4 进入多模态时代第一站的「战地钟声」。

更多惊艳的效果图,见官方网址 https://openai.com/dall-e-3

Invalid media: video
在工作时,你最痛苦的时刻是什么?
不确定和不尊重,是我本人最痛苦的职场时刻

你们有没有尝试过去听一个完全不熟的人发来的连续3个60秒语音?而且还是不得不听的那种?即使是语音转文字,我也需要透过包裹着大量语气词的内容去了解对方到底想要用180秒传达什么,这180秒不是剪辑得当的播客,不是口齿清晰的短视频,没有逻辑和配乐,只有想到哪儿说哪儿,但你又不得不去捋 去解读。

所以当我意识到AI可以解决这个事情后,我真的一瞬间没有那么痛苦了,我甚至期待有人给我发语音,我可以10秒就搞定这个曾经让我非常不悦的事儿:想象一下我本人,带着不屑和冷笑,在3秒内轻松把那几段转换完的文字扔进AI的文本框,AI在三秒内给我清晰又冷静地总结出重点,我用三秒钟看完。10秒,就10秒,你逼逼叨叨180秒,我只需要10秒,我赢了。

所以朋友们,用AI吧,把那些让你不舒服的事交给AI,让AI去应付那些不值得尊重的人,你应该做更快乐更有意义的事情,而不是被3个60秒的语音折磨,毁了一天的好心情。

当然,「AI帮个忙」里肯定是有可以做这事儿的小帮手,请用:https://aibang.run/tool/tldr/?refId=jike
打算看一看炒菜机器人
米哈游最近与复旦NLP实验室合著了一篇86页的AI Agent论文,该论文从认知核心(推理,记忆,规划)、感知(文本,视觉,听觉)、行动(文本,工具使用,具身)、参与者(单智能体,多智能体,真人与智能体)和环境(虚拟沙盒,物理引擎)等方面做了一个很好的AI Agent概述。

如果“斯坦福小镇”这样的生成式Agent可以应用到《原神》或其他大型MMORPG游戏中,那无疑将带来令人难以预料的惊喜。但目前来看大规模部署Agent的成本和效率等关键难题还有待突破。

论文链接:https://arxiv.org/abs/2309.07864
真的有用工荒吗?哪里有
自介下团队做的一个小东西:Kuli Kuli

是一款出国时用的菜单翻译app,为什么会做这么小的一个产品?主要原因是所有的翻译app在点菜场景下都不够好用,同时AI在理解菜单上比传统翻译有了更好的解释能力

不是什么了不起的东西,希望好用有用也欢迎大家在评论区报bug提建议

https://apps.apple.com/cn/app/kuli-kuli/id6458146511
Back to Top