关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
Open AI悄咪咪整了个大的,DALL·E 3发布了!相较于2代它有这些提升:

➜图像的生成质量有了非常大的提高,风格与Adobe Firefly类似。
➜DALL·E 3可以准确地表示具有特定对象的场景以及它们之间的关系。
➜在图像内以及手等人体细节中生成文本时,DALL·E 3 比 DALL·E 2 有了显着改进。
➜DALL·E 3 是构建在GPT-3.5之上的,你不会写提示词不要紧,GPT-3.5会帮你优化你的提示,也可以通过对话来修改生成的图像。
➜最后DALL·E 3将会在10月初向Plus用户和企业版用户提供,也会提供对应的API。

这里查看相关细节:https://openai.com/dall-e-3
震撼升级:Dall·E 3 即将登陆 ChatGPT Plus 和企业版

你没有看错,这是全新升级的 Dall·E 3 (文本到图像模型)在 ChatGPT 内的「深度对话」体验。不要因为这个「润物细无声」的演示视频而低估了它。

这不仅仅是对 Midjourney 的回应,更是人机对话、与 AI 共同创作的范式升级,因为它更懂你。

在我看来,这是 GPT-4 进入多模态时代第一站的「战地钟声」。

更多惊艳的效果图,见官方网址 https://openai.com/dall-e-3

Invalid media: video
在工作时,你最痛苦的时刻是什么?
不确定和不尊重,是我本人最痛苦的职场时刻

你们有没有尝试过去听一个完全不熟的人发来的连续3个60秒语音?而且还是不得不听的那种?即使是语音转文字,我也需要透过包裹着大量语气词的内容去了解对方到底想要用180秒传达什么,这180秒不是剪辑得当的播客,不是口齿清晰的短视频,没有逻辑和配乐,只有想到哪儿说哪儿,但你又不得不去捋 去解读。

所以当我意识到AI可以解决这个事情后,我真的一瞬间没有那么痛苦了,我甚至期待有人给我发语音,我可以10秒就搞定这个曾经让我非常不悦的事儿:想象一下我本人,带着不屑和冷笑,在3秒内轻松把那几段转换完的文字扔进AI的文本框,AI在三秒内给我清晰又冷静地总结出重点,我用三秒钟看完。10秒,就10秒,你逼逼叨叨180秒,我只需要10秒,我赢了。

所以朋友们,用AI吧,把那些让你不舒服的事交给AI,让AI去应付那些不值得尊重的人,你应该做更快乐更有意义的事情,而不是被3个60秒的语音折磨,毁了一天的好心情。

当然,「AI帮个忙」里肯定是有可以做这事儿的小帮手,请用:https://aibang.run/tool/tldr/?refId=jike
打算看一看炒菜机器人
米哈游最近与复旦NLP实验室合著了一篇86页的AI Agent论文,该论文从认知核心(推理,记忆,规划)、感知(文本,视觉,听觉)、行动(文本,工具使用,具身)、参与者(单智能体,多智能体,真人与智能体)和环境(虚拟沙盒,物理引擎)等方面做了一个很好的AI Agent概述。

如果“斯坦福小镇”这样的生成式Agent可以应用到《原神》或其他大型MMORPG游戏中,那无疑将带来令人难以预料的惊喜。但目前来看大规模部署Agent的成本和效率等关键难题还有待突破。

论文链接:https://arxiv.org/abs/2309.07864
真的有用工荒吗?哪里有
自介下团队做的一个小东西:Kuli Kuli

是一款出国时用的菜单翻译app,为什么会做这么小的一个产品?主要原因是所有的翻译app在点菜场景下都不够好用,同时AI在理解菜单上比传统翻译有了更好的解释能力

不是什么了不起的东西,希望好用有用也欢迎大家在评论区报bug提建议

https://apps.apple.com/cn/app/kuli-kuli/id6458146511
最近给自己开了新坑,研究AI时代下新的交互范式:NUI
出发点是我认为Chat不是终局,AI会带来的全新的交互变革和生产力,而真正顶尖的团队应该去探索新时代的体验应该是什么(而不是在产品里增加office📎
像奶茶咖啡这类固定配比的饮料
怎么还没有大规模使用机械臂或者机器人程序
居然还在大规模使用人工
甚至在想是不是在保就业率🧐
Midjourney 做立绘真是好用。
Back to Top