关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
这个研究有点强的,我们可能获得了另外一种增强Stable Diffusion控制的方法,它允许你使用富文本书写提示词。
比如指定某个提示词的颜色,例如提示词中有长发这个单词,然后你把长发的文字颜色改成了粉色,那么生成图像的头发颜色就会变成粉色。不只是那种粗略的粉色哦,是带有精确色值的。

下面我们分别来看一下它支持的富文本格式和生效方式:

首先你可以通过字体颜色控制生成对象的颜色,比如下面这张图Hair头发的字体颜色被改成粉色的时候生成图像的头发颜色就会变为粉色。

然后你可以改变对应提示词单词的字体来赋予图像对应的风格,这个就有点意识流了,全看模型对这个字体的感知,比如下面这这张图的guitar吉他的字体如果是比较放松的就会生成彩色的吉他,如果是古朴的手写体吉他就比较有年代感。

最后你可以给对应提示词的单词增加注释对其进行补充说明,比如下方这个例子中的cat被加上了“一只戴着墨镜、脖子上围着头巾的猫。”这样的注释在不影响整体画面的情况下猫这个主体准确的生成了注释的内容。你也可以给多个单词都加上这样的注释。

下面看一下这个论文大概的原理:
简单来说他们用了一种方法获得了每一个提示词单词对生成图像影响区域的映射,然后用将富文本的属性拿出来单独针对每个影响的提示词单词的区域再进行降噪操作从而修改扩散模型第一次生成的图像。

好了介绍到这里就结束了,希望早日有大神可以将这种方法集成到SD里面,或者开发出更多地富文本格式。
这里是论文的介绍:https://rich-text-to-image.github.io/
这里你可以试玩这个控制方法:https://huggingface.co/spaces/songweig/rich-text-to-image
Open AI重构了他们的 cookbook 页面里面的内容简直是LLM的宝藏,都是Open AI的开发人员精心挑选的工具和相关论文,还有非常多的教程。毕竟这帮人可能是这个星球上最懂LLM的人了,可以去发掘一下。
地址:https://cookbook.openai.com
昨晚偷偷上线了一个产品,118位AI绘画师联合出品共创的《AI绘画一本通》专栏,在小报童上线了!

其实是昨天晚上偷偷上线了,现在已经2500+订阅用户了

【下面是广告,你可以划走了】

365个AI绘画实操案例,MJ+SD,累计50万字,各行各业、变现、应用,不能说一网打尽吧,只能说覆盖面极广!
亮点:
365个Al绘画实操案例
看得懂(每个案例都有详细的教程)
学得会(普通人都可以使用的场景,做头像,做壁纸,做写真等)照着做(把Al绘画变现方式提炼出来)
还不贵
小报童持续推送,目前价格99元!

链接直达(微信内打开):https://xiaobot.net/p/yibentong?refer=3b1908ec-6bc2-49ff-af0a-2600f0503515
在组合创新这,ai 的确超越人类了。
这面相应该是贵不可言了🤣
Jeflon Zuckergates
这一波生成式AI浪潮在我的知识体系中,第一次看到的相对完整且偏行业(而非技术向)的梳理是去年9月红杉美国发的那篇:《Generative AI: A Creative New World》
这里https://www.sequoiacap.com/article/generative-ai-a-creative-new-world/
当时红杉给出了很多观点以及画了好几张直到今天你依然可以在各种关于AI的演讲中会出现的偏行业Maps性质的图片(图1,图2);

然后时隔一年,红杉美国最近又发了这个文章系列的更新:《
Generative AI’s Act Two》
https://www.sequoiacap.com/article/generative-ai-act-two/

文章的内容质量还是很高的,我简单总结下:

1、定义了ACT 1是发现了新的“锤子”---基础模型,现在在向ACT 2(端到端的解决问题)演进;
2、重新画了行业地图(图3),并且按照2C\2B\2内容生产者的框架重新划分;
3、增加了LLM开发者生态的行业地图;(图4)
4、回溯了之前判断中的错误:发展速度比所有人预期的都快、瓶颈不是客户需求而是GPU、应用和底层模型并未分离、竞争的急速加剧、大家伙们并没有落下、壁垒在客户而不是数据;
5、当然也确定了之前一些推论是正确的:生成式AI是一件大事、杀手级应用出现(ChatGPT\Character AI\Midjourney)、开发者很关键、大模型能力持续进化、版权/道德/伦理问题;
6、从月留存和用户活跃(DAU/MAU)数据对比,现在的AI应用相较于古典web2的那些大家伙们还有比较大的差距,他们需要持续的“证明价值”,以度过“awkward teenage years.”;

以及英文不好的同学可以看译稿,这里:
https://mp.weixin.qq.com/s/e2bOOnRfuV36WylWLidLxw
(国内的自媒体生态啊,也是真的够卷的了……)
现在的打电话机器人
除了ai
还有识别-匹配复读语音型的了
好家伙
——大家对机器人有什么常见误解?
——大众好像认为,人形机器儿就应该有一个脑袋、两个脚,其实不一定的。

?机器人就机器人,那你不像人为什么要叫人形机器人?
直接驱动技术能否替代减速器?
DALL·E 3 集成到 ChatGPT 中的使用体验,太丝滑了,太智能了。
完全自然语言对话,就能创建图像,修改图像。

Invalid media: video
Open AI悄咪咪整了个大的,DALL·E 3发布了!相较于2代它有这些提升:

➜图像的生成质量有了非常大的提高,风格与Adobe Firefly类似。
➜DALL·E 3可以准确地表示具有特定对象的场景以及它们之间的关系。
➜在图像内以及手等人体细节中生成文本时,DALL·E 3 比 DALL·E 2 有了显着改进。
➜DALL·E 3 是构建在GPT-3.5之上的,你不会写提示词不要紧,GPT-3.5会帮你优化你的提示,也可以通过对话来修改生成的图像。
➜最后DALL·E 3将会在10月初向Plus用户和企业版用户提供,也会提供对应的API。

这里查看相关细节:https://openai.com/dall-e-3
Back to Top