关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
LLM 相关的基础文章很多人整理,AI 图像生成的比较少,刚好发现了一个,我又自己筛选了一下,一共 15 篇内容,都在这里了,如果想深入研究 SD,建议看看。

主要包括三个部分:图片生成简介、图像生成基础模型的精细调整和构建 AI 生成服务,。

都放在下面的这个个链接里,打开一个就都有了。元旦我也会找时间把这些内容翻译一下,然后发出来,可以收藏这条回来看。等不及可以直接看,下面是具体的分类和文章目录:

图像生成技术简介:

◆ 人工智能和艺术:机器学习如何改变创造性工作(报告)
◆ 平面设计师如何创建他们自己的AI工具(博客文章)
◆ AI图像生成器的工作原理以及扩散是什么(视频)
◆ 什么是Diffusion模型?(视频)
◆ Diffusion模型的工作原理(1小时课程)
◆ 初学者指南:Stable diffusion(指南)

基础模型的精细调整:

◆ SD1.5通用目的模型的全面精细调整指南(博客文章)
◆ SD模型的基准测试与混合(博客文章)
◆ 解耦文本编码器和UNET学习率(博客文章)
◆ D适应:再见学习率困扰?(博客文章)
◆ 自己精细调整通用稳定扩散模型指南(博客文章)

构建 AI 生成服务的后端:

◆ 如何构建一个生成AI服务的后端
◆ Stable diffusion提示:权威指南
◆ SD提示的精细调整:修改Stable diffusion提示的GPT 3.5(博客文章)
◆ SD提示的目录(目录)

所有内容链接:https://arc.net/folder/10431A09-4798-4002-B99A-2769BD9131FF
我们做Catjourney主要还是想帮助大家的找图和找提示词需求,只是好看用不到工作里面没有任何意义。
所以我们会紧跟最近的营销节点,不断上线可以用在项目和工作里的提示词和图片。

最近更新了很多春节国风红色主题的图,还有很多贺卡之类的样机模板,可以直接把文字或图片叠在上面。有需要的可以自行取用。

另外还上线了搜索功能,点击左边的搜索图标,输入相关单词就可以用了,现在还有点糙会继续优化。

这里使用:https://catjourney.life/
lsZ44eSevxrbwyA0S85p_4KvZGGNv3.png
7.8 MB
写 prompt 的 26 条参考原则。

这篇论文 (https://arxiv.org/abs/2312.16171) 总结了 26 条优化 prompt 的原则。我读完,感觉有点像是 OpenAI 官方提示词指南加上最近流行的几个技巧,比如给小费技巧「I'm going to tip you $300K for a better answer.」

还是可以当做一个很好的入门参考。

受 @杨昌 的启发,调整了一下用 Kimi 读论文的基本工作流。既然 Kimi 这么能翻,那能者多劳,多翻点吧。调整后的工作流如下:

第一步:逐句翻译论文的摘要和结论。

论文的摘要和结论很好地展现了论文基于什么背景,用什么方式解决什么问题,最后得到一个什么样的结果。

所以,Kimi,开始翻吧。参考提示词:这是一篇论文,请帮我逐句翻译论文的摘要 (Abstract) 和结论 (Conclusion)。

论文总结的 26 条原则中,有一条是不需要使用像“请”这样的礼貌用语。哎呀,这个手它不听使唤呀。

第二步:从 5 个方面进行总结。

参考提示词:https://docs.qq.com/doc/DSXp1YXJ4eHhLdklR

比起上一个版本,去掉了列出核心观点,因为我用下来,核心观点基本是对解决方案的复述。增加了一个方案局限性总结。

第三步:还是从 What、Why、How 的角度问问题。取决于你想了解什么,想到什么就问什么。反正 Kimi 的上下文窗口足够长。我个人还是习惯让 Kimi 先列出问题相关原文再回答。

参考提示词:https://docs.qq.com/doc/DSXdkc2dtampyYkRW

26 条原则提升结果参考图六。当然,所有的方案都是有适用条件的。这个结果是基于论文自己的数据集。

另外,论文作者很贴心,把 26 条原则和相应的 prompt 例子整理成文档了,见:https://github.com/VILA-Lab/ATLAS/blob/main/data/README.md
Wolfram的《这就是ChatGPT》中文版在微信读书上架了,建议阅读
我用AI编曲工具Suno把叶芝的情诗「当你老了」变成了一首重金属摇滚乐。

* Suno的Pro计划是支持版权商用的,而叶芝的作品也早就进入公版领域了,所以严格来说,我真的可以宣称我是这首歌的制作人……而Suno最低档的Pro计划也能支持每年6000首的歌曲生成额度,音乐人市场被冲击是迟早的事情了。

Invalid media: video
最近工作内容和机器人有关,浅浅道听途说做了点功课。

再加上今天小米汽车发布会有句话:「相信终有一天,全球每条路上都有小米汽车驰骋的身影。」

于是开始联想…造手机的造车,造车的造机器人…智能手机的普及率多少,智能车的普及率多少…要是哪天大家都像拥有智能手机一般普遍拥有了智能车…

噢!变形金刚或成最大预言家!
AI套壳应用如何把壳做厚?

1.一阶:直接引用Open ai接口,ChatGPT回答什么,套壳产品回答什么。卷UI、形态、成本。

2.二阶:构建Prompt。大模型可以类比为研发,Prompt可以类比为需求文档,需求文档越清晰,研发实现得越精准。套壳产品可以积累自己的优质Prompt,卷Prompt质量高,卷Prompt分发。

3.三阶:Embedding特定数据集。把特定数据集进行向量化,在部分场景构建自己的向量数据库,以达到可以回答ChatGPT回答不出来的问题。比如垂直领域、私人数据等。Embedding可以将段落文本编码成固定维度的向量,从而便于进行语义相似度的比较,相较于Prompt可以进行更精准的检索从而获得更专业的回答。

4.四阶:微调Fine-Tuning。使用优质的问答数据进行二次训练,让模型更匹配对特定任务的理解。相较于Embedding和Prompt两者需要消耗大量的Token,微调是训练大模型本身,消耗的token更少,响应速度也更快。

一个AI应用产品如果停留在做一阶和二阶,注定是个门槛极低的产品,没有任何壁垒。

而什么场景,何时以及如何使用三阶和四阶的能力,是个关键性的问题。
「AI直接读网页」这个功能的厉害之处,绝对被很多人低估了。

话不多说,今天先举一个「直接用 kimi 翻译和精读万字英文网页」的例子。

1、2.5 万字一口气翻译完

翻译的提示词,是在宝玉老师的提示词基础上改的,所以 LLM 不会被翻译成“法律硕士”,翻译结果既贴近原文也没有过浓的译腔。

但重点不在这里,重点在于,只要我把英文博客的网页链接放进去,2.5 万字的《Year One of Generative AI: Six Key Trends》可以“一口气”翻译完。

当然,说“一口气”有点夸张。为了保证2.5万字英文译文的稳定输出,我需要发一次直译的提示词,再发一次直译结果自我反思的提示词,最后发一次意译的提示词。直译和意译的过程中,再发一次继续,以免翻译不完。

但这是直接翻译完 2.5 万字的英文博客啊,我全程发 3 段提示词,输 2 个“继续”,翻译好的结果就全部出来了。

2、这是我之前不敢想象的

生成式 AI 爆发的这一年,很多优质信息在英文网页上。

中文自媒体的翻译,我只敢当做初筛工具,非一手的信息还是有点信不过。

但直接看英文网页,哪有看中文速度快?所以我每次都开着沉浸式翻译的插件,中英对照着看。但 LLM 每次都翻译成“法学硕士”,体验确实有点糟糕。

过程中遇到不懂的,我一般会先关掉插件,然后整段复制粘贴给 ChatGPT,请它帮我解释和分析。

没有上下文的解释,终究是欠了点意思;偶尔会自己手动写上下文,但也觉得有点浪费时间;遇到「内容的确很好但不懂的又很多」的情况,我就要不断地复制粘贴,就挺累人的。

现在好了,直接把网页丢给 kimi,先让它一口气翻译完。然后,我可以基于原始网页的全文信息,哪里不懂问哪里。

3、其他的话

我也试过用ChatGPT-4 和webpilot的官方 GPTs 去读。

开头能读,但 2.5 万字的量还是有点大,没点击几次“继续”按钮,整个就罢工了。

目前能保证这么长的输出的,暂时只看到 kimi。

最后,再次感谢宝玉老师的翻译提示词,感谢 kimi免费「翻译和精读万字英文网页」的功能。#AI工作流
Back to Top