关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
一个懒人 LoRA 制作指南,手把手教你用 OneTrainer 训练自己的 AI 绘画模型,无需深入理论,轻松掌握关键步骤。

作者是用XL生成的图片,你可以用MIdjoureny生成效果比较好。

我完整翻译了内容,并且重新整理了适合推特阅读的版本,或者你可以在下面看完整翻译的内容:

-----------------------------

1️⃣ LoRA 模型制作教程

作者作为一名 LoRA 模型制作的新手,通过自己的学习实践,总结了一份简明扼要的制作教程。

这份教程不涉及太多理论知识,而是直奔主题,手把手教初学者如何训练自己的 LoRA 模型。

作者坦诚分享了自己从最初尝试 Embedding 和 LoRA 时遇到的问题,以及后来找到的解决方法,为读者提供了宝贵的经验参考。

所需工具介绍 要制作 LoRA 模型,需要准备一些必要的工具。作者推荐使用自己喜欢的模型和图像生成工具,他个人使用的是 StableSwarmUI 和 GhostXL 模型。

此外,还需要一个训练工具,作者选择了 OneTrainer,因为有人说它比另一个常用的工具 Kohya 更易用。作者还提到,训练时如果需要将 SDXL 格式的图像转换为 SD 格式,需要在设置中开启分辨率覆盖选项。

2️⃣ LoRA 模型制作步骤

作者将 LoRA 模型的制作过程分为三个主要步骤:

第一步是用现有的模型生成大量高质量的图像作为训练数据;

第二步是人工检查挑选图像,剔除所有质量不合格的;

第三步是使用 OneTrainer 进行训练,调整必要的参数设置。

作者还特别提到,在训练时如果需要将 SDXL 格式的图像转换为 SD 格式,一定要记得开启分辨率覆盖选项,否则训练会出问题。

训练参数调整心得 作为一名新手,作者在调整训练参数时主要参考了一份网上的指南。

他尝试调整了 Lora 设置中的 rank 参数,将其从默认的 16 改为 32,解决了模型训练中遇到的问题。作者分享了这份参数调整指南的链接,供其他学习者参考。

3️⃣ 作者的训练数据集分享

为了帮助更多学习者,作者慷慨地分享了自己完整的训练图像数据集,其中还包含了他使用的 OneTrainer 配置文件。这些数据可供其他 LoRA 制作人下载参考和使用。数据集已经过作者的筛选,图像质量有保证。

4️⃣ 训练成果展示
万字解析AI视频《Devices》工作流全网浏览2k+啦!
工作流在OpenArt上有600views+140+下载啦!
感谢AJ收录通往AGI之路!

全文:https://mp.weixin.qq.com/s/tkcvmtybmj2xHkIaeIQypw
工作流下载:https://openart.ai/workflows/pXkm6GZX8G19I22Odeo4

Blender建模动画 + ComfyUI转绘 + 剪映剪辑
是一条很强大的工作流
如果你是想原创实验艺术、还是测试动画转绘,都可以去按照我分享的思路去试试。

而且我分享的经验里不仅讲了我如何构思和实现的,还讲述了怎么debug修正遇到的很多错误。非常的干货。
昨天的 line2normal 我在 ComfyUI 里搭出来了
工作流在评论区,也可以在 OpenArt 上下载:https://openart.ai/workflows/2LZhKiApQUAnIdJTgplz

需要接对应的 LoRA 和 controlnet 模型:

🔸 Line2Normal LoRA(权重1.2-1.5):https://huggingface.co/tori29umai/SDXL_shadow/tree/main
🔸 ControlNet-LoRA:https://huggingface.co/stabilityai/control-lora/blob/main/control-LoRAs-rank256/control-lora-canny-rank256.safetensors

ControlNet 的预处理器接 lineart 或者 canny 都可以,我觉得 lineart 效果更好。

我还接了一个 WD14 自动打标,因为发现效果和描述也有关系。

动画的底模效果也会更好,因为 LoRA 是 SDXL 上训练的,所以底模要用 XL 的,我用的 animagine xl 3.1 或者 realcartoonxl_v5
终于有产品能够用AI重新思考和构建稍后阅读和内容收集工具了。#ai#

iki这个笔记工具非常强大,你不需要整理自己收藏的内容一切都交给AI来完成。

它可以处理你收集的大量杂乱、非结构化数据,让应用程序为你组织和显示信息,而不必你自己动手。

主要功能有:

✲ 自动提取和总结

✲ 自动在聊天和任何现有笔记中显示相关数据

✲ 为任何文件添加个人注释

✲ 与团队共享数据集合

✲ 关注社区其他人创建的合集和阅读内容

你可以在这里尝试IKI:https://app.iki.ai/ask
生财有术这个社群确是厉害,一个谈钱不伤感情的地方,里面个个都是搞钱小能手,联合圈内的搞钱大佬,准备想要加入生财的朋友搞到了一些福利,不加入生财也可以体验到,点赞超过20就安排。
@text1024
Media is too big
VIEW IN TELEGRAM
LLocalSearch 一个开源的完全本地化的AI搜索工具,无需 OpenAI 或 Google API 密钥。

过去24小时增长了一千颗星星。感兴趣的话可以部署一下试试。

项目特点:

🕵️ 完全本地化运行,不需要连接到外部API,因此无需API密钥。

💸 适用于性能相对较低的大型语言模型硬件,例如在演示视频中使用的是7b模型。

🤓 提供详细的进度日志,这有助于用户更好地理解搜索和处理过程。

🤔 支持用户提出后续问题,以便深入探讨或解决问题。

📱 界面对移动设备友好,适合在手机或平板电脑上使用。

🚀 使用Docker Compose工具,可以快速且轻松地部署此服务。

🌐 提供网络界面,使用户可以从任何设备轻松访问和使用。

💮 该服务提供精心设计的用户界面,支持浅色和深色模式,满足不同用户的视觉偏好。

项目地址:https://github.com/nilsherzig/LLocalSearch
🎨 重磅更新:Dall·E的「局部重绘」现在已登录全平台~

ChatGPT的网页、iOS和安卓全平台都已经上线,你可以在画面中无限修改局部内容了。

为什么这个局部重绘(in-painting)功能超级无敌?
它意味着一致性(角色、对象)大幅提升,让文生图工作流效率展开范式升级。

去年Midjourney 推出时引发过创作社区的热潮,考虑到Dall·E 惊人的理解力和用户覆盖面,这是山峰再一次攀升。借助局部重绘功能,你将探索出前所未有全新的工作流。

实现你的想象,用自然语言不断说出想法就行了。 Amazing~ 🎉
斯坦福大学CS25课程将会向所有人开放,你可以通过Zoom接入直播参与课程。

英语好的人推荐看看,课程内容和讲师都很强。

这个课程主要会每周邀请Transformer研究的前沿专家,来分享他们在最新突破上的成就。比如英伟达、OpenAI以及Mistral AI的人。

内容涵盖从大型语言模型(如GPT和Gemini)到在艺术创作(比如DALL-E和Sora)、生物学和神经科学应用、机器人学等领域的创新应用。

课程主页:https://web.stanford.edu/class/cs25/
发现一个根据线条生成法线贴图的项目:

🔸 项目地址:github.com/tori29umai0123/Line2Normalmap
🔸 作者笔记:http://t.cn/A6TJAVpb

目前些到的两个运用方向:

🔹 利好材质,SD生成的纹理,现在可以一并生成法线贴图了。
🔹 利好 AI 影楼,前景合成背景以后提取线条,生成新的normalmap,再重新生成光影。

但我都还没试,求社区出一个 ComfyUI 版本
卧槽,傅盛这篇访谈绝了
个人觉得和朱啸虎那期播客一般精彩

进入到企业内做AI
你才会意识到大模型

通用但不好用
大但不强
成本还很高

我为啥要自己跑用研
尼玛公司用研一个周期三个月
黄花菜都凉了
着急找PMF呀😫
一堆pm坐在办公室里拍脑门全yy出来了

不找到好的商业闭环
谁给你钱烧到AGI?

前段时间我还在想傅盛说的百亿模型
能力天花板能不能覆盖需求
转头一问业内朋友
大家都说够了够了

千亿/万亿模型
超长文本
理想主义很理想
现实或许会很骨感
AI探索指南
最近在搞毕设,分享一个我的阅读论文文献SOP 论文,它的格式非常八股,基本都是按照这样的结构来呈现的:标题 → 概要 → 介绍 → 方法 → 实验 → 结论。 结合Stanford教授 Srinivasan Keshav 分享的三遍法,我凝练出来一个结合AI的五步法 1. 选读:通过检索工具选出合适的论文,以及在Twitter等社交媒体上看这篇论文的含金量 2. 略读:读论文前,我们得搞清楚这篇论文值不值得读,我们不需要全部都读完,这样会浪费我们很多时间。使用AI Summary工具,回答关键问题:…
推荐一个工具UPDF,他有强大的编辑功能,能直接改动这篇PDF的文章内容,排版布局,能让你编辑PDF有编辑Word的那种体验,修改文字,字体、对齐、大小、颜色,复制文字。图片编辑也很丝滑,和Word一样。图片编辑功能可以修改页面原本图片的尺寸、旋转角度、裁剪、或者替换图像。也可以在页面任意位置添加新的文本或图片。辅助我们去理解文献。
这样我们就可以直接在PDF里去记笔记,无论你是想添加高亮、还是 下划线 、文本注释、文本框、文本标注等都可以。还可以进行高亮和笔记。我们可以自定义我们高亮代表的意思,把文献拆分开来,辅助我们理解加深记忆,也方便我们日后查找相关内容,比如
- 重点观点用黄色
- 论证的过程和论据用橙色
- 数据用红色
- 等等
他还有一些其他功能,有各种可爱的贴纸可以选择,无聊的时候可以鼓励一下自己

5. 复盘:假设自己是作者,重新复盘整篇文章,如果是我,我会采取什么样的解决方案?我会怎么做实验?

原文整理在:https://k5ms77k0o1.feishu.cn/wiki/wikcnRnDZ1yPM0PMpkAIoQipQnb?from=from_copylink
最近在搞毕设,分享一个我的阅读论文文献SOP

论文,它的格式非常八股,基本都是按照这样的结构来呈现的:标题 → 概要 → 介绍 → 方法 → 实验 → 结论。

结合Stanford教授 Srinivasan Keshav 分享的三遍法,我凝练出来一个结合AI的五步法

1. 选读:通过检索工具选出合适的论文,以及在Twitter等社交媒体上看这篇论文的含金量

2. 略读:读论文前,我们得搞清楚这篇论文值不值得读,我们不需要全部都读完,这样会浪费我们很多时间。使用AI Summary工具,回答关键问题:
1. 主要解决了什么问题?
2. 提出了什么解决方案?
3. 解决方案中核心的方法/步骤/策略是什么?
4. 结论是什么?
5. 有什么限制条件?
请有条理地组织以上信息,确保涵盖每一个点。
这一类可以AI Summary的工具非常多,主要看总结能力和花费金额,推荐使用
1. txyz:介绍在下面的工具安利里
2. PopAI:介绍在下面的工具安利里
3. ChatGPT:ChatGPT直接上传PDF,进行对话也可以
4. Kimi:国内可以使用
但是还有一个点需要注意,就是你自己需要去判断正确性,包括这篇论文的正确性——他有没有在和你胡扯

3. 精读:接下来就开始精读了
1. 精读的顺序:摘要 → 结论 → 方法 → 实验 → 数据和图表
2. 对于需要翻译的同学来说,必备的就是“沉浸式翻译”这个插件,具体使用看下面
3. 看图表和参考文献,判断是否正确
4. 在这一步,遇到问题,也可以借助AI工具,
1. 有不懂的细节继续提问,从 What、Why、How 三个方面抽取问题。

What:即哪些概念是不熟悉的。

Why:为什么要使用这种策略/方法,好在哪里?

How:具体论文中是怎么实现某种策略/方法的。
2. 对于不懂图表的,也可以借助AI工具,分析图表
1. PopAI:接入了GPT-4V的API,可以对论文图表进行解读
2. ChatGPT:直接读图
3. 亿图图示:也可以解读图表

4. 整理笔记:精读完就可以整理笔记了,这里我的思路是基于PDF本身去整理
RAGFlow开源了一个RAG框架,有下面这些特点:

RAGFlow的核心功能是文档的智能解析和管理,支持多种格式,并允许用户使用任何大型语言模型查询他们上传的文档。

RAGFlow提供了多种智能文档处理模板,以满足不同行业和角色的需求,如会计、人力资源专业人员和研究人员。

它还强调了智能文档处理的可视化和可解释性,允许用户查看文档处理结果,进行比较、修改和查询。

RAGFlow的一个关键优势是它允许LLM以受控方式回答问题,提供了一种理性和基于证据的方法来消除幻觉。

项目地址:https://github.com/infiniflow/ragflow
Vercel:用生成式UI重塑前端开发

vercel的ai sdk+ai chatbot都做的很方便上手,我将ai-chatbot项目https://github.com/vercel/ai-chatbot 实践套壳gpt(chat.aicube.fun),缝合langchain官方的next.js+langchain.js的示例模板https://github.com/langchain-ai/langchain-nextjs-template,很轻松就实现了搜索、浏览、Dall-E生图等gpts的功能.

一键部署到vercel,还用tauri打包成客户端,实践下来确实可以成为AI Navtive初创企业的首选框架🚲

当然新的rsc版本,多了AI State和UI State这样的设定,开始让框架有点繁琐了,我个人是不太感冒,庆幸自己是在之前fork了这个项目,保留了简洁的chatbot框架,方便自己拓展改造。欢迎对rsc有研究的朋友指正。

🧡感谢文章作者 @Scarlett-事业脑版 的精彩创作,期待更多好文!
AI探索指南
一个顶级 AI 产品经理的自我修养 | 对谈光年之外产品负责人 Hidecloud - 42章经 听完播客最大的感受是:AI行业的非技术人员,如果愿意读论文和测 demo,投资回报率(ROI)将会极高。 一、先说测 demo 多体验demo,多做实验,实际上是在培养我们的认知和思考能力,思考在工程和产品上还有哪些机会可以探索。 因为这个行业还处于早期阶段,我们付出一点小小的努力,就能获得很高的投资回报率(ROI)。 1、往大了说,可以发现很多潜在机会 在这个过程中,我们会发现一个模型要真正运行…
同时,在特定领域,我们至少需要通读八九篇核心论文,这样才能基本理解,并解释为什么某篇论文让我们感到兴奋。

未来五到十年里,很多现在的知识可能会变成常识。到那时,了解与否的差异可能并不显著。但在当前,通过阅读论文获得的信息量是巨大的,它能显著提高我们的认知水平,帮助你做出更准确的判断。

2、去哪找论文,怎么读论文?

那么,想要找到新颖或高质量的论文,我们应该去哪里呢?可以关注一些知名平台,如百度学术,或是OpenAI的Andrej Karpathy,看看他们推荐了哪些论文。实际上,你需要让自己沉浸在学术环境中,对感兴趣的论文深入阅读。Hidecloud个人习惯一天至少读两到三篇。

Hidecloud通常将论文分为两类:一类是他认为具有范式创新的,另一类是技术细节有所改进的。

对于后者,Hidecloud会快速阅读,关注他们具体优化了哪些方面,提升了多少。但对于那些具有范式创新的论文,Hidecloud会仔细研读。

阅读论文的好处是巨大的,它能直接帮助我们在产品设计和技术改进上取得实际成效。比如一些论文不仅提出新模型,还包含了工程优化的技巧,比如加速模型推理等。产品经理阅读这些内容后,可以直接应用于产品中,提升性能。

更重要的是,通过阅读前沿论文,可以及时了解最新模型的能力边界,以及新出现的技术创新点。进而,重新审视传统问题,开拓新的解决思路。这种全新的思考方式,有可能带来行业颠覆性的创新机会。

三、读完论文、测完demo,如何产研协同?

1、之前产品更依赖工程师

传统的软件开发模式中,产品经理负责需求分析和功能设计,然后把需求文档交给工程师,由工程师将这些抽象的业务逻辑转化为具体的代码实现。

这个过程需要产品经理和工程师密切配合,但两个角色的职责划分还是比较明确的。

2、现在产品也能做点开发

而现在,一些低代码(Low-code)或无代码(No-code)开发平台的出现,让非技术背景的人也能通过可视化的方式快速构建应用。

比如使用自然语言描述业务流程,然后自动生成可执行的工作流(Workflow)。这在一定程度上降低了开发门槛,产品经理可以更直接地参与到原型设计和功能实现中来。

3、工程师可能更专注后台问题

借助大语言模型的能力,产品经理用自然语言描述的复杂业务逻辑,可能会被自动转换成更加结构化、标准化的中间表示,如可视化的流程图(pipeline)或特定领域语言(DSL)等形式。这种表示一方面可以清晰地呈现业务逻辑,另一方面也更容易转化为最终的代码实现。

在这种趋势下,产品经理在功能决策上可能会有更大的自主权,可以通过灵活组合各种逻辑单元来快速响应业务变化。而工程师则会更专注于系统架构、性能优化、弹性扩展等技术问题,去建设一个高可用、高并发的稳定平台。
一个顶级 AI 产品经理的自我修养 | 对谈光年之外产品负责人 Hidecloud - 42章经

听完播客最大的感受是:AI行业的非技术人员,如果愿意读论文和测 demo,投资回报率(ROI)将会极高。

一、先说测 demo

多体验demo,多做实验,实际上是在培养我们的认知和思考能力,思考在工程和产品上还有哪些机会可以探索。

因为这个行业还处于早期阶段,我们付出一点小小的努力,就能获得很高的投资回报率(ROI)。

1、往大了说,可以发现很多潜在机会

在这个过程中,我们会发现一个模型要真正运行起来并不像想象中那么简单。它涉及很多环节,包括数据处理、参数设置等。解决每一个问题的过程中,你可能会发现一些潜在的产品机会。

比如,有时候Hidecloud在配置模型时,就会突然发现这个模型产生的结果挺有趣的。但普通用户根本无法直接使用,因为它涉及到很复杂的数据预处理环节。以声音克隆为例,如果讲一分钟的话来克隆,不是直接就能克隆的。那一分钟的内容,需要经过七八步复杂的预处理,普通人很难独立完成。

如果普通人搞不定,这不就是一个机会吗?如果我们能帮他们完成整个数据预处理和训练过程,直接交付最终效果,这不也是一个机会吗?

但如果我们不亲自去体验,首先无法感受到看到最终结果那一刻的喜悦,其次也不会知道要达到那个效果还会遇到哪些障碍。

2、往小了看,能甩开国内同行一大截

在Twitter上,偶尔会有一些外国人分享有趣的小产品。比如,有人发布了一个有趣的小产品,在聊天过程中你要去猜测对方是AI还是真人。这种东西挺有意思,但国内似乎还没有人做类似的产品。

更简单一点,我们可以尝试自己写个GPTs。这种事情不需要编程,对吧?但说实话,就像Hidecloud平时面试产品经理,会问他们有没有尝试过创建自己的GPTs?

可能十个人里面九个都会被Hidecloud淘汰,因为大家还是不太愿意亲自动手,更喜欢看别人的成果。但一旦我们亲自动手,获得的信息量会比看视频或阅读文档都要大得多。

二、再说读论文

1、只需8篇核心论文,显著提高认知水平

作为产品经理,学习AI的一个有效途径就是阅读论文。

Hidecloud之前总结过Stable Diffusion的发展历史,从2020年至今,这三年间的关键信息其实并不多,大约只有八篇经典论文,把它们串起来就能清楚地理解整个原理。
Back to Top