关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
工作流在OpenArt上有600views+140+下载啦!
感谢AJ收录通往AGI之路!
全文:https://mp.weixin.qq.com/s/tkcvmtybmj2xHkIaeIQypw
工作流下载:https://openart.ai/workflows/pXkm6GZX8G19I22Odeo4
Blender建模动画 + ComfyUI转绘 + 剪映剪辑
是一条很强大的工作流
如果你是想原创实验艺术、还是测试动画转绘,都可以去按照我分享的思路去试试。
而且我分享的经验里不仅讲了我如何构思和实现的,还讲述了怎么debug修正遇到的很多错误。非常的干货。
昨天的 line2normal 我在 ComfyUI 里搭出来了
工作流在评论区,也可以在 OpenArt 上下载:https://openart.ai/workflows/2LZhKiApQUAnIdJTgplz
需要接对应的 LoRA 和 controlnet 模型:
🔸 Line2Normal LoRA(权重1.2-1.5):https://huggingface.co/tori29umai/SDXL_shadow/tree/main
🔸 ControlNet-LoRA:https://huggingface.co/stabilityai/control-lora/blob/main/control-LoRAs-rank256/control-lora-canny-rank256.safetensors
ControlNet 的预处理器接 lineart 或者 canny 都可以,我觉得 lineart 效果更好。
我还接了一个 WD14 自动打标,因为发现效果和描述也有关系。
动画的底模效果也会更好,因为 LoRA 是 SDXL 上训练的,所以底模要用 XL 的,我用的 animagine xl 3.1 或者 realcartoonxl_v5
工作流在评论区,也可以在 OpenArt 上下载:https://openart.ai/workflows/2LZhKiApQUAnIdJTgplz
需要接对应的 LoRA 和 controlnet 模型:
🔸 Line2Normal LoRA(权重1.2-1.5):https://huggingface.co/tori29umai/SDXL_shadow/tree/main
🔸 ControlNet-LoRA:https://huggingface.co/stabilityai/control-lora/blob/main/control-LoRAs-rank256/control-lora-canny-rank256.safetensors
ControlNet 的预处理器接 lineart 或者 canny 都可以,我觉得 lineart 效果更好。
我还接了一个 WD14 自动打标,因为发现效果和描述也有关系。
动画的底模效果也会更好,因为 LoRA 是 SDXL 上训练的,所以底模要用 XL 的,我用的 animagine xl 3.1 或者 realcartoonxl_v5
终于有产品能够用AI重新思考和构建稍后阅读和内容收集工具了。#ai#
iki这个笔记工具非常强大,你不需要整理自己收藏的内容一切都交给AI来完成。
它可以处理你收集的大量杂乱、非结构化数据,让应用程序为你组织和显示信息,而不必你自己动手。
主要功能有:
✲ 自动提取和总结
✲ 自动在聊天和任何现有笔记中显示相关数据
✲ 为任何文件添加个人注释
✲ 与团队共享数据集合
✲ 关注社区其他人创建的合集和阅读内容
你可以在这里尝试IKI:https://app.iki.ai/ask
iki这个笔记工具非常强大,你不需要整理自己收藏的内容一切都交给AI来完成。
它可以处理你收集的大量杂乱、非结构化数据,让应用程序为你组织和显示信息,而不必你自己动手。
主要功能有:
✲ 自动提取和总结
✲ 自动在聊天和任何现有笔记中显示相关数据
✲ 为任何文件添加个人注释
✲ 与团队共享数据集合
✲ 关注社区其他人创建的合集和阅读内容
你可以在这里尝试IKI:https://app.iki.ai/ask
生财有术这个社群确是厉害,一个谈钱不伤感情的地方,里面个个都是搞钱小能手,联合圈内的搞钱大佬,准备想要加入生财的朋友搞到了一些福利,不加入生财也可以体验到,点赞超过20就安排。
@text1024
@text1024
LLocalSearch 一个开源的完全本地化的AI搜索工具,无需 OpenAI 或 Google API 密钥。
过去24小时增长了一千颗星星。感兴趣的话可以部署一下试试。
项目特点:
🕵️ 完全本地化运行,不需要连接到外部API,因此无需API密钥。
💸 适用于性能相对较低的大型语言模型硬件,例如在演示视频中使用的是7b模型。
🤓 提供详细的进度日志,这有助于用户更好地理解搜索和处理过程。
🤔 支持用户提出后续问题,以便深入探讨或解决问题。
📱 界面对移动设备友好,适合在手机或平板电脑上使用。
🚀 使用Docker Compose工具,可以快速且轻松地部署此服务。
🌐 提供网络界面,使用户可以从任何设备轻松访问和使用。
💮 该服务提供精心设计的用户界面,支持浅色和深色模式,满足不同用户的视觉偏好。
项目地址:https://github.com/nilsherzig/LLocalSearch
过去24小时增长了一千颗星星。感兴趣的话可以部署一下试试。
项目特点:
🕵️ 完全本地化运行,不需要连接到外部API,因此无需API密钥。
💸 适用于性能相对较低的大型语言模型硬件,例如在演示视频中使用的是7b模型。
🤓 提供详细的进度日志,这有助于用户更好地理解搜索和处理过程。
🤔 支持用户提出后续问题,以便深入探讨或解决问题。
📱 界面对移动设备友好,适合在手机或平板电脑上使用。
🚀 使用Docker Compose工具,可以快速且轻松地部署此服务。
🌐 提供网络界面,使用户可以从任何设备轻松访问和使用。
💮 该服务提供精心设计的用户界面,支持浅色和深色模式,满足不同用户的视觉偏好。
项目地址:https://github.com/nilsherzig/LLocalSearch
🎨 重磅更新:Dall·E的「局部重绘」现在已登录全平台~
ChatGPT的网页、iOS和安卓全平台都已经上线,你可以在画面中无限修改局部内容了。
为什么这个局部重绘(in-painting)功能超级无敌?
它意味着一致性(角色、对象)大幅提升,让文生图工作流效率展开范式升级。
去年Midjourney 推出时引发过创作社区的热潮,考虑到Dall·E 惊人的理解力和用户覆盖面,这是山峰再一次攀升。借助局部重绘功能,你将探索出前所未有全新的工作流。
实现你的想象,用自然语言不断说出想法就行了。 Amazing~ 🎉
ChatGPT的网页、iOS和安卓全平台都已经上线,你可以在画面中无限修改局部内容了。
为什么这个局部重绘(in-painting)功能超级无敌?
它意味着一致性(角色、对象)大幅提升,让文生图工作流效率展开范式升级。
去年Midjourney 推出时引发过创作社区的热潮,考虑到Dall·E 惊人的理解力和用户覆盖面,这是山峰再一次攀升。借助局部重绘功能,你将探索出前所未有全新的工作流。
实现你的想象,用自然语言不断说出想法就行了。 Amazing~ 🎉
英语好的人推荐看看,课程内容和讲师都很强。
这个课程主要会每周邀请Transformer研究的前沿专家,来分享他们在最新突破上的成就。比如英伟达、OpenAI以及Mistral AI的人。
内容涵盖从大型语言模型(如GPT和Gemini)到在艺术创作(比如DALL-E和Sora)、生物学和神经科学应用、机器人学等领域的创新应用。
课程主页:https://web.stanford.edu/class/cs25/
个人觉得和朱啸虎那期播客一般精彩
进入到企业内做AI
你才会意识到大模型
通用但不好用
大但不强
成本还很高
我为啥要自己跑用研
尼玛公司用研一个周期三个月
黄花菜都凉了
着急找PMF呀😫
一堆pm坐在办公室里拍脑门全yy出来了
不找到好的商业闭环
谁给你钱烧到AGI?
前段时间我还在想傅盛说的百亿模型
能力天花板能不能覆盖需求
转头一问业内朋友
大家都说够了够了
千亿/万亿模型
超长文本
理想主义很理想
现实或许会很骨感
推荐一个工具UPDF,他有强大的编辑功能,能直接改动这篇PDF的文章内容,排版布局,能让你编辑PDF有编辑Word的那种体验,修改文字,字体、对齐、大小、颜色,复制文字。图片编辑也很丝滑,和Word一样。图片编辑功能可以修改页面原本图片的尺寸、旋转角度、裁剪、或者替换图像。也可以在页面任意位置添加新的文本或图片。辅助我们去理解文献。
这样我们就可以直接在PDF里去记笔记,无论你是想添加高亮、还是 下划线 、文本注释、文本框、文本标注等都可以。还可以进行高亮和笔记。我们可以自定义我们高亮代表的意思,把文献拆分开来,辅助我们理解加深记忆,也方便我们日后查找相关内容,比如
- 重点观点用黄色
- 论证的过程和论据用橙色
- 数据用红色
- 等等
他还有一些其他功能,有各种可爱的贴纸可以选择,无聊的时候可以鼓励一下自己
5. 复盘:假设自己是作者,重新复盘整篇文章,如果是我,我会采取什么样的解决方案?我会怎么做实验?
原文整理在:https://k5ms77k0o1.feishu.cn/wiki/wikcnRnDZ1yPM0PMpkAIoQipQnb?from=from_copylink
这样我们就可以直接在PDF里去记笔记,无论你是想添加高亮、还是 下划线 、文本注释、文本框、文本标注等都可以。还可以进行高亮和笔记。我们可以自定义我们高亮代表的意思,把文献拆分开来,辅助我们理解加深记忆,也方便我们日后查找相关内容,比如
- 重点观点用黄色
- 论证的过程和论据用橙色
- 数据用红色
- 等等
他还有一些其他功能,有各种可爱的贴纸可以选择,无聊的时候可以鼓励一下自己
5. 复盘:假设自己是作者,重新复盘整篇文章,如果是我,我会采取什么样的解决方案?我会怎么做实验?
原文整理在:https://k5ms77k0o1.feishu.cn/wiki/wikcnRnDZ1yPM0PMpkAIoQipQnb?from=from_copylink
论文,它的格式非常八股,基本都是按照这样的结构来呈现的:标题 → 概要 → 介绍 → 方法 → 实验 → 结论。
结合Stanford教授 Srinivasan Keshav 分享的三遍法,我凝练出来一个结合AI的五步法
1. 选读:通过检索工具选出合适的论文,以及在Twitter等社交媒体上看这篇论文的含金量
2. 略读:读论文前,我们得搞清楚这篇论文值不值得读,我们不需要全部都读完,这样会浪费我们很多时间。使用AI Summary工具,回答关键问题:
1. 主要解决了什么问题?
2. 提出了什么解决方案?
3. 解决方案中核心的方法/步骤/策略是什么?
4. 结论是什么?
5. 有什么限制条件?
请有条理地组织以上信息,确保涵盖每一个点。
这一类可以AI Summary的工具非常多,主要看总结能力和花费金额,推荐使用
1. txyz:介绍在下面的工具安利里
2. PopAI:介绍在下面的工具安利里
3. ChatGPT:ChatGPT直接上传PDF,进行对话也可以
4. Kimi:国内可以使用
但是还有一个点需要注意,就是你自己需要去判断正确性,包括这篇论文的正确性——他有没有在和你胡扯
3. 精读:接下来就开始精读了
1. 精读的顺序:摘要 → 结论 → 方法 → 实验 → 数据和图表
2. 对于需要翻译的同学来说,必备的就是“沉浸式翻译”这个插件,具体使用看下面
3. 看图表和参考文献,判断是否正确
4. 在这一步,遇到问题,也可以借助AI工具,
1. 有不懂的细节继续提问,从 What、Why、How 三个方面抽取问题。
What:即哪些概念是不熟悉的。
Why:为什么要使用这种策略/方法,好在哪里?
How:具体论文中是怎么实现某种策略/方法的。
2. 对于不懂图表的,也可以借助AI工具,分析图表
1. PopAI:接入了GPT-4V的API,可以对论文图表进行解读
2. ChatGPT:直接读图
3. 亿图图示:也可以解读图表
4. 整理笔记:精读完就可以整理笔记了,这里我的思路是基于PDF本身去整理
RAGFlow的核心功能是文档的智能解析和管理,支持多种格式,并允许用户使用任何大型语言模型查询他们上传的文档。
RAGFlow提供了多种智能文档处理模板,以满足不同行业和角色的需求,如会计、人力资源专业人员和研究人员。
它还强调了智能文档处理的可视化和可解释性,允许用户查看文档处理结果,进行比较、修改和查询。
RAGFlow的一个关键优势是它允许LLM以受控方式回答问题,提供了一种理性和基于证据的方法来消除幻觉。
项目地址:https://github.com/infiniflow/ragflow
vercel的ai sdk+ai chatbot都做的很方便上手,我将ai-chatbot项目https://github.com/vercel/ai-chatbot 实践套壳gpt(chat.aicube.fun),缝合langchain官方的next.js+langchain.js的示例模板https://github.com/langchain-ai/langchain-nextjs-template,很轻松就实现了搜索、浏览、Dall-E生图等gpts的功能.
一键部署到vercel,还用tauri打包成客户端,实践下来确实可以成为AI Navtive初创企业的首选框架🚲
当然新的rsc版本,多了AI State和UI State这样的设定,开始让框架有点繁琐了,我个人是不太感冒,庆幸自己是在之前fork了这个项目,保留了简洁的chatbot框架,方便自己拓展改造。欢迎对rsc有研究的朋友指正。
🧡感谢文章作者 @Scarlett-事业脑版 的精彩创作,期待更多好文!
同时,在特定领域,我们至少需要通读八九篇核心论文,这样才能基本理解,并解释为什么某篇论文让我们感到兴奋。
未来五到十年里,很多现在的知识可能会变成常识。到那时,了解与否的差异可能并不显著。但在当前,通过阅读论文获得的信息量是巨大的,它能显著提高我们的认知水平,帮助你做出更准确的判断。
2、去哪找论文,怎么读论文?
那么,想要找到新颖或高质量的论文,我们应该去哪里呢?可以关注一些知名平台,如百度学术,或是OpenAI的Andrej Karpathy,看看他们推荐了哪些论文。实际上,你需要让自己沉浸在学术环境中,对感兴趣的论文深入阅读。Hidecloud个人习惯一天至少读两到三篇。
Hidecloud通常将论文分为两类:一类是他认为具有范式创新的,另一类是技术细节有所改进的。
对于后者,Hidecloud会快速阅读,关注他们具体优化了哪些方面,提升了多少。但对于那些具有范式创新的论文,Hidecloud会仔细研读。
阅读论文的好处是巨大的,它能直接帮助我们在产品设计和技术改进上取得实际成效。比如一些论文不仅提出新模型,还包含了工程优化的技巧,比如加速模型推理等。产品经理阅读这些内容后,可以直接应用于产品中,提升性能。
更重要的是,通过阅读前沿论文,可以及时了解最新模型的能力边界,以及新出现的技术创新点。进而,重新审视传统问题,开拓新的解决思路。这种全新的思考方式,有可能带来行业颠覆性的创新机会。
三、读完论文、测完demo,如何产研协同?
1、之前产品更依赖工程师
传统的软件开发模式中,产品经理负责需求分析和功能设计,然后把需求文档交给工程师,由工程师将这些抽象的业务逻辑转化为具体的代码实现。
这个过程需要产品经理和工程师密切配合,但两个角色的职责划分还是比较明确的。
2、现在产品也能做点开发
而现在,一些低代码(Low-code)或无代码(No-code)开发平台的出现,让非技术背景的人也能通过可视化的方式快速构建应用。
比如使用自然语言描述业务流程,然后自动生成可执行的工作流(Workflow)。这在一定程度上降低了开发门槛,产品经理可以更直接地参与到原型设计和功能实现中来。
3、工程师可能更专注后台问题
借助大语言模型的能力,产品经理用自然语言描述的复杂业务逻辑,可能会被自动转换成更加结构化、标准化的中间表示,如可视化的流程图(pipeline)或特定领域语言(DSL)等形式。这种表示一方面可以清晰地呈现业务逻辑,另一方面也更容易转化为最终的代码实现。
在这种趋势下,产品经理在功能决策上可能会有更大的自主权,可以通过灵活组合各种逻辑单元来快速响应业务变化。而工程师则会更专注于系统架构、性能优化、弹性扩展等技术问题,去建设一个高可用、高并发的稳定平台。
未来五到十年里,很多现在的知识可能会变成常识。到那时,了解与否的差异可能并不显著。但在当前,通过阅读论文获得的信息量是巨大的,它能显著提高我们的认知水平,帮助你做出更准确的判断。
2、去哪找论文,怎么读论文?
那么,想要找到新颖或高质量的论文,我们应该去哪里呢?可以关注一些知名平台,如百度学术,或是OpenAI的Andrej Karpathy,看看他们推荐了哪些论文。实际上,你需要让自己沉浸在学术环境中,对感兴趣的论文深入阅读。Hidecloud个人习惯一天至少读两到三篇。
Hidecloud通常将论文分为两类:一类是他认为具有范式创新的,另一类是技术细节有所改进的。
对于后者,Hidecloud会快速阅读,关注他们具体优化了哪些方面,提升了多少。但对于那些具有范式创新的论文,Hidecloud会仔细研读。
阅读论文的好处是巨大的,它能直接帮助我们在产品设计和技术改进上取得实际成效。比如一些论文不仅提出新模型,还包含了工程优化的技巧,比如加速模型推理等。产品经理阅读这些内容后,可以直接应用于产品中,提升性能。
更重要的是,通过阅读前沿论文,可以及时了解最新模型的能力边界,以及新出现的技术创新点。进而,重新审视传统问题,开拓新的解决思路。这种全新的思考方式,有可能带来行业颠覆性的创新机会。
三、读完论文、测完demo,如何产研协同?
1、之前产品更依赖工程师
传统的软件开发模式中,产品经理负责需求分析和功能设计,然后把需求文档交给工程师,由工程师将这些抽象的业务逻辑转化为具体的代码实现。
这个过程需要产品经理和工程师密切配合,但两个角色的职责划分还是比较明确的。
2、现在产品也能做点开发
而现在,一些低代码(Low-code)或无代码(No-code)开发平台的出现,让非技术背景的人也能通过可视化的方式快速构建应用。
比如使用自然语言描述业务流程,然后自动生成可执行的工作流(Workflow)。这在一定程度上降低了开发门槛,产品经理可以更直接地参与到原型设计和功能实现中来。
3、工程师可能更专注后台问题
借助大语言模型的能力,产品经理用自然语言描述的复杂业务逻辑,可能会被自动转换成更加结构化、标准化的中间表示,如可视化的流程图(pipeline)或特定领域语言(DSL)等形式。这种表示一方面可以清晰地呈现业务逻辑,另一方面也更容易转化为最终的代码实现。
在这种趋势下,产品经理在功能决策上可能会有更大的自主权,可以通过灵活组合各种逻辑单元来快速响应业务变化。而工程师则会更专注于系统架构、性能优化、弹性扩展等技术问题,去建设一个高可用、高并发的稳定平台。
听完播客最大的感受是:AI行业的非技术人员,如果愿意读论文和测 demo,投资回报率(ROI)将会极高。
一、先说测 demo
多体验demo,多做实验,实际上是在培养我们的认知和思考能力,思考在工程和产品上还有哪些机会可以探索。
因为这个行业还处于早期阶段,我们付出一点小小的努力,就能获得很高的投资回报率(ROI)。
1、往大了说,可以发现很多潜在机会
在这个过程中,我们会发现一个模型要真正运行起来并不像想象中那么简单。它涉及很多环节,包括数据处理、参数设置等。解决每一个问题的过程中,你可能会发现一些潜在的产品机会。
比如,有时候Hidecloud在配置模型时,就会突然发现这个模型产生的结果挺有趣的。但普通用户根本无法直接使用,因为它涉及到很复杂的数据预处理环节。以声音克隆为例,如果讲一分钟的话来克隆,不是直接就能克隆的。那一分钟的内容,需要经过七八步复杂的预处理,普通人很难独立完成。
如果普通人搞不定,这不就是一个机会吗?如果我们能帮他们完成整个数据预处理和训练过程,直接交付最终效果,这不也是一个机会吗?
但如果我们不亲自去体验,首先无法感受到看到最终结果那一刻的喜悦,其次也不会知道要达到那个效果还会遇到哪些障碍。
2、往小了看,能甩开国内同行一大截
在Twitter上,偶尔会有一些外国人分享有趣的小产品。比如,有人发布了一个有趣的小产品,在聊天过程中你要去猜测对方是AI还是真人。这种东西挺有意思,但国内似乎还没有人做类似的产品。
更简单一点,我们可以尝试自己写个GPTs。这种事情不需要编程,对吧?但说实话,就像Hidecloud平时面试产品经理,会问他们有没有尝试过创建自己的GPTs?
可能十个人里面九个都会被Hidecloud淘汰,因为大家还是不太愿意亲自动手,更喜欢看别人的成果。但一旦我们亲自动手,获得的信息量会比看视频或阅读文档都要大得多。
二、再说读论文
1、只需8篇核心论文,显著提高认知水平
作为产品经理,学习AI的一个有效途径就是阅读论文。
Hidecloud之前总结过Stable Diffusion的发展历史,从2020年至今,这三年间的关键信息其实并不多,大约只有八篇经典论文,把它们串起来就能清楚地理解整个原理。