关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
最近和几个朋友聊天记录:
1. 我问他是怎么建Prompt的验收标准的:准备好Query,归纳抽象理想回答的几条Principle,找一个更聪明的大模型基于这个Principle来给Prompt的结果打分,每次上线前跑1000条。
感觉挺make sense,想测试一下。

2.perplexity怎么解决搜索引擎响应速度的问题:去年8月份就宣布基于3.5版本的微调模型已经比GPT4快且效果好,且自研了推理堆栈(pplx-api),能大幅度提升响应速度。微调没那么难搞,只要场景垂数据集质量高,一周左右。

3.在厂里的朋友说在搞低代码搭建Agent,面向B端,找不到太落地的具体场景,还要搞权限数据集多环境版本,由于B端业务逻辑比较复杂,要依赖现有GUI,要跳卡片或者跳页面,比C端难做太多了。
早上好,继续发福利,今年生财拉新,现在可以免费加入生财有术围观群,可以免费白嫖三天生财有术,速进,满200就进不来啦。

生财有术是什么?这是一个致力于帮助普通人建立和扩大生意的付费社群,目前已有57000+会员加入。

如果你想要赚钱情报、扩大圈层、持续实战、高手案例,都可以在这里找到对标,不管你是小白还是高手,这里都有你的搞钱机会。

第8期生财有术启动,快来参与搞钱,一起生财有术。
福利及群二维码点击 https://t.me/text1024/8767
关于生财有术的介绍 https://t.me/text1024/8812
生财第七期视频集锦 https://t.me/text1024/8726
第八期视频预告 https://t.me/text1024/8824
其实蔚来的nomi一直是我喜欢蔚来很有意思的地方,直到今天我看到了一个叫Looi的桌面机器人,这才是AI实体应该做的产品,有灵魂有意思有温度有情感。
这个可能比较重要,北大发布一个新的图像生成框架VAR。

VAR首次使GPT风格的AR模型在图像生成上超越了Diffusion transformer。

同时展现出了与大语言模型观察到的类似Scaling laws的规律。

在ImageNet 256x256基准上,VAR将FID从18.65大幅提升到1.80,IS从80.4提升到356.4,推理速度提高了20倍。

详细介绍:

视觉自回归模型(VAR)是一种新的图像生成范式,它将自回归学习重新定义为从粗到细的"下一尺度预测"或"下一分辨率预测",有别于标准的光栅扫描"下一token预测"。

这种简单直观的方法让自回归transformer能够快速学习视觉分布并具有良好的泛化能力:

VAR首次使GPT风格的AR模型在图像生成上超越了扩散transformer。

在ImageNet 256x256基准上,VAR将FID从18.65大幅提升到1.80,IS从80.4提升到356.4,推理速度提高了20倍。

实证验证了VAR在多个维度包括图像质量、推理速度、数据效率和可扩展性上都优于Diffusion Transformer。

随着VAR模型的扩大,它展现出了与大语言模型观察到的类似幂律缩放规律,线性相关系数接近-0.998,有力证明了这一点。

VAR进一步展示了在下游任务如图像修复、外推和编辑上的零样本泛化能力。

这些结果表明,VAR初步模拟了大语言模型的两个重要特性:缩放规律和零样本泛化。

研究人员已经公开了所有模型和代码,以促进AR/VAR模型在视觉生成和统一学习中的探索。

VAR算法为计算机视觉中的自回归算法设计提供了新的见解,有望推动这一领域的进一步发展。

项目地址:https://github.com/FoundationVision/VAR
Demo 地址,生成速度真的非常快:https://var.vision/demo
模型下载:https://huggingface.co/FoundationVision/var/tree/main
很有意思的一个研究,让 LLM 帮助培训社交沟通技能,确实有很多人需要这样的服务,LLM 又擅长这个。

通过一个通用框架,利用大语言模型(LLM)进行社交技能训练。“AI伙伴,AI导师”框架将实际体验学习与真实场景练习和个性化反馈相结合。

详细介绍:

使用大语言模型进行社交技能训练的提议:

研究者提出,可以利用大语言模型强大的对话生成能力,为社交技能练习提供一个随时可用、安全可控的环境。相关研究已经证实,当前的大语言模型已经能够较好地模拟各类人物,进行逼真的对话互动。这为将其应用于社交技能训练奠定了基础。

AI Partner和AI Mentor框架的提出:

论文提出了一个通用的社交技能训练框架,包括两个关键组件:AI Partner负责提供对话实践的环境,AI Mentor负责在关键节点给予个性化指导。二者协同,可以把体验式的实践学习与理论指导有机结合,有望大幅提升社交技能训练的可及性和有效性。

使用该框架进行社交技能训练的应用场景

该框架可以灵活应用于多个领域的社交技能训练,如心理咨询、谈判、教学等。通过调整AI Partner塑造的人物角色,以及AI Mentor搭载的领域知识库,就可以对应不同领域的训练需求。论文通过一系列案例展示了这种适用性和灵活性。

论文地址:https://arxiv.org/abs/2404.04204
有的时候,觉得这个世界正在筛选出一批机器人一样的人来存活。没有情绪,不考虑回报,不需要支持,需要的只有解决问题的能力,输出价值的能力,自我管理的能力。世界到最后变成巨大的《模拟人生》游戏,消耗的只有时间,得到的只有数据。
Prompting 的核心技能可能只有一个……

启动效应,是大脑最有趣的认知活动之一。每当一段旋律、一个拼图或一段故事出现,大脑就开始疯狂运算,猜测整个景观;不直觉的开始分析因果、构建起一个个可能的解释。

不信的话,试着放松下来,聆听我这唱一首小曲:一闪一闪亮晶晶……(请接龙)

启动效应的本质之一是基于先验的预测,它是多模态和多感官的。简单类比的话,Prompting 就是你如何激活大模型知识结构的「启动」。

一旦能深刻意识到这一点,如何提升你与 AI 对话的技能、有效 激活 LLMs 效能的方法就会涌现出来了。

通过成百上千小时的反复练习,你将意识到:真正提升 Prompt 核心技能在于,持续深化于你的认知体系。

你无法提出你不知道的问题。
更新后的 IPAdapter 可以风格和构图分别参考了,感觉风格LoRA越来越不需要了👁️

btw 图二我真的好喜欢,把头发改成了五线谱+琴键,让我觉得 AI 真的好懂康定斯基

项目地址:https://github.com/cubiq/ComfyUI_IPAdapter_plus

InstantX 的团队和 ComfyUI 的插件作者 Matteo Spinelli 联名发了关于 InstantStyle 的 Paper!也开源了!

🔸Code: github.com/InstantStyle/InstantStyle
🔸Project Page: instantstyle.github.io/
AI探索指南
斯坦福这节课讲清楚了LLM做RAG所有最重要的问题。 这节课就是传说中的Stanford CS25中的一节讲座。授课人就是RAG论文的作者之一Douwe Kiela,课程中他分享了一个检索增强语言模型的架构图。 这张图重要到让我觉得,做RAG只要记住这一张图就够了。所有相关概念和工程实践中的权衡,全都涵盖在这张图的架构和问题中了。 这个架构主要包括input、prompt、通过retriever检索增强生成的context,然后把这三部分一起输入给generator即模型,最终输出output作为结果。…
❇️❇️目前工程实践上,大家把优化的重点基本都放在了retrieve环节里,这里面涉及三个重要的问题:
1️⃣how and what do I retrieve:从传统的相似性检索、文本检索,到目前最常用的依托于embedding的语义检索,大家在实践中仍在不断迭代。Kiela后面也提到有研究希望把整个retriever过程做成一个模型,他也在课程中构想未来应该把retriever的训练也纳入到LLM的训练架构中。
🌟文本的embedding可简化理解为文本的向量化表达,并且可根据不同文本的向量化表达,判断出文本之间语义的远近亲疏关系。
🌟目前的文本emebedding也都是通过模型来实现的,这类模型也在不断迭代。OpenAI在今年1月份推出了text-embedding-3(small和large两版),相比其2022年12月推出的ada-002模型,在性能上获得了显著提升。
🌟用于多语言检索的常用基准(MIRACL)平均分数已从 31.4%(ada-002)增加到 44.0%(3-small)和54.9%(3-large)。
🌟附图之一是OpenAI对其text emebedding模型作用机制的示意。
2️⃣When to retrieve: 一般就两种思路。一种是在获得检索范围后即retrieve,另一种是让模型判断何时retrieve。
3️⃣How to encode: 如何编码也直接影响了如何检索的过程。

❇️❇️其他问题:
1️⃣how to pre-process: 实际上强调就是input要包含system prompt,可设定角色、技能、任务、工作流、限制条件等。
2️⃣how to prompt: 涉及提示词工程的方法论。
3️⃣how to pass context: 可以把context作为prompt的一部分以文本形式输入,也可通过代码的方式代入。
4️⃣how to post-process: 比如格式化输出的处理,如固定输出json格式,或固定在末尾输出reference列表等。
5️⃣how to verify: 指的是如何验证output的效果或质量,比如验证output与知识库的相关性、准确性等。

❇️❇️最后,还有关于RAG整体架构的审视框架:
1️⃣How to optimize: 各环节哪些地方可以优化。架构中已经列出的问题都是思考的重点。
2️⃣How to learn: 这里的learn应该指的是机器学习的learn,探讨各环节从software 1.0的静态架构向机器学习和software 2.0的演进。
3️⃣how to scale: 如何应对规模化的问题。
🌟比如关于知识库如何chunk、何时编码,在知识库过大时就不适合提前预处理好chunk和编码。或者大量用户同时prompt该如何应对。

❇️❇️前段时间判断过2024年会是RAG应用爆发的一年https://m.okjike.com/originalPosts/6602dca712ed2fda687ec0a3?s=ewoidSI6ICI2M2VlMjQ0NjhhMGY3NzVjODQyMmY1NzEiCn0=,自己在2B业务中也涉及RAG工程的落地,所以花了些精力来学习这节课。以上内容夹杂了不少自己的个人理解,欢迎批评指正,一起交流学习~

❇️❇️links:
🌟Stanford CS25 V4 2024春季课程(面向公众开放,有人想一起学习搭子么?) https://web.stanford.edu/class/cs25/
🌟Stanford CS25 V3: Retrieval Augmented Language Models https://www.youtube.com/watch?v=mE7IDf2SmJg
🌟RAG论文原文 https://arxiv.org/abs/2005.11401
🌟OpenAI text-embedding-3 models https://openai.com/blog/new-embedding-models-and-api-updates?t
🌟OpenAI text-embedding-ada-002 model https://openai.com/blog/new-and-improved-embedding-model?t
🌟Software 2.0 by Andrej Karpathy https://karpathy.medium.com/software-2-0-a64152b37c35
🌟 Kiela在讲这节课几个月后在其创立的Contextual AI正式推出RAG 2.0 https://contextual.ai/introducing-rag2/
斯坦福这节课讲清楚了LLM做RAG所有最重要的问题。

这节课就是传说中的Stanford CS25中的一节讲座。授课人就是RAG论文的作者之一Douwe Kiela,课程中他分享了一个检索增强语言模型的架构图。

这张图重要到让我觉得,做RAG只要记住这一张图就够了。所有相关概念和工程实践中的权衡,全都涵盖在这张图的架构和问题中了。

这个架构主要包括input、prompt、通过retriever检索增强生成的context,然后把这三部分一起输入给generator即模型,最终输出output作为结果。

❇️❇️关于这几个核心概念,值得注意的是:
1️⃣input和prompt的区别和联系在于,input可理解为既包含system prompt,又包含用户输入的检索范围的指向,而prompt则强调用户输入的指令。
🌟以公司知识库RAG举例,比如用户输入chatbot的内容为"检索公司2023年的财务数据并生成总结报告",其中"公司2023年的财务数据"是对公司知识库检索范围的指向,应理解为input的一部分,而"检索并生成总结报告"则是指令,应理解为prompt。
2️⃣retriever的作用机制,我理解类似于在图书馆借书的过程,提供书名(query)-系统查找图书编号(query编码)-对应书架书籍编号(docs编码)-找到并借出图书(context)。
🌟接着上文公司知识库的例子,从input获取query(如"2023年资产负债表, 2023年利润表, 2023年现金流量表"),对应的query编码("2023年资产负债表, 2023年利润表, 2023年现金流量表"的向量化表达)在docs编码(公司知识库所有文本的向量化表达)中检索匹配,提取匹配的部分作为context(涉及公司2023年财务数据的文本)。
🌟其中query和input的关系,我想到两种可能性,一种是直接把input作为query,另一种是模型基于input生成的query,架构图简化表达了。
3️⃣retriever和context之间可加一步reranker架构,对检索结果按特定规则进行重新排序。reranking的机制既可通过模型判断,也可在模型基础上预设特定规则。
🌟比如根据员工职级限制其可获取的企业知识库信息范围。
如果中国多一些猴米这样的营销公司

那两年后 美国的智能机器人蹦蹦跳跳走到中国机器人前面 用普通话骂人 转头弯腰放个屁

还拍拍屁股的时候

中国的机器人估计还站在原地



你好 我是你的智能助理 你可以叫我小美

然后颤巍巍的举起手 要握手

我不明白 请再说一次

我的电机全自研 走路速度世界第一

采用高通最新....
吴恩达谈 Agent 4个模式:Agent 工作流可实现 GPT-3.5 >GPT-4

吴恩达对AI Agent的这个分享,真的很有价值,这可能才是AI Agent未来的打开方式,我自己体验了一下效果确实很好。

大多数人使用语言模型的方式是非 Agent 式的工作流,即输入提示,生成答案;而Agent 式工作流是这样的:让 AI 编写文章大纲,看是否需要做一些研究,然后写初稿,阅读初稿并思考哪些部分需要修改,然后修改草稿,如此反复。

多Agent协同很有SaaS 里协同带来的价值那种感觉,我觉得协同在 AI 时代或许仍然非常重要,只不过是将人与人之间的协同更多换成了 AI Agent 而已,而我猜测 AI+Human 协同可能会是未来长期的一个状态。
Back to Top