关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
最近和几个朋友聊天记录:
1. 我问他是怎么建Prompt的验收标准的:准备好Query,归纳抽象理想回答的几条Principle,找一个更聪明的大模型基于这个Principle来给Prompt的结果打分,每次上线前跑1000条。
感觉挺make sense,想测试一下。
2.perplexity怎么解决搜索引擎响应速度的问题:去年8月份就宣布基于3.5版本的微调模型已经比GPT4快且效果好,且自研了推理堆栈(pplx-api),能大幅度提升响应速度。微调没那么难搞,只要场景垂数据集质量高,一周左右。
3.在厂里的朋友说在搞低代码搭建Agent,面向B端,找不到太落地的具体场景,还要搞权限数据集多环境版本,由于B端业务逻辑比较复杂,要依赖现有GUI,要跳卡片或者跳页面,比C端难做太多了。
1. 我问他是怎么建Prompt的验收标准的:准备好Query,归纳抽象理想回答的几条Principle,找一个更聪明的大模型基于这个Principle来给Prompt的结果打分,每次上线前跑1000条。
感觉挺make sense,想测试一下。
2.perplexity怎么解决搜索引擎响应速度的问题:去年8月份就宣布基于3.5版本的微调模型已经比GPT4快且效果好,且自研了推理堆栈(pplx-api),能大幅度提升响应速度。微调没那么难搞,只要场景垂数据集质量高,一周左右。
3.在厂里的朋友说在搞低代码搭建Agent,面向B端,找不到太落地的具体场景,还要搞权限数据集多环境版本,由于B端业务逻辑比较复杂,要依赖现有GUI,要跳卡片或者跳页面,比C端难做太多了。
生财有术是什么?这是一个致力于帮助普通人建立和扩大生意的付费社群,目前已有57000+会员加入。
如果你想要赚钱情报、扩大圈层、持续实战、高手案例,都可以在这里找到对标,不管你是小白还是高手,这里都有你的搞钱机会。
第8期生财有术启动,快来参与搞钱,一起生财有术。
福利及群二维码点击 https://t.me/text1024/8767
关于生财有术的介绍 https://t.me/text1024/8812
生财第七期视频集锦 https://t.me/text1024/8726
第八期视频预告 https://t.me/text1024/8824
VAR首次使GPT风格的AR模型在图像生成上超越了Diffusion transformer。
同时展现出了与大语言模型观察到的类似Scaling laws的规律。
在ImageNet 256x256基准上,VAR将FID从18.65大幅提升到1.80,IS从80.4提升到356.4,推理速度提高了20倍。
详细介绍:
视觉自回归模型(VAR)是一种新的图像生成范式,它将自回归学习重新定义为从粗到细的"下一尺度预测"或"下一分辨率预测",有别于标准的光栅扫描"下一token预测"。
这种简单直观的方法让自回归transformer能够快速学习视觉分布并具有良好的泛化能力:
VAR首次使GPT风格的AR模型在图像生成上超越了扩散transformer。
在ImageNet 256x256基准上,VAR将FID从18.65大幅提升到1.80,IS从80.4提升到356.4,推理速度提高了20倍。
实证验证了VAR在多个维度包括图像质量、推理速度、数据效率和可扩展性上都优于Diffusion Transformer。
随着VAR模型的扩大,它展现出了与大语言模型观察到的类似幂律缩放规律,线性相关系数接近-0.998,有力证明了这一点。
VAR进一步展示了在下游任务如图像修复、外推和编辑上的零样本泛化能力。
这些结果表明,VAR初步模拟了大语言模型的两个重要特性:缩放规律和零样本泛化。
研究人员已经公开了所有模型和代码,以促进AR/VAR模型在视觉生成和统一学习中的探索。
VAR算法为计算机视觉中的自回归算法设计提供了新的见解,有望推动这一领域的进一步发展。
项目地址:https://github.com/FoundationVision/VAR
Demo 地址,生成速度真的非常快:https://var.vision/demo
模型下载:https://huggingface.co/FoundationVision/var/tree/main
通过一个通用框架,利用大语言模型(LLM)进行社交技能训练。“AI伙伴,AI导师”框架将实际体验学习与真实场景练习和个性化反馈相结合。
详细介绍:
使用大语言模型进行社交技能训练的提议:
研究者提出,可以利用大语言模型强大的对话生成能力,为社交技能练习提供一个随时可用、安全可控的环境。相关研究已经证实,当前的大语言模型已经能够较好地模拟各类人物,进行逼真的对话互动。这为将其应用于社交技能训练奠定了基础。
AI Partner和AI Mentor框架的提出:
论文提出了一个通用的社交技能训练框架,包括两个关键组件:AI Partner负责提供对话实践的环境,AI Mentor负责在关键节点给予个性化指导。二者协同,可以把体验式的实践学习与理论指导有机结合,有望大幅提升社交技能训练的可及性和有效性。
使用该框架进行社交技能训练的应用场景
该框架可以灵活应用于多个领域的社交技能训练,如心理咨询、谈判、教学等。通过调整AI Partner塑造的人物角色,以及AI Mentor搭载的领域知识库,就可以对应不同领域的训练需求。论文通过一系列案例展示了这种适用性和灵活性。
论文地址:https://arxiv.org/abs/2404.04204
有的时候,觉得这个世界正在筛选出一批机器人一样的人来存活。没有情绪,不考虑回报,不需要支持,需要的只有解决问题的能力,输出价值的能力,自我管理的能力。世界到最后变成巨大的《模拟人生》游戏,消耗的只有时间,得到的只有数据。
Prompting 的核心技能可能只有一个……
启动效应,是大脑最有趣的认知活动之一。每当一段旋律、一个拼图或一段故事出现,大脑就开始疯狂运算,猜测整个景观;不直觉的开始分析因果、构建起一个个可能的解释。
不信的话,试着放松下来,聆听我这唱一首小曲:一闪一闪亮晶晶……(请接龙)
启动效应的本质之一是基于先验的预测,它是多模态和多感官的。简单类比的话,Prompting 就是你如何激活大模型知识结构的「启动」。
一旦能深刻意识到这一点,如何提升你与 AI 对话的技能、有效 激活 LLMs 效能的方法就会涌现出来了。
通过成百上千小时的反复练习,你将意识到:真正提升 Prompt 核心技能在于,持续深化于你的认知体系。
你无法提出你不知道的问题。
启动效应,是大脑最有趣的认知活动之一。每当一段旋律、一个拼图或一段故事出现,大脑就开始疯狂运算,猜测整个景观;不直觉的开始分析因果、构建起一个个可能的解释。
不信的话,试着放松下来,聆听我这唱一首小曲:一闪一闪亮晶晶……(请接龙)
启动效应的本质之一是基于先验的预测,它是多模态和多感官的。简单类比的话,Prompting 就是你如何激活大模型知识结构的「启动」。
一旦能深刻意识到这一点,如何提升你与 AI 对话的技能、有效 激活 LLMs 效能的方法就会涌现出来了。
通过成百上千小时的反复练习,你将意识到:真正提升 Prompt 核心技能在于,持续深化于你的认知体系。
你无法提出你不知道的问题。
❇️❇️目前工程实践上,大家把优化的重点基本都放在了retrieve环节里,这里面涉及三个重要的问题:
1️⃣how and what do I retrieve:从传统的相似性检索、文本检索,到目前最常用的依托于embedding的语义检索,大家在实践中仍在不断迭代。Kiela后面也提到有研究希望把整个retriever过程做成一个模型,他也在课程中构想未来应该把retriever的训练也纳入到LLM的训练架构中。
🌟文本的embedding可简化理解为文本的向量化表达,并且可根据不同文本的向量化表达,判断出文本之间语义的远近亲疏关系。
🌟目前的文本emebedding也都是通过模型来实现的,这类模型也在不断迭代。OpenAI在今年1月份推出了text-embedding-3(small和large两版),相比其2022年12月推出的ada-002模型,在性能上获得了显著提升。
🌟用于多语言检索的常用基准(MIRACL)平均分数已从 31.4%(ada-002)增加到 44.0%(3-small)和54.9%(3-large)。
🌟附图之一是OpenAI对其text emebedding模型作用机制的示意。
2️⃣When to retrieve: 一般就两种思路。一种是在获得检索范围后即retrieve,另一种是让模型判断何时retrieve。
3️⃣How to encode: 如何编码也直接影响了如何检索的过程。
❇️❇️其他问题:
1️⃣how to pre-process: 实际上强调就是input要包含system prompt,可设定角色、技能、任务、工作流、限制条件等。
2️⃣how to prompt: 涉及提示词工程的方法论。
3️⃣how to pass context: 可以把context作为prompt的一部分以文本形式输入,也可通过代码的方式代入。
4️⃣how to post-process: 比如格式化输出的处理,如固定输出json格式,或固定在末尾输出reference列表等。
5️⃣how to verify: 指的是如何验证output的效果或质量,比如验证output与知识库的相关性、准确性等。
❇️❇️最后,还有关于RAG整体架构的审视框架:
1️⃣How to optimize: 各环节哪些地方可以优化。架构中已经列出的问题都是思考的重点。
2️⃣How to learn: 这里的learn应该指的是机器学习的learn,探讨各环节从software 1.0的静态架构向机器学习和software 2.0的演进。
3️⃣how to scale: 如何应对规模化的问题。
🌟比如关于知识库如何chunk、何时编码,在知识库过大时就不适合提前预处理好chunk和编码。或者大量用户同时prompt该如何应对。
❇️❇️前段时间判断过2024年会是RAG应用爆发的一年https://m.okjike.com/originalPosts/6602dca712ed2fda687ec0a3?s=ewoidSI6ICI2M2VlMjQ0NjhhMGY3NzVjODQyMmY1NzEiCn0=,自己在2B业务中也涉及RAG工程的落地,所以花了些精力来学习这节课。以上内容夹杂了不少自己的个人理解,欢迎批评指正,一起交流学习~
❇️❇️links:
🌟Stanford CS25 V4 2024春季课程(面向公众开放,有人想一起学习搭子么?) https://web.stanford.edu/class/cs25/
🌟Stanford CS25 V3: Retrieval Augmented Language Models https://www.youtube.com/watch?v=mE7IDf2SmJg
🌟RAG论文原文 https://arxiv.org/abs/2005.11401
🌟OpenAI text-embedding-3 models https://openai.com/blog/new-embedding-models-and-api-updates?t
🌟OpenAI text-embedding-ada-002 model https://openai.com/blog/new-and-improved-embedding-model?t
🌟Software 2.0 by Andrej Karpathy https://karpathy.medium.com/software-2-0-a64152b37c35
🌟 Kiela在讲这节课几个月后在其创立的Contextual AI正式推出RAG 2.0 https://contextual.ai/introducing-rag2/
1️⃣how and what do I retrieve:从传统的相似性检索、文本检索,到目前最常用的依托于embedding的语义检索,大家在实践中仍在不断迭代。Kiela后面也提到有研究希望把整个retriever过程做成一个模型,他也在课程中构想未来应该把retriever的训练也纳入到LLM的训练架构中。
🌟文本的embedding可简化理解为文本的向量化表达,并且可根据不同文本的向量化表达,判断出文本之间语义的远近亲疏关系。
🌟目前的文本emebedding也都是通过模型来实现的,这类模型也在不断迭代。OpenAI在今年1月份推出了text-embedding-3(small和large两版),相比其2022年12月推出的ada-002模型,在性能上获得了显著提升。
🌟用于多语言检索的常用基准(MIRACL)平均分数已从 31.4%(ada-002)增加到 44.0%(3-small)和54.9%(3-large)。
🌟附图之一是OpenAI对其text emebedding模型作用机制的示意。
2️⃣When to retrieve: 一般就两种思路。一种是在获得检索范围后即retrieve,另一种是让模型判断何时retrieve。
3️⃣How to encode: 如何编码也直接影响了如何检索的过程。
❇️❇️其他问题:
1️⃣how to pre-process: 实际上强调就是input要包含system prompt,可设定角色、技能、任务、工作流、限制条件等。
2️⃣how to prompt: 涉及提示词工程的方法论。
3️⃣how to pass context: 可以把context作为prompt的一部分以文本形式输入,也可通过代码的方式代入。
4️⃣how to post-process: 比如格式化输出的处理,如固定输出json格式,或固定在末尾输出reference列表等。
5️⃣how to verify: 指的是如何验证output的效果或质量,比如验证output与知识库的相关性、准确性等。
❇️❇️最后,还有关于RAG整体架构的审视框架:
1️⃣How to optimize: 各环节哪些地方可以优化。架构中已经列出的问题都是思考的重点。
2️⃣How to learn: 这里的learn应该指的是机器学习的learn,探讨各环节从software 1.0的静态架构向机器学习和software 2.0的演进。
3️⃣how to scale: 如何应对规模化的问题。
🌟比如关于知识库如何chunk、何时编码,在知识库过大时就不适合提前预处理好chunk和编码。或者大量用户同时prompt该如何应对。
❇️❇️前段时间判断过2024年会是RAG应用爆发的一年https://m.okjike.com/originalPosts/6602dca712ed2fda687ec0a3?s=ewoidSI6ICI2M2VlMjQ0NjhhMGY3NzVjODQyMmY1NzEiCn0=,自己在2B业务中也涉及RAG工程的落地,所以花了些精力来学习这节课。以上内容夹杂了不少自己的个人理解,欢迎批评指正,一起交流学习~
❇️❇️links:
🌟Stanford CS25 V4 2024春季课程(面向公众开放,有人想一起学习搭子么?) https://web.stanford.edu/class/cs25/
🌟Stanford CS25 V3: Retrieval Augmented Language Models https://www.youtube.com/watch?v=mE7IDf2SmJg
🌟RAG论文原文 https://arxiv.org/abs/2005.11401
🌟OpenAI text-embedding-3 models https://openai.com/blog/new-embedding-models-and-api-updates?t
🌟OpenAI text-embedding-ada-002 model https://openai.com/blog/new-and-improved-embedding-model?t
🌟Software 2.0 by Andrej Karpathy https://karpathy.medium.com/software-2-0-a64152b37c35
🌟 Kiela在讲这节课几个月后在其创立的Contextual AI正式推出RAG 2.0 https://contextual.ai/introducing-rag2/
如果中国多一些猴米这样的营销公司
那两年后 美国的智能机器人蹦蹦跳跳走到中国机器人前面 用普通话骂人 转头弯腰放个屁
还拍拍屁股的时候
中国的机器人估计还站在原地
说
你好 我是你的智能助理 你可以叫我小美
然后颤巍巍的举起手 要握手
我不明白 请再说一次
我的电机全自研 走路速度世界第一
采用高通最新....
那两年后 美国的智能机器人蹦蹦跳跳走到中国机器人前面 用普通话骂人 转头弯腰放个屁
还拍拍屁股的时候
中国的机器人估计还站在原地
说
你好 我是你的智能助理 你可以叫我小美
然后颤巍巍的举起手 要握手
我不明白 请再说一次
我的电机全自研 走路速度世界第一
采用高通最新....
吴恩达对AI Agent的这个分享,真的很有价值,这可能才是AI Agent未来的打开方式,我自己体验了一下效果确实很好。
大多数人使用语言模型的方式是非 Agent 式的工作流,即输入提示,生成答案;而Agent 式工作流是这样的:让 AI 编写文章大纲,看是否需要做一些研究,然后写初稿,阅读初稿并思考哪些部分需要修改,然后修改草稿,如此反复。
多Agent协同很有SaaS 里协同带来的价值那种感觉,我觉得协同在 AI 时代或许仍然非常重要,只不过是将人与人之间的协同更多换成了 AI Agent 而已,而我猜测 AI+Human 协同可能会是未来长期的一个状态。