关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
新产品 HeyBeauty 发布到 ProductHunt 了🎉,请大家帮忙投个票:https://producthunt.com/posts/heybeauty

一起来感受 AI 试衣的魔法吧😉
回顾我的 prompt 能力从小白到熟练的一些重要节点:

防杠叠甲:
1. 仅代表我自己的认知,没啥权威性。
2. 认为提示词那么简单至于搞那么复杂么的朋友,你对
3. 本文是语音转写的,比较随意。

第一步:大模型基本特性与生成原理

第一步还是要从大模型的基本特性了解开始 这部分可以叫做大模型祛魅或者是大模型的基础认知 这部分学习的重点应该是大模型的生成原理 避免在以后使用提示词的时候对大模型有一些不恰当的想象 导致一些很奇怪(不现实)的提示词的想法,比如一次生成上万字,准确生成312个字,自动生成爆款什么的。

第二步:自然语言对话体会与大模型交流

在心流状态下认真地审视自己内心想要解决的问题和诉求,尝试通过完全的聊天式的自然语言来和大模型进行几轮对话,以此来体会大模型的一些生成机制,然后感受一下其中不尽如人意的地方,反思自己的提问哪里有缺陷, 也思考一下大模型是不是有一些局限性。

第三步:引入结构化思维

在进行了第二步之后,会显著地感受到对自己的表述和对大模型的反应已经有了一个直观的认知,这个时候可以开始考虑如何采纳更加有效的表达结构来进行和大模型的对话,这时候才真正地引入所谓带有方法论的提示词写法,如模块化的提示词框架, 可以尝试去用几个比较简单的提示词,例如交代清楚任务的背景,给出生成内容的格式要求,描述具体的任务步骤等等。

第四步:深入理解“角色法”

在第四步要深入地理解角色法(让大模型扮演某角色)这种方法在提示词当中的非常有效的作用 在这个阶段可以充分地去体验一下不同角色的约束带来的大模型回复的变化 首先要自己认同角色法的意义和作用。

在角色法的基础上加上结构化表达,所谓结构化提示词事实上就是基于角色法的一种结构化表述方法。 同时,在结构化提示词的 workflow 部分融入了思维链的思路,将复杂的任务拆分成清晰的、环环相扣的、分步实施的清晰的任务指令。
结合了角色法、结构化表达和思维链提示的三种方法论与一体的结构化提示词,在一些复杂任务当中或在一些复杂的角色塑造当中起到了非常显著的作用,但这只是提示词创作的方法之一。

第五步:了解 markdown 语法和它的意义

在第四个步骤的基础上,可以为了让我们的结构化语法更加的清晰有效,在一些复杂的文本层级和结构之间带来更加清晰的显示方式, 我们可以引入 Markdown 语法,为我们先前的角色法和结构化表达带来更加清晰的语法结构,以便大模型能够更清楚地识别我们所提供的所有的指令。

提示词中使用 Markdown 语法的核心是符合 OpenAI 的官方六个最佳实践里面的使用清晰的表达结构和分隔符、符号等方式使得我们的大段文本的结构变得更加清晰。

这样做的目的只有一个:就是让大模型不至于混淆在我们复杂的文本指令过程中的一些层级问题,或者因为分隔不当而导致一些有不同含义的文本被混淆在一起导致大模型的误解。

在这一点上,很多同学有着诸多的困惑或误解,事实上,Markdown 语法并不局限于我们广为流传的结构化语法当中的那些固定格式和单词, 只要是基于清晰表述的框架层级下采用 Markdown 语法, 你完全可以自定义你的每一级的标题的内容和文本的内容, 以及灵活地使用 Markdown 当中的其他的一些写法, 例如有序列表,无序列表,缩近符,分隔符,在提示词当中嵌入一部分片段式的代码等等,都是可以的。

第六步:没想好叫什么名字,就再进一步学习吧

认真完成前面五步事实上并不需要太久的时间,如果已完成,恭喜你,你的提示词基础已经挺扎实了。

接下来是两个层面的进阶学习:

1. 实践

大量的实践, 对上述方法的大量实践,在极多的不同场景下的反复编写提示词,观察大模型的反馈结果,进行测试和迭代,然后去优化自己的表述结构, 以此更加深入地理解大模型的一些能力,一些局限,以及会更加深入地理解自己表达上面的一些技巧和方法。

2. 表达能力

向内审视自己的表述,这背后是我们的逻辑思维和表达能力,我们的词汇量,我们的语言组织,我们的语法习惯,都会影响我们在对大模型输出指令时的文本的质量。

在前一个步骤里采用的结构化提示词的好处在于,它已经规范了一套相当标准的表述结构,那么就可能会在一定程度上弥补个体在表达上缺乏逻辑性和条理性的这样局限和缺陷。

在我们运用结构化提示词非常熟练的场景下,我们需要进一步地去融合和提炼,学会在更加复杂的情况下使用复杂提示词,而在更加简单或连续追问的心流场景下,找到准确表述自己的意图的一种方法。

这是需要建立在大量的对话实践的基础上的,如果你在之前已经了解过大模型的特性,也采用结构化提示词,采用别人提供的框架和模板,进行过大量实践的情况下,你可以在极其精简的几个句子中就明确表述自己的意图,并且对大模型接下来的生成有一定的判断。

在大模型的生成不符合你预期的结果时,你也可能很快地找到如何调整自己表述的方式。这些是我称之为一种和大模型对话语感的能力,这种语感的背后有经验的累积,有对方法论的思考,更多时候也是形成一种潜意识的表达的一种条件反射的语言素养。

第七步:提示词封装与工作流

当我们对外掌握了足够的技巧和方法,对内也深刻思考了自己的深层逻辑思维与表达能力,我们该考虑如何把我们熟练运用的提示词作为工具分享给他人使用,或作为工具沉淀下来用于提升自己的生产力工具。

这时候我们必须要考虑到引入一个提示词封装的方法。 目前市面上比较主流的工具有 OpenAI 官方推出的 GPTS 或者叫 Gizmo, 当然也有我们国内国产大模型的很多智能体封装的工具, 例如智谱清言的智能体,百度文心一言的智能体,以及Kimi Plus版本最近推出的官方智能体(暂不支持用户自己上传), 这些都是很成熟的平台化的智能体封装方式。

对于提示词学习者来说,仅需要花较少的时间去了解平台的特性、智能体的设置规则, 以及一些最基础的简单的参数设置即可。

但当我们来到这一步时,我们必须面临的一个问题是, 在我们独自使用一个提示词的时候, 很可能这个提示词的某些约束语句仅出于我个人的语言习惯或我个人对提示词的使用场景, 所以在我们测试和迭代的时候不会发生太多的问题。

但当我们把一个提示词封装为一个智能体去发布或者是传递给更多其他人使用的时候, 由于使用场景的差异和思维方式的差异, 很可能我们的提示词会遇到很多用户层面的问题。 如果我们有机会和我们的用户交流的话, 可以极大的提升我们在提示词的编写迭代上的认知和见解。 这是非常宝贵的经验,值得大家在这个领域投入更多精力,建立和你提示词使用者的沟通机制是非常有帮助的。

同时我们在这个阶段也会面临另一个困境,就是单一的提示词很难解决较为复杂的任务或生成非常长篇的复杂文本。 这是大模型单词对话窗口的局限性和大模型的注意力机制所决定的。 当你的提示词足够复杂的时候,意味着大模型的注意力也被大量的稀释。 那么分散在一些特定的重要约束语句上的注意力可能就会不足以让大模型来理解并完成这一个指令和约束。

在这种情况下,单个提示词的能力会变得让我们感到非常无力,这种情况下,我们需要引入提示词链或工作流程,把多个提示词和大模型能力以及外部工具的能力链接起来,形成一个特定的工作流来解决我们对复杂任务的要求。

第八步:RAG技术

同时,为了解决大模型的世界知识不足或产生幻觉等等问题, 我们在这个时候需要适时地考虑引入基于 RAG 技术的自主上传的知识库文本或自己去创建清晰的数据集来作为引用文本, 方便大模型基于更加严谨的参考文本来解决我们特定的任务场景。

到这里,提示词应该可以想写什么写什么了,祝 AI 旅途愉快。
昨天抖音一条把旅行 Vlog 处理成黏土风格的视频爆了。 现在已经 7 万赞,4.6 万转发了。

这个效果非常好,对原图的控制很强,作者说用了几十个小时,用的 Wink 的 AI 动图,Wink 立刻上了 banner 宣传,大家都很快啊。

哎。。。 Animatediff 要是有一个好点的 XL 模型就好了,所有条件都有就是差个动画模型。

视频来源:抖音 Jacob
好东西,Elicit发布了一个机器学习必读清单,能够系统地了解机器学习的各个方面,尤其是语言模型。

清单包括下面几个部分:

🌟机器学习基础:介绍机器学习从基础到进阶的各种概念,如机器学习入门、深度强化学习和反向传播。

🌟Transformer 与基础模型:深入探讨了 Transformer架构,内容包括视觉引导、实践调查和各种模型的技术报告。

🌟训练与微调:介绍了训练和精调语言模型的方法与策略,特别强调了整合人类反馈和零样本学习。

🌟推理与运行策略:探讨了在上下文中进行推理、任务分解和工具使用的策略,分析大语言模型如何处理复杂的推理和解决问题的任务。

🌟应用领域:课程还涵盖了机器学习在科学、预测和搜索排名等领域的实际应用。

🌟机器学习实践:介绍了在实际部署中的洞见及评估语言模型在实际环境中的性能标准。

🌟进阶主题:涉及更为专业的主题,如世界模型、因果关系、规划及机器学习中的不确定性。

🌟整体观:讨论了 AI 的扩展、安全性及 AI 对经济和社会影响的更宽泛话题,为理解机器学习的整体景观提供了全面的视角。

这里阅读清单:https://github.com/elicit/machine-learning-list
DeepSeek 的这个价格和效果,真的让我完全丧失了折腾本地运行小模型的想法了。

1M token 2 块钱,冲 50 块,可以一直开着我的插件浏览网页,每次切换网页都能自动进行总结/信息提取或者其他任务,能用一年。

以前嫌弃自动化太贵了,现在完全无感了。
炸!很快就可以一键虚拟试穿线上任何服装了!

国外一位大佬正开发一款 Chrome 浏览器插件,让你可以在商城上一键虚拟试穿任何服装!

从演示视频来看,安装了此插件,并上传一张人物站立姿势图,然后在商城上的任何服装只需右键点击下即可完成虚拟试穿。

目前插件已提交审核,但还没有通过,我将持续留意,当放出时第一时间同步到星球。

插件背后使用的虚拟试穿技术正是之前推荐过的 IDM-VTON,能够生成高度真实的虚拟试穿图像。

据作者介绍,它是直接通过调用 IDM-VTON 在 Replicate 上的 API 实现插件使用的。

大家可以先到 Replicate 上体验,实测效果如下图,个人觉得已经很不错了。

链接:https://replicate.com/cuuupid/idm-vton
DeepSeek-V2 这个模型确实很强,尝试了一下我日常的任务都能胜任。

主要是太便宜了,开放平台送的十块钱总共有 500 万 Token 。冲个五十块钱估计够我用好几年。

模型为 MOE 架构总参数 236B 激活参数 21B,开源版本上下文 128K,API 上下文 32K 。

在8卡H800机器上,输出吞吐量超过每秒 5 万 Token。

模型权重下载:https://huggingface.co/deepseek-ai
每天早上就是玩Remini
还是黏土特效最好玩
对于创作女孩子我还是有一点审美自信的
Back to Top