关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
这玩意再加上 Sora 这样的视频生成模型,一些简单的短视频以及广告视频基本上就不需要人工介入了,大家以后刷的估计都是生成出来的视频了,想要啥有啥。
我下面会简单介绍一下这个剪辑工具的界面组成和 Agents 设计:
-----------工具界面及交互(图 1)-----------
A 区域主要是输入提示词以及展示 LLM 详细的剪辑逻辑。
B 区域是素材库,你可以鼠标 Hover 后获得 LLM 帮你总结的这段视频的内容,不需要播放查看, AI 也会自动生成的素材标题。
E 区域就是传统的视频时间轴,AI 剪辑的视频就在这里,你也可以手动调整。
-----------Agents 设计(图 2)-----------
1️⃣系统提示前言:
角色分配:一个开场段指示Agents担任视频编辑助理,负责根据用户命令生成行动计划。
动作描述:在角色分配之后,描述了Agents可以执行的一系列动作。每个动作对应于LAVE支持的编辑功能。详细说明了每个动作的功能和用例,帮助Agents选择适当的响应以满足用户的命令。
格式指导:最后,指导Agents以一致的格式输出行动计划:首先确定用户的编辑目标,然后列出逐步计划,列举建议的行动以实现该目标。
其他系统提示:
在前言之后,附加了最近的对话历史,以及最新的用户输入。这种组合形成了发送给LLM以生成行动计划的完整提示。
2️⃣制定行动计划后,将其提交给用户进行批准:
与批量批准不同,每个行动都由用户依次批准。这种方法允许用户执行一个行动,观察其结果,然后决定是否继续进行下一个行动。LAVE从行动计划中解析每个行动描述,并将其转化为相应的后端函数调用。
3️⃣LAVE支持五种LLM功能:
1)素材概览,2)创意头脑风暴,3)视频检索,4)故事板,5)剪辑修剪。前四种功能可通过Agents访问,而剪辑修剪可通过双击编辑时间轴上的剪辑时出现的窗口进行。
其中,基于语言的视频检索是通过向量存储数据库实现的,而其余功能则是通过LLM提示工程实现的。所有功能都是基于自动生成的语言构建的。
💫详细学习参考:https://yunyinghui.feishu.cn/wiki/BaCEwe3AliqYERkc9dVcfW0BnXg?from=from_copylink
后续面对sora或者类sora的强大工具,我们怎么思考/怎么使用/或者要求我们具备什么样的能力?
昨天上午写prompt时产生的想法
在使用时,我会反倒觉得不应该把他们当作纯工具:他们应该是共同协作完成目标项目的partner,要让他们参与创作其中。
如果是纯工具心态,你对自己的能力要求是我怎么才能更好地驾驭它、使用它,我如何讲好一个故事告诉他去执行;
但Gen-AI是可以理解学习的,反倒在使用时应该适当留白,少点约束,即很核心的是如何平衡规范性与创造性
昨天上午写prompt时产生的想法
在使用时,我会反倒觉得不应该把他们当作纯工具:他们应该是共同协作完成目标项目的partner,要让他们参与创作其中。
如果是纯工具心态,你对自己的能力要求是我怎么才能更好地驾驭它、使用它,我如何讲好一个故事告诉他去执行;
但Gen-AI是可以理解学习的,反倒在使用时应该适当留白,少点约束,即很核心的是如何平衡规范性与创造性
关于 Sora 的十点思考
1)Openai 出于狙击 Google 的目的,在相近的时间节点推出了 Sora,它是一个文本转视频的模型,可以做到输入 Prompt,输出视频内容;相较于竞争对手 Pika、Runway 等,Sora 拥有60s的视频长度、连贯性的画面、基础物理逻辑的遵循等特点;
2)Sora 的诞生,让视频关联行业会产生较大的成本结构变化,会导致摄影、短视频、电影等行业产生较大的变化,同时会让一些原本受限于软件使用无法进入行业的人,可以依靠创意进入相关行业。鲁智深大战林黛玉的场景,以后只需要一句 Prompt 即可实现;
3)对于创业公司来说,一定要仔细梳理Sam说过的话,考虑他的话不完全是为了营销目的进行宣传的话,而是有一定可能性已经实现或者即将实现;
4)Sora 可能还需要至少3个月的时间才会推出,这段时间需要测试公众的反应,同时寻求规避潜在风险;
5)有很大可能,Sora 的生成界面是嵌入在聊天对话内,但是第三方一定会考虑接入 Sora 的能力,宣传自己可以基于 Sora 的生成进行二次编辑,在这个过程当中,剪映、快影等应该都会跟进,Adobe 也会受到影响;
6)从对公司的影响来看,做视频生成的相关公司受到直接的冲击,做视频编辑的公司受到一定的冲击,做视频分发的公司可能会需要想办法识别AI创作类视频。对于依靠视频作为主要素材来源的行业,比如广告、短视频博主等都可能会受到冲击,加剧竞争的烈度,淘汰一大批人,最后竞争升维;
7)对普通人来说,要考虑的就是学会讲好故事,目前来说,文稿、视频、语音都可以通过不同AI工具的串联进行合并处理,一定会有公司化的方式运作视频内容的生成,这个过程会更简单以及轻量化,甚至可能5人以下的小团队就可以搞定;
8)文生视频的进展可能比大部分人的预期最快的情况还要快很多,原本只想着能不能先到15秒,没想到可以直接推进到60秒,甚至1小时都不是难以想象的事情;
9)目前整体的生成成本单次生成预估可能要超过1美元,对于 Openai 来说,如果不把成本降下来,工具可能还比较困难推进到公众面前。按照之前的迭代速度,通常半年左右会有一个新的版本出来,预估 Sora 到 3.0 或者 4.0 的时候,应该会产生飞跃;
10)对于整体视频的生成,应该是一次性生成,甚至会支持一次性生成多机位多角度的视频,支持对单视频进行二次编辑,比如插入新素材或者处理已有素材等,但是如果想要做到更智能的生成,可能还需要一点时间。
1)Openai 出于狙击 Google 的目的,在相近的时间节点推出了 Sora,它是一个文本转视频的模型,可以做到输入 Prompt,输出视频内容;相较于竞争对手 Pika、Runway 等,Sora 拥有60s的视频长度、连贯性的画面、基础物理逻辑的遵循等特点;
2)Sora 的诞生,让视频关联行业会产生较大的成本结构变化,会导致摄影、短视频、电影等行业产生较大的变化,同时会让一些原本受限于软件使用无法进入行业的人,可以依靠创意进入相关行业。鲁智深大战林黛玉的场景,以后只需要一句 Prompt 即可实现;
3)对于创业公司来说,一定要仔细梳理Sam说过的话,考虑他的话不完全是为了营销目的进行宣传的话,而是有一定可能性已经实现或者即将实现;
4)Sora 可能还需要至少3个月的时间才会推出,这段时间需要测试公众的反应,同时寻求规避潜在风险;
5)有很大可能,Sora 的生成界面是嵌入在聊天对话内,但是第三方一定会考虑接入 Sora 的能力,宣传自己可以基于 Sora 的生成进行二次编辑,在这个过程当中,剪映、快影等应该都会跟进,Adobe 也会受到影响;
6)从对公司的影响来看,做视频生成的相关公司受到直接的冲击,做视频编辑的公司受到一定的冲击,做视频分发的公司可能会需要想办法识别AI创作类视频。对于依靠视频作为主要素材来源的行业,比如广告、短视频博主等都可能会受到冲击,加剧竞争的烈度,淘汰一大批人,最后竞争升维;
7)对普通人来说,要考虑的就是学会讲好故事,目前来说,文稿、视频、语音都可以通过不同AI工具的串联进行合并处理,一定会有公司化的方式运作视频内容的生成,这个过程会更简单以及轻量化,甚至可能5人以下的小团队就可以搞定;
8)文生视频的进展可能比大部分人的预期最快的情况还要快很多,原本只想着能不能先到15秒,没想到可以直接推进到60秒,甚至1小时都不是难以想象的事情;
9)目前整体的生成成本单次生成预估可能要超过1美元,对于 Openai 来说,如果不把成本降下来,工具可能还比较困难推进到公众面前。按照之前的迭代速度,通常半年左右会有一个新的版本出来,预估 Sora 到 3.0 或者 4.0 的时候,应该会产生飞跃;
10)对于整体视频的生成,应该是一次性生成,甚至会支持一次性生成多机位多角度的视频,支持对单视频进行二次编辑,比如插入新素材或者处理已有素材等,但是如果想要做到更智能的生成,可能还需要一点时间。
生成视觉叙述:以每秒一帧的速率对视频帧进行采样。然后使用建立在Vicuna-V1-13B 的LLaMA-V1-13B模型 的fine-tuned检查点LLaVA v1.0对每帧进行标题标注。
检索功能利用向量存储:通过使用OpenAI的text-embedding-ada-002将每个视频的视觉叙述(标题和摘要)进行嵌入。
将视频整合成共同的主题:提供用户视频收藏中主题的摘要。提示包括一个功能指令,然后是画廊视频的视觉叙述。然后将此提示发送到LLM以生成概览,随后在聊天界面中呈现给用户进行审阅。
基于用户的所有视频进行视频编辑创意:提示结构以功能指令开头。如果提供了创意指导,会在提示中包含用户的创意指导,以引导头脑风暴。
根据用户提供的叙述在序列中剪辑视频片段:与以前的功能不同,它只影响时间轴上的视频。与头脑风暴类似,系统会检查用户提供的叙述中是否有任何创意指导。
4️⃣LAVE应用构建:
LAVE系统实现为全栈Web应用程序。前端UI采用React.js开发,而后端服务器采用Flask。对于LLM推理,主要使用OpenAI的最新GPT-4模型。然而,为了将行动计划映射到功能,使用了gpt-4-0613检查点,专门针对函数调用的使用进行了微调。
论文地址:网页链接
检索功能利用向量存储:通过使用OpenAI的text-embedding-ada-002将每个视频的视觉叙述(标题和摘要)进行嵌入。
将视频整合成共同的主题:提供用户视频收藏中主题的摘要。提示包括一个功能指令,然后是画廊视频的视觉叙述。然后将此提示发送到LLM以生成概览,随后在聊天界面中呈现给用户进行审阅。
基于用户的所有视频进行视频编辑创意:提示结构以功能指令开头。如果提供了创意指导,会在提示中包含用户的创意指导,以引导头脑风暴。
根据用户提供的叙述在序列中剪辑视频片段:与以前的功能不同,它只影响时间轴上的视频。与头脑风暴类似,系统会检查用户提供的叙述中是否有任何创意指导。
4️⃣LAVE应用构建:
LAVE系统实现为全栈Web应用程序。前端UI采用React.js开发,而后端服务器采用Flask。对于LLM推理,主要使用OpenAI的最新GPT-4模型。然而,为了将行动计划映射到功能,使用了gpt-4-0613检查点,专门针对函数调用的使用进行了微调。
论文地址:网页链接
这玩意再加上 Sora 这样的视频生成模型,一些简单的短视频以及广告视频基本上就不需要人工介入了,大家以后刷的估计都是生成出来的视频了,想要啥有啥。
我下面会简单介绍一下这个剪辑工具的界面组成和 Agents 设计:
-----------工具界面及交互(图 1)-----------
A 区域主要是输入提示词以及展示 LLM 详细的剪辑逻辑。
B 区域是素材库,你可以鼠标 Hover 后获得 LLM 帮你总结的这段视频的内容,不需要播放查看, AI 也会自动生成的素材标题。
E 区域就是传统的视频时间轴,AI 剪辑的视频就在这里,你也可以手动调整。
-----------Agents 设计(图 2)-----------
1️⃣系统提示前言:
角色分配:一个开场段指示Agents担任视频编辑助理,负责根据用户命令生成行动计划。
动作描述:在角色分配之后,描述了Agents可以执行的一系列动作。每个动作对应于LAVE支持的编辑功能。详细说明了每个动作的功能和用例,帮助Agents选择适当的响应以满足用户的命令。
格式指导:最后,指导Agents以一致的格式输出行动计划:首先确定用户的编辑目标,然后列出逐步计划,列举建议的行动以实现该目标。
其他系统提示:
在前言之后,附加了最近的对话历史,以及最新的用户输入。这种组合形成了发送给LLM以生成行动计划的完整提示。
2️⃣制定行动计划后,将其提交给用户进行批准:
与批量批准不同,每个行动都由用户依次批准。这种方法允许用户执行一个行动,观察其结果,然后决定是否继续进行下一个行动。LAVE从行动计划中解析每个行动描述,并将其转化为相应的后端函数调用。
3️⃣LAVE支持五种LLM功能:
1)素材概览,2)创意头脑风暴,3)视频检索,4)故事板,5)剪辑修剪。前四种功能可通过Agents访问,而剪辑修剪可通过双击编辑时间轴上的剪辑时出现的窗口进行。
其中,基于语言的视频检索是通过向量存储数据库实现的,而其余功能则是通过LLM提示工程实现的。所有功能都是基于自动生成的语言构建的。
本小册为 大胡子和 彭涛共创,大胡子RPA进阶课作者,RPA领域老法师
小红书,抖音,微信,等各大平台有丰富经验,非常多RPA经典案例。
小册:提供了以automa、uibot、影刀等开发的高效RPA工具,场景包含浏览器、桌面软件端的RPA自动化,一个工具就让你效率翻倍,职场人士,自媒体创业必备神器。
50个 RPA 机器人,帮你无代码,自动化实现爬虫
RPA 代替我们的双手,RPA+AI 代替我们的双手和大脑。
例如:我们写旅游攻略,放在以前,一篇攻略可能需要写1天,但现在 AI可以在30s告诉你答案,然后再通过 RPA 发布到平台。
搞了个 Sora 体系化知识库
花了一天时间学习了 Sora 目前公开可查的内容,并且将比较好的内容都整理到 LangGPT 知识库了,比市面上现有的 Sora 诈骗课程内容更全,质量更好,公开、免费。
包括官方技术报告,博客,现有视频生成模型对比分析,各方观点,比较好的一些微信文章。
持续更新,欢迎关注转发,欢迎推荐优质内容,更欢迎共创!
https://langgptai.feishu.cn/wiki/I9Nhw0qLSiSfYEkXRmHcczFAn2c?fromScene=spaceOverview
花了一天时间学习了 Sora 目前公开可查的内容,并且将比较好的内容都整理到 LangGPT 知识库了,比市面上现有的 Sora 诈骗课程内容更全,质量更好,公开、免费。
包括官方技术报告,博客,现有视频生成模型对比分析,各方观点,比较好的一些微信文章。
持续更新,欢迎关注转发,欢迎推荐优质内容,更欢迎共创!
https://langgptai.feishu.cn/wiki/I9Nhw0qLSiSfYEkXRmHcczFAn2c?fromScene=spaceOverview
事实上,人家openAI从未在任何官方宣传资料上使用过【世界模型(英文:world model)】这个名词来宣传sora,关于sora和世界模型的关系基本来自于翻译的误读、部分人群的颅内高潮外加营销号的刻意造势。
【世界模型】的定义并不在于它生成的东西能不能像一个世界。
一个模型如果能够被认定为【世界模型】它必须要向人们证明:其模型的预测结果可以随着环境中的主动交互进行变化,且这种变化还需要符合正确且统一的物理规律。(即图1中action的影响部分)
也正因为如此,【世界模型】才可以被应用到训练、测试和端到端的决策系统上。
从sora的技术方案中可看出(图2),sora的生成行为为:一次性生成视频而非不断地生成单帧图片。这意味着:sora生成的视频内容无法在其生成过程中被影响。
sora的生成行为从技术本质上来说是:一次生成=一个完整的视频。(抽一次卡一个视频),而基于【世界模型】的文生视频模型需要能够让你看到这个视频在时间线上的生成过程并且你还能够在这个过程没有走到结束的时候影响它的结果。
举个🌰,如果你让sora生成一个:林克在草丛中奔跑,它也许能很好的完成任务,比如模仿出塞尔达的场景,让一个穿着英杰服拿着大师剑的林克在草丛中奔跑,也许它还能更好比如能转个弯跳一下。但是如果它是【世界模型】的话,你可以随时按照你的需要改变他奔跑的轨迹,甚至让他停下来,就像在玩游戏一样。
sora当然做不到这些😓🤣🤣🤣甚至连物理规律都没学好🤣🤣🤣
如果还有人告诉你它是世界模型,那么要么它就不该是你收集信息的信息源了,要么ta想骗你点什么。
我强烈推荐你阅读关于Myers-Briggs性格类型的这篇文章: https://www.myersbriggs.org/my-mbti-personality-type/myers-briggs-overview/。
这篇文章提供了关于Myers-Briggs框架和一般性格概念的深入理解。你可以了解“偏好”如何影响我们的思维方式,以及如何识别和发展你自己的个性类型。该框架包括了八种偏好,它们组合在四对相反的对中。此外,该文章也谈论了生来与后天学到的偏好如何影响我们的个性特征,并强调了Myers-Briggs性格类型指标的目标——帮助人们识别和理解自己如何获取信息和做决策。祝阅读愉快!如有疑问或需要进一步讨论,随时告诉我。
这篇文章提供了关于Myers-Briggs框架和一般性格概念的深入理解。你可以了解“偏好”如何影响我们的思维方式,以及如何识别和发展你自己的个性类型。该框架包括了八种偏好,它们组合在四对相反的对中。此外,该文章也谈论了生来与后天学到的偏好如何影响我们的个性特征,并强调了Myers-Briggs性格类型指标的目标——帮助人们识别和理解自己如何获取信息和做决策。祝阅读愉快!如有疑问或需要进一步讨论,随时告诉我。
1. 我的问题
我想系统了解下MBTI,类似www.16personalities.com中的信息,它是否可信呢?
2. 回答
## 理解信息
你提供的链接内容详细介绍了一个理解和分类人格类型的框架。这个框架似乎依赖于心理学家卡尔·古斯塔夫·荣格的研究,以及由凯瑟琳·库克·布里格斯和她的女儿伊莎贝尔·布里格斯·迈尔斯联合编写的广为人知的人格指标——Myers-Briggs型人格指标(MBTI)。
该文本解释了这个人格框架基于特性的概念,而非类型。换句话说,它们并不是将人们划分为严格的类型,而是根据他们展现出某种特质的程度进行考察。你的目的看起来是更清楚地理解这个人格框架。
## 思维模型
处理你问题的合适思维模型是“概念框架分析”。这将帮助我们将像这样的复杂概念和理论分解为易于理解的部分。
## 解决方法
我们来应用“概念框架分析”:
### 整体概念理解:
描述的人格框架基于特质,而不是类型。它衡量特定特质被展现的程度,而不是将人们分入预设的类别中。
### 历史背景:
这个框架的理论根基在荣格的理论以及布里格斯母女设计的Myers-Briggs型人格指标(MBTI)。
### 特性模型和类型模型的区别:
像文中描述的这样的特性模型,会衡量个体展现出某种特性的程度。比如,而不是将某人分类为内向者或外向者,他们可能会被定位到一个衡量内向和外向程度的连续体上。相反,类型模型将人们根据其属性划分为预设的类型,通常是二分的。
### 应用和解释:
这个框架通过承认特性间的连续性,而非绝对的类型,提供了更细微的人格理解。例如,有些人可能显示出内向和外向特性的双重特征,称为“中间性格”。
## 形象理解
可以想象一个滑杆。一个端是内向,另一个端是外向。而个人可以在这个滑杆上滑动到任何点,这样能更准确地展现他们的人格特质。如需深入阅读,你可以探索卡尔·古斯塔夫·荣格的原始文本或凯瑟琳·库克·布里格斯和伊莎贝尔·布里格斯·迈尔斯的著作。
请记得,标签和框架的存在是为了帮助我们理解,而不是限制或完全定义我们。我们每个人都以自己的方式独一无二。如果你需要更多的解释或有其他问题,尽管告诉我!
3. 追问
请给出你推荐的阅读内容的网页链接。
4. 回答