关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
没有 60 秒的用,还是先磨练自己的 4 秒技艺吧。#ai视频#歸藏的AI工具箱的微博视频
#广告 【海外美区信用卡】
支持所有海外软件服务的开通,畅游世界,安全支付,另外还赠送海外居住地址、海外手机号、邮箱、IP等。

新用户使用邀请码开户立减 2 美金。邀请码:LUCK88
或链接访问:https://bewildcard.com/i/LUCK88
就知道会有这个,AnimateLCM-SVD-xt 利用了 LCM 技术蒸馏的 SVD 模型,只需要四步就能生成不错的视频,相比原来的模型生成时间缩短了好几倍。#ai视频#

遵循 AnimateLCM 论文中提出的策略,一致性蒸馏稳定视频扩散 Image2Video-XT (SVD-xt)。 AnimateLCM-SVD-xt 可以通过 2~8 个步骤生成 25 帧的高质量图像调节视频,分辨率为 576x1024。

AnimateLCM-SVD-xt 通常能在无需依赖分类器的自由引导下,仅通过四个步骤就生成高质量的演示。因此与普通的 SVD 模型相比,可以节省 25 x 2 / 4 = 12.5 倍的计算资源。

模型地址:网页链接歸藏的AI工具箱的微博视频
15 号发布的一个大世界模型,感觉像是一个带视频生成的多模态模型,也挺厉害了,跟 Gemini 1.5 Pro 的能力差不多了。#ai#
支持 100 万上下文的文本检索,可以分析超过 1 小时的视频,支持视频生成和图片生成。

模型介绍:
我们创建了一个包含多样视频和书籍的大型数据集,运用了 RingAttention(环形注意力)技术来高效训练长序列,并逐步将上下文大小从4千扩展至100万个标记。

本文的主要贡献包括:(a) 构建了具有最大上下文大小的神经网络:我们训练了一个在处理长视频和语言序列方面具有前所未有的大上下文规模的 Transformer(变换器),在复杂的检索任务和长视频理解方面设立了新的标准。

(b) 提出了克服视觉-语言训练挑战的多种解决方案,包括使用遮蔽序列打包技术混合不同长度的序列、通过损失加权平衡语言和视觉的重要性,以及为长序列对话创建由模型生成的问答数据集。

(c) 实现了一种高度优化的训练方案,结合了 RingAttention、遮蔽序列打包等关键特性,适用于数百万长度的多模态序列。

(d) 完全开源了一系列拥有70亿参数的模型家族,能够处理长达100万标记以上的长文本文档(LWM-Text, LWM-Text-Chat)和视频(LWM, LWM-Chat)。

这项工作为在大规模的长视频和语言数据集上训练,进而理解人类知识和多模态世界,以及开发更广泛的AI能力铺平了道路。

项目页面:网页链接歸藏的AI工具箱的微博视频
上午看 Sora 的几点收获:

🟣 Sora完全站在了Openai成功产品的肩膀上。

chatGPT背后是个大语言模型,把一个句子拆成若干个token,可能是一个单词、一个词组、一个短句,通过海量数据训练,推测下一个最大概率的token(生成文字)。

Sora模型,同样是把海量视频拆成一个个分块,配合GPT强大的语言能力,给视频分块增加和扩充文字描述。
当海量的训练视频都用这种分块统一拆分学习后,用户输入新指令,就可以从不同的分块里预测和生成新的视频分块,再变成一整条视频。

即:用语言模型 👉🏻 把用户指令扩写和改写 👉🏻 输入视频模型 👉🏻 生成新视频

这相当于人类给了一个作文题,语言模型写一篇描写场景的小作文,Sora再根据这篇作文生成视频,所以细节会比其他 AI 视频产品强太多。

🟣 新世界降临前夕,我们普通人可以做什么?

快刀青衣老师的观点:不管是文生视频、文生图,技术底层关注的是「生」,而我们普通人需要关注的是「文」。

表达有短板、想象力不够,出来的图和视频是没有意境的。
🌅 有文化的你输入“大漠孤烟直,长河落日圆”,没文化的我输入“沙漠上空挂着一个圆太阳”,出来的效果就是卖家秀和买家秀的区别。

保持阅读、在阅读的时候记录下具有画面感的段落、收集经典电影的精彩镜头…… 在技术逐渐平权的时代当下,期待我们每个人都能有“超能力”。
.jpg
393.5 KB
AI探索指南
Meta 发布了一个可以利用 AI 自动剪辑视频的 Agents LAVE。 这玩意再加上 Sora 这样的视频生成模型,一些简单的短视频以及广告视频基本上就不需要人工介入了,大家以后刷的估计都是生成出来的视频了,想要啥有啥。 我下面会简单介绍一下这个剪辑工具的界面组成和 Agents 设计: -----------工具界面及交互(图 1)----------- A 区域主要是输入提示词以及展示 LLM 详细的剪辑逻辑。 B 区域是素材库,你可以鼠标 Hover 后获得 LLM 帮你总结的这段视频的内容,不需要播放查看,…
生成视觉叙述:以每秒一帧的速率对视频帧进行采样。然后使用建立在Vicuna-V1-13B 的LLaMA-V1-13B模型 的fine-tuned检查点LLaVA v1.0对每帧进行标题标注。

检索功能利用向量存储:通过使用OpenAI的text-embedding-ada-002将每个视频的视觉叙述(标题和摘要)进行嵌入。

将视频整合成共同的主题:提供用户视频收藏中主题的摘要。提示包括一个功能指令,然后是画廊视频的视觉叙述。然后将此提示发送到LLM以生成概览,随后在聊天界面中呈现给用户进行审阅。

基于用户的所有视频进行视频编辑创意:提示结构以功能指令开头。如果提供了创意指导,会在提示中包含用户的创意指导,以引导头脑风暴。

根据用户提供的叙述在序列中剪辑视频片段:与以前的功能不同,它只影响时间轴上的视频。与头脑风暴类似,系统会检查用户提供的叙述中是否有任何创意指导。

4️⃣LAVE应用构建:

LAVE系统实现为全栈Web应用程序。前端UI采用React.js开发,而后端服务器采用Flask。对于LLM推理,主要使用OpenAI的最新GPT-4模型。然而,为了将行动计划映射到功能,使用了gpt-4-0613检查点,专门针对函数调用的使用进行了微调。

论文地址:https://arxiv.org/pdf/2402.10294.pdf
FvNz621Wn5SiZy30-CbYIsD88hsJv3.png
346.7 KB
Meta 发布了一个可以利用 AI 自动剪辑视频的 Agents LAVE。
这玩意再加上 Sora 这样的视频生成模型,一些简单的短视频以及广告视频基本上就不需要人工介入了,大家以后刷的估计都是生成出来的视频了,想要啥有啥。

我下面会简单介绍一下这个剪辑工具的界面组成和 Agents 设计:

-----------工具界面及交互(图 1)-----------

A 区域主要是输入提示词以及展示 LLM 详细的剪辑逻辑。

B 区域是素材库,你可以鼠标 Hover 后获得 LLM 帮你总结的这段视频的内容,不需要播放查看, AI 也会自动生成的素材标题。

E 区域就是传统的视频时间轴,AI 剪辑的视频就在这里,你也可以手动调整。

-----------Agents 设计(图 2)-----------

1️⃣系统提示前言:

角色分配:一个开场段指示Agents担任视频编辑助理,负责根据用户命令生成行动计划。

动作描述:在角色分配之后,描述了Agents可以执行的一系列动作。每个动作对应于LAVE支持的编辑功能。详细说明了每个动作的功能和用例,帮助Agents选择适当的响应以满足用户的命令。

格式指导:最后,指导Agents以一致的格式输出行动计划:首先确定用户的编辑目标,然后列出逐步计划,列举建议的行动以实现该目标。

其他系统提示:

在前言之后,附加了最近的对话历史,以及最新的用户输入。这种组合形成了发送给LLM以生成行动计划的完整提示。

2️⃣制定行动计划后,将其提交给用户进行批准:

与批量批准不同,每个行动都由用户依次批准。这种方法允许用户执行一个行动,观察其结果,然后决定是否继续进行下一个行动。LAVE从行动计划中解析每个行动描述,并将其转化为相应的后端函数调用。

3️⃣LAVE支持五种LLM功能:

1)素材概览,2)创意头脑风暴,3)视频检索,4)故事板,5)剪辑修剪。前四种功能可通过Agents访问,而剪辑修剪可通过双击编辑时间轴上的剪辑时出现的窗口进行。

其中,基于语言的视频检索是通过向量存储数据库实现的,而其余功能则是通过LLM提示工程实现的。所有功能都是基于自动生成的语言构建的。
【重磅干货】朋友们,目前Sora没有对外开放,大家不要买市面上任何的课程和资料,避免割韭菜,大国为大家整理了市面上最全的Sora学习资料,覆盖介绍,未来变现玩法,各路观点,技术解读等等,免费开放给大家学习!

💫详细学习参考:https://yunyinghui.feishu.cn/wiki/BaCEwe3AliqYERkc9dVcfW0BnXg?from=from_copylink
后续面对sora或者类sora的强大工具,我们怎么思考/怎么使用/或者要求我们具备什么样的能力?

昨天上午写prompt时产生的想法

在使用时,我会反倒觉得不应该把他们当作纯工具:他们应该是共同协作完成目标项目的partner,要让他们参与创作其中。

如果是纯工具心态,你对自己的能力要求是我怎么才能更好地驾驭它、使用它,我如何讲好一个故事告诉他去执行;

但Gen-AI是可以理解学习的,反倒在使用时应该适当留白,少点约束,即很核心的是如何平衡规范性与创造性
关于 Sora 的十点思考

1)Openai 出于狙击 Google 的目的,在相近的时间节点推出了 Sora,它是一个文本转视频的模型,可以做到输入 Prompt,输出视频内容;相较于竞争对手 Pika、Runway 等,Sora 拥有60s的视频长度、连贯性的画面、基础物理逻辑的遵循等特点;

2)Sora 的诞生,让视频关联行业会产生较大的成本结构变化,会导致摄影、短视频、电影等行业产生较大的变化,同时会让一些原本受限于软件使用无法进入行业的人,可以依靠创意进入相关行业。鲁智深大战林黛玉的场景,以后只需要一句 Prompt 即可实现;

3)对于创业公司来说,一定要仔细梳理Sam说过的话,考虑他的话不完全是为了营销目的进行宣传的话,而是有一定可能性已经实现或者即将实现;

4)Sora 可能还需要至少3个月的时间才会推出,这段时间需要测试公众的反应,同时寻求规避潜在风险;

5)有很大可能,Sora 的生成界面是嵌入在聊天对话内,但是第三方一定会考虑接入 Sora 的能力,宣传自己可以基于 Sora 的生成进行二次编辑,在这个过程当中,剪映、快影等应该都会跟进,Adobe 也会受到影响;

6)从对公司的影响来看,做视频生成的相关公司受到直接的冲击,做视频编辑的公司受到一定的冲击,做视频分发的公司可能会需要想办法识别AI创作类视频。对于依靠视频作为主要素材来源的行业,比如广告、短视频博主等都可能会受到冲击,加剧竞争的烈度,淘汰一大批人,最后竞争升维;

7)对普通人来说,要考虑的就是学会讲好故事,目前来说,文稿、视频、语音都可以通过不同AI工具的串联进行合并处理,一定会有公司化的方式运作视频内容的生成,这个过程会更简单以及轻量化,甚至可能5人以下的小团队就可以搞定;

8)文生视频的进展可能比大部分人的预期最快的情况还要快很多,原本只想着能不能先到15秒,没想到可以直接推进到60秒,甚至1小时都不是难以想象的事情;

9)目前整体的生成成本单次生成预估可能要超过1美元,对于 Openai 来说,如果不把成本降下来,工具可能还比较困难推进到公众面前。按照之前的迭代速度,通常半年左右会有一个新的版本出来,预估 Sora 到 3.0 或者 4.0 的时候,应该会产生飞跃;

10)对于整体视频的生成,应该是一次性生成,甚至会支持一次性生成多机位多角度的视频,支持对单视频进行二次编辑,比如插入新素材或者处理已有素材等,但是如果想要做到更智能的生成,可能还需要一点时间。
AI探索指南
Meta 发布了一个可以利用 AI 自动剪辑视频的 Agents LAVE。#ai视频# 这玩意再加上 Sora 这样的视频生成模型,一些简单的短视频以及广告视频基本上就不需要人工介入了,大家以后刷的估计都是生成出来的视频了,想要啥有啥。 我下面会简单介绍一下这个剪辑工具的界面组成和 Agents 设计: -----------工具界面及交互(图 1)----------- A 区域主要是输入提示词以及展示 LLM 详细的剪辑逻辑。 B 区域是素材库,你可以鼠标 Hover 后获得 LLM 帮你总…
生成视觉叙述:以每秒一帧的速率对视频帧进行采样。然后使用建立在Vicuna-V1-13B 的LLaMA-V1-13B模型 的fine-tuned检查点LLaVA v1.0对每帧进行标题标注。

检索功能利用向量存储:通过使用OpenAI的text-embedding-ada-002将每个视频的视觉叙述(标题和摘要)进行嵌入。

将视频整合成共同的主题:提供用户视频收藏中主题的摘要。提示包括一个功能指令,然后是画廊视频的视觉叙述。然后将此提示发送到LLM以生成概览,随后在聊天界面中呈现给用户进行审阅。

基于用户的所有视频进行视频编辑创意:提示结构以功能指令开头。如果提供了创意指导,会在提示中包含用户的创意指导,以引导头脑风暴。

根据用户提供的叙述在序列中剪辑视频片段:与以前的功能不同,它只影响时间轴上的视频。与头脑风暴类似,系统会检查用户提供的叙述中是否有任何创意指导。

4️⃣LAVE应用构建:

LAVE系统实现为全栈Web应用程序。前端UI采用React.js开发,而后端服务器采用Flask。对于LLM推理,主要使用OpenAI的最新GPT-4模型。然而,为了将行动计划映射到功能,使用了gpt-4-0613检查点,专门针对函数调用的使用进行了微调。

论文地址:网页链接
006KpAl0ly1hmyrjgiezsj321m0gi10z.jpg
307 KB
Meta 发布了一个可以利用 AI 自动剪辑视频的 Agents LAVE。#ai视频#
这玩意再加上 Sora 这样的视频生成模型,一些简单的短视频以及广告视频基本上就不需要人工介入了,大家以后刷的估计都是生成出来的视频了,想要啥有啥。

我下面会简单介绍一下这个剪辑工具的界面组成和 Agents 设计:

-----------工具界面及交互(图 1)-----------

A 区域主要是输入提示词以及展示 LLM 详细的剪辑逻辑。

B 区域是素材库,你可以鼠标 Hover 后获得 LLM 帮你总结的这段视频的内容,不需要播放查看, AI 也会自动生成的素材标题。

E 区域就是传统的视频时间轴,AI 剪辑的视频就在这里,你也可以手动调整。

-----------Agents 设计(图 2)-----------

1️⃣系统提示前言:

角色分配:一个开场段指示Agents担任视频编辑助理,负责根据用户命令生成行动计划。

动作描述:在角色分配之后,描述了Agents可以执行的一系列动作。每个动作对应于LAVE支持的编辑功能。详细说明了每个动作的功能和用例,帮助Agents选择适当的响应以满足用户的命令。

格式指导:最后,指导Agents以一致的格式输出行动计划:首先确定用户的编辑目标,然后列出逐步计划,列举建议的行动以实现该目标。

其他系统提示:

在前言之后,附加了最近的对话历史,以及最新的用户输入。这种组合形成了发送给LLM以生成行动计划的完整提示。

2️⃣制定行动计划后,将其提交给用户进行批准:

与批量批准不同,每个行动都由用户依次批准。这种方法允许用户执行一个行动,观察其结果,然后决定是否继续进行下一个行动。LAVE从行动计划中解析每个行动描述,并将其转化为相应的后端函数调用。

3️⃣LAVE支持五种LLM功能:

1)素材概览,2)创意头脑风暴,3)视频检索,4)故事板,5)剪辑修剪。前四种功能可通过Agents访问,而剪辑修剪可通过双击编辑时间轴上的剪辑时出现的窗口进行。

其中,基于语言的视频检索是通过向量存储数据库实现的,而其余功能则是通过LLM提示工程实现的。所有功能都是基于自动生成的语言构建的。
兄弟们,2024 还不知道影刀,不知道 RPA,真心推荐你看看我朋友涛哥的 RPA 小册子
本小册为 大胡子和 彭涛共创,大胡子RPA进阶课作者,RPA领域老法师
小红书,抖音,微信,等各大平台有丰富经验,非常多RPA经典案例。

小册:提供了以automa、uibot、影刀等开发的高效RPA工具,场景包含浏览器、桌面软件端的RPA自动化,一个工具就让你效率翻倍,职场人士,自媒体创业必备神器。

50个 RPA 机器人,帮你无代码,自动化实现爬虫

RPA 代替我们的双手,RPA+AI 代替我们的双手和大脑。

例如:我们写旅游攻略,放在以前,一篇攻略可能需要写1天,但现在 AI可以在30s告诉你答案,然后再通过 RPA 发布到平台。
搞了个 Sora 体系化知识库

花了一天时间学习了 Sora 目前公开可查的内容,并且将比较好的内容都整理到 LangGPT 知识库了,比市面上现有的 Sora 诈骗课程内容更全,质量更好,公开、免费。

包括官方技术报告,博客,现有视频生成模型对比分析,各方观点,比较好的一些微信文章。

持续更新,欢迎关注转发,欢迎推荐优质内容,更欢迎共创!

https://langgptai.feishu.cn/wiki/I9Nhw0qLSiSfYEkXRmHcczFAn2c?fromScene=spaceOverview
[整理]基于Sora是否真的像Open AI说的一样是个世界模型,又吵起来了。#ai视频##sora#

基本上就是两派一派类似杨立昆的论点,模型必须理解底层理论从底层理论推导出来物理现象才能叫世界模型。

另一派的意思是只要他表现出来相当程度的物理世界的表现,那就有继续优化的机会,就有可能变成完整的世界 ...
智能汽车更像是给AI机器人练手的前导产业
鉴于我们团队从去年开始就在做【世界模型(worldmodel)我必须要坚决地站在Yann 佬这边🤣地指出OpenAI的Sora根本不是世界模型,甚至除了都属于图像领域模型以外没有半毛钱关系。

事实上,人家openAI从未在任何官方宣传资料上使用过【世界模型(英文:world model)】这个名词来宣传sora,关于sora和世界模型的关系基本来自于翻译的误读、部分人群的颅内高潮外加营销号的刻意造势。

【世界模型】的定义并不在于它生成的东西能不能像一个世界。

一个模型如果能够被认定为【世界模型】它必须要向人们证明:其模型的预测结果可以随着环境中的主动交互进行变化,且这种变化还需要符合正确且统一的物理规律。(即图1中action的影响部分)

也正因为如此,【世界模型】才可以被应用到训练、测试和端到端的决策系统上。

从sora的技术方案中可看出(图2),sora的生成行为为:一次性生成视频而非不断地生成单帧图片。这意味着:sora生成的视频内容无法在其生成过程中被影响。

sora的生成行为从技术本质上来说是:一次生成=一个完整的视频。(抽一次卡一个视频),而基于【世界模型】的文生视频模型需要能够让你看到这个视频在时间线上的生成过程并且你还能够在这个过程没有走到结束的时候影响它的结果。

举个🌰,如果你让sora生成一个:林克在草丛中奔跑,它也许能很好的完成任务,比如模仿出塞尔达的场景,让一个穿着英杰服拿着大师剑的林克在草丛中奔跑,也许它还能更好比如能转个弯跳一下。但是如果它是【世界模型】的话,你可以随时按照你的需要改变他奔跑的轨迹,甚至让他停下来,就像在玩游戏一样。

sora当然做不到这些😓🤣🤣🤣甚至连物理规律都没学好🤣🤣🤣

如果还有人告诉你它是世界模型,那么要么它就不该是你收集信息的信息源了,要么ta想骗你点什么。
AI探索指南
正在用coze搭建一个聊天机器人,目前还很粗糙,但是从回答上看,已经呈现很不错的结构化知识了。 1. 我的问题 我想系统了解下MBTI,类似www.16personalities.com中的信息,它是否可信呢? 2. 回答 ## 理解信息 你提供的链接内容详细介绍了一个理解和分类人格类型的框架。这个框架似乎依赖于心理学家卡尔·古斯塔夫·荣格的研究,以及由凯瑟琳·库克·布里格斯和她的女儿伊莎贝尔·布里格斯·迈尔斯联合编写的广为人知的人格指标——Myers-Briggs型人格指标(MBTI)。 该文本解释…
我强烈推荐你阅读关于Myers-Briggs性格类型的这篇文章: https://www.myersbriggs.org/my-mbti-personality-type/myers-briggs-overview/。
这篇文章提供了关于Myers-Briggs框架和一般性格概念的深入理解。你可以了解“偏好”如何影响我们的思维方式,以及如何识别和发展你自己的个性类型。该框架包括了八种偏好,它们组合在四对相反的对中。此外,该文章也谈论了生来与后天学到的偏好如何影响我们的个性特征,并强调了Myers-Briggs性格类型指标的目标——帮助人们识别和理解自己如何获取信息和做决策。祝阅读愉快!如有疑问或需要进一步讨论,随时告诉我。
Back to Top