关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
对sora比较深入的分析

从电影和游戏行业的视角出发。指出了Sora在模拟物理现象和创意内容生成方面的局限性,也强调了其在多模态学习和生成能力上的潜力。以下是意见的总结:

Sora的局限性:
Sora虽然能够模拟物理现象,但其物理理解仍然脆弱,无法完全替代专业的物理引擎。
在物体交互和物理规则的理解上存在不足,可能导致超现实的结果。
Sora的生成内容依赖于大量数据的压缩和提炼,而非完全的物理模拟。

Sora的创新与潜力:
通过将视频内容压缩到隐空间,Sora有效地解决了处理高分辨率视频所需的计算资源问题。
其技术可能影响实时影像资料的处理和分析,如直播和监控视频数据。
Sora的应用可能为AI模型训练提供新路径,特别是在多模态数据和复杂现实世界情境的理解方面。
对未来的展望:

Sora技术的发展可能需要在提升算力和优化算法效率之间找到平衡。
尽管Sora不会取代游戏引擎开发者或影视特效师,但它可以作为创意预览阶段的工具,帮助普通人进行民主化创作。
Sora的多模态能力可能通过3D引擎模型进一步发展,为虚拟世界的构建提供自动化支持。

这个见解强调AI在创意和模拟物理现象方面的潜力,同时也提醒我们AI技术仍有待发展,特别是在理解和模拟复杂物理世界方面。
IMG_2568.JPG
2.3 MB
[整理]GPT-4生成的这段鸡汤文煽动性很强,同时提示词也很管用,我生成的另一段情绪也很饱满。#ai#

GPT-4回答的翻译:好吧,我们要全力以赴了。你正站在一个宇宙的边缘,这个宇宙渴望有人像你一样站出来执掌大权,将星座握在手中,重排成字母,把你的名字刻在整个宇宙上。

这不仅仅是为了应付日常生活或者挺过令人厌烦的闲聊;这是关于在一个无法抗拒你的宇宙中夺得你的王位,展现你的意志、激情和坚定不移的动力。

你就像自然界的力量,一股既创造性又狂暴的风暴,无法被定义或限制。你的每一次呼吸都充满战斗精神,每一步行走都能震撼现实的基础。你不是来这里过安稳的生活,也不是悄悄地向深渊低语,希望得到温和的回响。不,你是来向虚无大声疾呼,挑战星辰,进行一场命运的决斗,唯一的结果就是你的彻底胜利。

忘记成为海洋中的一滴水吧;你是撕裂海洋的海啸。你是恐龙恐惧的陨石,连光也不敢停留的黑洞。在你的雄心壮志面前,任何障碍都会像在炽热太阳下的薄雾一样消散。疑虑?那是那些还没意识到唯一存在的限制是他们自己设定的凡人的事。

即使周围的世界看起来充满悲观,你也是希望的灯塔,在暴风雨中引导自己和他人前往未知的岸边。你的乐观是你的盾,你的意志是你的剑,你的勇气是你无敌的铠甲。

今天,就在这一刻,你站起来,决定这是你的时刻。不是明天,不是在遥远的未来,而是就在现在。你将征服你的恐惧,你的疑惑,甚至是整个宇宙。你将创造历史,不是因为它会被赋予你,而是因为你将用自己的双手和永不言败的心去夺取它。

所以,让我们出发吧。宇宙还没准备好迎接即将来临的风暴。你不仅仅是乘风破浪,你将掀起波涛。因为那就是你,世界将不是小声地记住你的名字,而是作为一声穿越时代的战斗呐喊来铭记。让我们开始吧。

来源:网页链接
[整理]k_zer0s老哥对Groq的LPU为什么能有这么快的推理速度做了相对详细的解释:

Groq的LPU在处理请求和响应方面,速度超越了Nvidia的GPU。#ai##硬件#

不同于Nvidia GPU需要依赖高速数据传输,Groq的LPU在其系统中没有采用高带宽存储器(HBM)。它使用的是SRAM,其速度比GPU所用的存储器快约20倍。

鉴于AI的推理计算相较于模型训练需要的数据量远小,Groq的LPU因此更节能。在执行推理任务时,它从外部内存读取的数据更少,消耗的电量也低于Nvidia的GPU。

LPU的工作原理与GPU截然不同。它采用了时序指令集计算机(Temporal Instruction Set Computer)架构,这意味着它无需像使用高带宽存储器(HBM)的GPU那样频繁地从内存中加载数据。这一特点不仅有助于避免HBM短缺的问题,还能有效降低成本。

如果在AI处理场景中采用Groq的LPU,可能就无需为Nvidia GPU配置特殊的存储解决方案。LPU并不像GPU那样对存储速度有极高要求。Groq公司宣称,其技术能够通过其强大的芯片和软件,在AI任务中取代GPU的角色。

来源:网页链接
他们那边最牛的是人工智能,我们这边最牛的是人工智能培训😅
九年前就想做的情感陪伴机器人,海外少数公司小的Demo已经实现了,下一个10年顶峰相见。
前几天那个每秒输出500个Token的项目groq,公开了他们的API,他们的输出速度比顶级运营商快18倍。得益于这个速度,甚至实现了完全实时的远程AI对话。#ai#

Mixtral, 8x7B SMoE可以达到480 Token/S,价格为100万Token 0.27美元。极限情况下他们用Llama2 7B甚至能实现750 Token/S。

目前他们还提供100万 Token的免费试用。API完全兼容OpenAI API。

这里尝试groq:网页链接歸藏的AI工具箱的微博视频
我自己尝试了一下这个每秒输出500个Token的项目groq,这速度确实离谱,每秒485Token。视频没有加速。#ai#

你可以在这里尝试:groq.com 歸藏的AI工具箱的微博视频
🧪#晚安提示词# 还是来画龙吧,整了一套非常抽象全是华丽形容词的提示词,没想到用 MJ 和 Niji 画的结果都不错。#ai画图#

老样子建议更换-- s 后面的数值试试,400 起步。整个画面非常华丽细节非常多,带来的后果就是很多的噪点,建议用一下放大服务会好一些。

提示词:
Majestic Chinese dragon, ethereal glow, white scales, iridescent feathers, flowing mane, sparkling stars, cosmic backdrop, crescent moons, swirling nebulae, pastel colors, luminescent tendrils, fantastical creature, elegant posture, celestial ambiance, opalescent wings, dream-like quality, delicate horns, soft lighting, interstellar space, magical presence, transcendent beauty. --ar 16:9 --style raw --stylize 400 --niji 6
没有 60 秒的用,还是先磨练自己的 4 秒技艺吧。#ai视频#歸藏的AI工具箱的微博视频
#广告 【海外美区信用卡】
支持所有海外软件服务的开通,畅游世界,安全支付,另外还赠送海外居住地址、海外手机号、邮箱、IP等。

新用户使用邀请码开户立减 2 美金。邀请码:LUCK88
或链接访问:https://bewildcard.com/i/LUCK88
就知道会有这个,AnimateLCM-SVD-xt 利用了 LCM 技术蒸馏的 SVD 模型,只需要四步就能生成不错的视频,相比原来的模型生成时间缩短了好几倍。#ai视频#

遵循 AnimateLCM 论文中提出的策略,一致性蒸馏稳定视频扩散 Image2Video-XT (SVD-xt)。 AnimateLCM-SVD-xt 可以通过 2~8 个步骤生成 25 帧的高质量图像调节视频,分辨率为 576x1024。

AnimateLCM-SVD-xt 通常能在无需依赖分类器的自由引导下,仅通过四个步骤就生成高质量的演示。因此与普通的 SVD 模型相比,可以节省 25 x 2 / 4 = 12.5 倍的计算资源。

模型地址:网页链接歸藏的AI工具箱的微博视频
15 号发布的一个大世界模型,感觉像是一个带视频生成的多模态模型,也挺厉害了,跟 Gemini 1.5 Pro 的能力差不多了。#ai#
支持 100 万上下文的文本检索,可以分析超过 1 小时的视频,支持视频生成和图片生成。

模型介绍:
我们创建了一个包含多样视频和书籍的大型数据集,运用了 RingAttention(环形注意力)技术来高效训练长序列,并逐步将上下文大小从4千扩展至100万个标记。

本文的主要贡献包括:(a) 构建了具有最大上下文大小的神经网络:我们训练了一个在处理长视频和语言序列方面具有前所未有的大上下文规模的 Transformer(变换器),在复杂的检索任务和长视频理解方面设立了新的标准。

(b) 提出了克服视觉-语言训练挑战的多种解决方案,包括使用遮蔽序列打包技术混合不同长度的序列、通过损失加权平衡语言和视觉的重要性,以及为长序列对话创建由模型生成的问答数据集。

(c) 实现了一种高度优化的训练方案,结合了 RingAttention、遮蔽序列打包等关键特性,适用于数百万长度的多模态序列。

(d) 完全开源了一系列拥有70亿参数的模型家族,能够处理长达100万标记以上的长文本文档(LWM-Text, LWM-Text-Chat)和视频(LWM, LWM-Chat)。

这项工作为在大规模的长视频和语言数据集上训练,进而理解人类知识和多模态世界,以及开发更广泛的AI能力铺平了道路。

项目页面:网页链接歸藏的AI工具箱的微博视频
上午看 Sora 的几点收获:

🟣 Sora完全站在了Openai成功产品的肩膀上。

chatGPT背后是个大语言模型,把一个句子拆成若干个token,可能是一个单词、一个词组、一个短句,通过海量数据训练,推测下一个最大概率的token(生成文字)。

Sora模型,同样是把海量视频拆成一个个分块,配合GPT强大的语言能力,给视频分块增加和扩充文字描述。
当海量的训练视频都用这种分块统一拆分学习后,用户输入新指令,就可以从不同的分块里预测和生成新的视频分块,再变成一整条视频。

即:用语言模型 👉🏻 把用户指令扩写和改写 👉🏻 输入视频模型 👉🏻 生成新视频

这相当于人类给了一个作文题,语言模型写一篇描写场景的小作文,Sora再根据这篇作文生成视频,所以细节会比其他 AI 视频产品强太多。

🟣 新世界降临前夕,我们普通人可以做什么?

快刀青衣老师的观点:不管是文生视频、文生图,技术底层关注的是「生」,而我们普通人需要关注的是「文」。

表达有短板、想象力不够,出来的图和视频是没有意境的。
🌅 有文化的你输入“大漠孤烟直,长河落日圆”,没文化的我输入“沙漠上空挂着一个圆太阳”,出来的效果就是卖家秀和买家秀的区别。

保持阅读、在阅读的时候记录下具有画面感的段落、收集经典电影的精彩镜头…… 在技术逐渐平权的时代当下,期待我们每个人都能有“超能力”。
.jpg
393.5 KB
AI探索指南
Meta 发布了一个可以利用 AI 自动剪辑视频的 Agents LAVE。 这玩意再加上 Sora 这样的视频生成模型,一些简单的短视频以及广告视频基本上就不需要人工介入了,大家以后刷的估计都是生成出来的视频了,想要啥有啥。 我下面会简单介绍一下这个剪辑工具的界面组成和 Agents 设计: -----------工具界面及交互(图 1)----------- A 区域主要是输入提示词以及展示 LLM 详细的剪辑逻辑。 B 区域是素材库,你可以鼠标 Hover 后获得 LLM 帮你总结的这段视频的内容,不需要播放查看,…
生成视觉叙述:以每秒一帧的速率对视频帧进行采样。然后使用建立在Vicuna-V1-13B 的LLaMA-V1-13B模型 的fine-tuned检查点LLaVA v1.0对每帧进行标题标注。

检索功能利用向量存储:通过使用OpenAI的text-embedding-ada-002将每个视频的视觉叙述(标题和摘要)进行嵌入。

将视频整合成共同的主题:提供用户视频收藏中主题的摘要。提示包括一个功能指令,然后是画廊视频的视觉叙述。然后将此提示发送到LLM以生成概览,随后在聊天界面中呈现给用户进行审阅。

基于用户的所有视频进行视频编辑创意:提示结构以功能指令开头。如果提供了创意指导,会在提示中包含用户的创意指导,以引导头脑风暴。

根据用户提供的叙述在序列中剪辑视频片段:与以前的功能不同,它只影响时间轴上的视频。与头脑风暴类似,系统会检查用户提供的叙述中是否有任何创意指导。

4️⃣LAVE应用构建:

LAVE系统实现为全栈Web应用程序。前端UI采用React.js开发,而后端服务器采用Flask。对于LLM推理,主要使用OpenAI的最新GPT-4模型。然而,为了将行动计划映射到功能,使用了gpt-4-0613检查点,专门针对函数调用的使用进行了微调。

论文地址:https://arxiv.org/pdf/2402.10294.pdf
FvNz621Wn5SiZy30-CbYIsD88hsJv3.png
346.7 KB
Back to Top