关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
担心自己春节休息两周跟不上AI领域的节奏?听不懂朋友们说的新名词?一篇内容搞定春节期间你落掉的所有AI领域内容。#ai#

AIGC周刊59期更新了看了一下一共一万八千字,相当管饱,我尽量把两周发生的事情都塞进去了。感兴趣可以看看:网页链接

主要内容有:

✦ OpenAI发布了视频生成模型Sora,可以生成1分钟长的高质量视频。Sora支持从图像和文本生成视频,并且可以扩展和编辑视频内容。

✦ 谷歌发布了语言模型Gemini 1.5 Pro和Ultra 1.0,支持长达100万字的上下文理解能力。同时推出了付费会员计划Gemini Advanced。

✦ Stability AI发布基于扩散模型的图片生成模型Stable Cascade,支持图像变化和生成。

✦ 汇总了Midjourney图片生成模型的一些新功能,如默认版本升级和区域编辑能力增强。

✦ 介绍了一些新的AI产品,如视频生成软件Deforum Studio,自动生成UI设计稿的工具Galileo AI,以及英伟达的本地语言模型软件Chat with RTX等。

✦ 收录了一些AI领域的文章,如人工智能如何改变广告业,使用AI进行3D渲染以及Stable Diffusion潜在空间的解释等。
Sora发布当天(2月16号),全网第一个直播讲Sora的,和合伙人西堂、Link羊羊、小石等人连麦,深夜交流Sora到凌晨4点多,经过上百次讲解和完善,输出了一篇保姆级Sora的干货,全部整理到这个小册中,目前持续更新中。 西堂,985硕士,大厂程序员,视频号快速涨粉项目教练,视频号赚了5位数。 小石:材料转码,23应届,AI绘画视频实战家,制作爆款视频,23年星球累计写作50w字 小册共有3个专栏:Sora背景与优势、Sora对各行业的影响、Sora视频提示词。 限时10元,每满千人涨价10元,订阅后从置顶帖进Sora学习交流群,群里随时更新Sora最前沿的讯息。

这两天给大家科普sora和输出
sora干货,没想到很多流言蜚语出现,“割韭菜”这个词多次出现。
服了服了,外面几千块,几万块割韭菜一大把你们不去管,我这白菜价的东西,你过来管我……

举头三尺有神明,人在做天在看,没有人可以一直牛逼的,只有真正坚持利他的人才能一直活下去,我问心无愧,我的小伙伴们也问心无愧!
算法和数据双垄断后,硅基对碳基的游戏,近乎一边倒。
Civitai一直在尝试各种方法增加收入,建立稳定的商业化路径。#ai画图#

新的尝试是给社区成员推荐适合使用SD的电脑硬件配置,然后他们会从对应的购物中收取佣金,目前只有AMD平台的。

如果你有硬件购买的需求也可以参考里面的配置:网页链接
关于Sora,觉得周鸿祎分享的观点讲的很好,尤其是第四点:

大语言模型最牛的是,它不是填空机,而是能完整地理解这个世界的知识。

这次很多人从技术上、从产品体验上分析 Sora,强调它能输出 60 秒视频,保持多镜头的一致性,模拟自然世界和物理规律,实际这些都比较表象,最重要的是 Sora 的技术思路完全不一样,因为这之前我们做视频做图用的都是 Diffusion,你可以把视频看成是多个真实图片的组合,它并没有真正掌握这个世界的知识。现在所有的文生图、文生视频都是在 2D 平面上对图形元素进行操作,并没有适用物理定律。

但 Sora 产生的视频里,它能像人一样理解坦克是有巨大冲击力的,坦克能撞毁汽车,而不会出现汽车撞毁坦克这样的情况。

所以我理解这次 OpenAl 利用它的大语言模型优势,把LLM 和 Diffusion 结合起来训练,让 Sora 实现了对现实世界的理解和对世界的模拟两层能力,

这样产生的视频才是真实的,才能跳出 2D 的范围模拟真实的物理世界。这都是大模型的功劳。
Open AI 摸着谷歌过河,剩下的人摸着 Open AI过河。
有想做AI聊天机器人的可以看看这个组件库,非常全面。#ai##设计#

基本上覆盖了AI可以输出的所有数据形式的展示组建样式。交互形式也挺合理的,基本可以直接拿来用了。也可以给不懂AI的设计师当参考。

设计稿地址:网页链接
ComfyUI官方已经支持了Stable Cascade的使用,试了一下没有感觉效果比SDXL好,可能得等微调了。#ai画图#

下面链接有官方的工作流下载,我的4070Ti一张1024图片的生成时间是7秒,还可以。

部分插件可能会导致Stable Cascade工作流报错,如果报错的话可以暂时把所有插件备份,然后删掉尝试。

使用方式:网页链接
我们至今仍未知道在人才流动性高度通畅的硅谷OpenAI是怎么做到如此断层领先的,要说屯人屯钱屯资源,谷歌脸书亚马逊都不可能比不过它,甚至按照估值来算的话,谷歌一年的利润(注意,还不是收入)就可以买下OpenAI了,但还是挡不住屡次被OpenAI截胡。

目前来看,OpenAI确实是距离AGI最近的那家公司,它的产品泛用性太高了,就像很多精调之后的垂直模型都宣称能在某个细分题库里打败GPT-4,这是事实吗,是的,但这种定向刷分行为没有意义,最后体验下来,还是只有ChatGPT能够全程跟用户说人话。

再比如我依然认为Midjourney的出图艺术性是独一档的,但DALL·E-3很明显训练方向和旨在临摹画师的Midjourney是不一样的,它更遵从文字逻辑,用朴实但准确的绘制反映AI理解的世界图景,所以在生产力上,它不如Midjourney有价值,却很适合搭在ChatGPT里去完善能力,够用就行,而且经济普惠。

Sora还没用上,不过目测也会强在泛用性,两步抽卡的图转视频模式以后的市场会越来越小了——先在出图时抽卡,再去转视频抽卡,容错率太低了——越来越多的AI视频产品也都不接受第三方的图片了,没办法,因为没有介入图片的生产环节,需要重新对图片进行理解再去转化,这条路走歪了。

要么像是Sora这样,直接合并抽卡次数,用文本逻辑一次性生成视频,保持成本足够低,就一定能建立飞轮,要么和Midjourney的尝试方向一样,做封闭式的生态,发挥图片训练的优势去外延视频,而Runway和Pika这样来者不拒的视频工具,确实会压力巨大,很难维持付费规模。

多扯一点,字节跳动直接把抖音的CEO调去管剪映,是真的果断,年度大会上梁茹波刚反省了公司内部的技术讨论直到2023年才有GPT相关议题,没过几天核心产品的一把手就直接去负责一款工具产品,这样的执行效率在大公司里委实不多见,而Sora的王炸反应,又及时的证明了字节跳动还真不是杯弓蛇影,前瞻性拉满了。

2024年,会很精彩。当然了,英伟达也会继续赢麻⋯⋯
AI探索指南
这是构成Sora基础之一的Diffusion Transformer论文作者关于Sora的一些猜测和技术解释。#ai视频#Sora 这个老哥可能是除了这篇论文的另一个作者(现在在Open AI工作)之外最懂Diffusion Transformer的人了,非常值得关注。 有趣的是这篇论文曾经在2023年的计算机视觉会议(CVR2023)上因“缺少创新性”而遭到拒绝,短短一年时间就变成了Sora这怪物模型的理论基础。 -------------正文开始------------- 以下是我对Sora技术…
可扩展性是DiT论文的核心主题。首先,经过优化的DiT在每Flop的实际运行时间上比UNet要快得多。更重要的是,Sora证明了DiT的扩展法则不仅适用于图像,现在也适用于视频——Sora复制了在DiT中观察到的视觉扩展行为。

👀猜测:在Sora报告中,第一个视频的质量相当差,我怀疑它使用的是基础模型尺寸。粗略计算一下:DiT XL/2的GFLOPs是B/2模型的5倍,所以最终16倍计算模型可能是3倍DiT-XL模型的大小,这意味着Sora可能有约3亿参数——如果这是真的,这并非一个不合理的模型大小。这可能意味着,训练Sora模型可能不需要像人们预期的那样多的GPU——我预计未来的迭代速度会非常快。

关键的收获来自于“新兴模拟能力”部分。在Sora出现之前,人们不清楚是否可以自然形成长篇连贯性,或者是否需要复杂的以主题为导向的生成流程,甚至物理模拟器。OpenAI已经证明,尽管不完美,但这些行为可以通过端到端训练来实现。然而,有两个关键点尚未被讨论。

1. 训练数据:关于训练数据的来源和构建完全没有提及,这可能意味着数据很可能是Sora成功的关键因素。

👀猜测:关于来自游戏引擎的数据已有许多猜测。我也预计可能会包括电影、纪录片、电影长镜头等。质量非常重要。我非常好奇Sora从哪里获取这些数据的(肯定不仅仅是YouTube,对吧?)。

2.(自回归的)长视频生成:Sora的一大突破是能够生成非常长的视频。制作2秒视频和1分钟视频之间的差异是巨大的。 在Sora中,这可能是通过联合帧预测实现的,允许自回归采样,但一个主要的挑战是如何解决错误累积,并在时间上保持质量和一致性。是需要一个非常长的(并且是双向的)上下文来进行条件化?还是说仅仅通过扩大规模就可以减少问题?这些技术细节可能非常重要,希望未来能够被逐渐揭示。

扩散变换器(DiT)在Sora中的应用效果非常出色。我们纽约大学的团队最近发布了一款新的DiT模型,名为SiT。它保持了与DiT完全相同的架构,但在性能上有所提升,收敛速度更快。我对它在视频生成方面的表现也非常感兴趣!

DiT论文地址:网页链接
这是构成Sora基础之一的Diffusion Transformer论文作者关于Sora的一些猜测和技术解释。#ai视频#Sora
这个老哥可能是除了这篇论文的另一个作者(现在在Open AI工作)之外最懂Diffusion Transformer的人了,非常值得关注。

有趣的是这篇论文曾经在2023年的计算机视觉会议(CVR2023)上因“缺少创新性”而遭到拒绝,短短一年时间就变成了Sora这怪物模型的理论基础。

-------------正文开始-------------

以下是我对Sora技术报告的解读,其中包含了一些可能并不准确的猜测。首先,我非常感谢团队分享了极为有价值的见解和设计决策——Sora确实令人惊叹,它将彻底改变视频生成领域。

我们目前所了解到的情况如下:

架构:Sora基于我们的扩散变换器(Diffusion Transformer,简称DiT)模型构建,该模型已发表在2023年国际计算机视觉会议(ICCV 2023)上。简单来说,它是一个结合了变换器(Transformer)主干的扩散模型: DiT = [变分自编码器(VAE)编码器 + 视觉变换器(ViT)+ 去噪扩散概率模型(DDPM)+ VAE解码器]。 根据报告,这个模型似乎没有太多额外的复杂设计。

“视频压缩网络”:这看起来就像是一个在原始视频数据上训练的变分自编码器(VAE)。在实现良好的时间一致性方面,标记化(Tokenization)可能扮演着关键角色。顺便提一下,VAE本质上是一个卷积网络,所以从技术上说,DiT实际上是一个混合模型。 ;)

当Bill和我参与DiT项目时,我们并未专注于创新(详见我之前的推特🤷♂️),而是将重点放在了两个方面:简洁性和可扩展性。这些优先事项带来的不仅仅是概念上的优势。

简洁性代表着灵活性。关于标准的视觉变换器(ViT),人们常忽视的一个亮点是,它让模型在处理输入数据时变得更加灵活。例如,在遮蔽自编码器(MAE)中,ViT帮助我们只处理可见的区块,忽略被遮蔽的部分。同样,Sora可以通过在适当大小的网格中排列随机初始化的区块来控制生成视频的尺寸。而UNet并不直接提供这种灵活性。

👀猜测:Sora可能还使用了Google的Patch n’ Pack(NaViT)技术,使DiT能够适应不同的分辨率、持续时间和长宽比。
突然发现Midjourney的alpha网站已经更新了局部重绘和更改图片比例的功能,交互还非常舒服。#ai画图#

这下网站终于可以完全替代Discord了。我现在90的画图工作已经都在网站上了。 歸藏的AI工具箱的微博视频
关于 Sora 的十个赚钱方法:

1、售卖Sora账号或邀请码:利用Sora的早期访问限制,通过售卖账号或邀请码来获利。

2、售卖高质量的视频生成提示(prompt):在专门的平台上出售精心设计的prompt,帮助用户生成更好的视频。

3、制作/代生成AI视频:为那些不愿意自己操作AI工具的用户代生成视频,或者为有定制需求的用户提供服务。

4、使用Sora生成视频做自媒体:利用Sora生成的视频内容,发布到自媒体平台如抖音、快手等,吸引流量和粉丝。

5、上传Sora生成的视频到素材网站:将生成的视频上传到素材交易网站,通过销售视频素材获利。

6、知识付费,制作Sora使用教程:制作关于Sora的教程或课程,通过知识付费方式赚钱。

7、围绕Sora的电商生意:在电商平台上销售与Sora相关的工具、教程或课程,利用精准用户群体。

8、开发Sora相关的网站或工具:对于有技术背景的人,可以开发与Sora相关的网站或工具,如导航网站或AI写真工具。

9、AI小说推文:利用Sora生成视频内容,用于AI小说推文,可能会成为新的盈利点。

10、直播带货推广Sora相关产品:通过直播方式推广Sora或其他相关付费产品,帮助他人销售并从中获利。

这些机会涵盖了从直接销售账号、提供生成服务、内容创作、知识分享到电商平台销售等多个方面,为不同背景和技能的人提供了多样化的盈利途径。
Back to Top