关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
Open AI 摸着谷歌过河,剩下的人摸着 Open AI过河。
有想做AI聊天机器人的可以看看这个组件库,非常全面。#ai##设计#

基本上覆盖了AI可以输出的所有数据形式的展示组建样式。交互形式也挺合理的,基本可以直接拿来用了。也可以给不懂AI的设计师当参考。

设计稿地址:网页链接
ComfyUI官方已经支持了Stable Cascade的使用,试了一下没有感觉效果比SDXL好,可能得等微调了。#ai画图#

下面链接有官方的工作流下载,我的4070Ti一张1024图片的生成时间是7秒,还可以。

部分插件可能会导致Stable Cascade工作流报错,如果报错的话可以暂时把所有插件备份,然后删掉尝试。

使用方式:网页链接
我们至今仍未知道在人才流动性高度通畅的硅谷OpenAI是怎么做到如此断层领先的,要说屯人屯钱屯资源,谷歌脸书亚马逊都不可能比不过它,甚至按照估值来算的话,谷歌一年的利润(注意,还不是收入)就可以买下OpenAI了,但还是挡不住屡次被OpenAI截胡。

目前来看,OpenAI确实是距离AGI最近的那家公司,它的产品泛用性太高了,就像很多精调之后的垂直模型都宣称能在某个细分题库里打败GPT-4,这是事实吗,是的,但这种定向刷分行为没有意义,最后体验下来,还是只有ChatGPT能够全程跟用户说人话。

再比如我依然认为Midjourney的出图艺术性是独一档的,但DALL·E-3很明显训练方向和旨在临摹画师的Midjourney是不一样的,它更遵从文字逻辑,用朴实但准确的绘制反映AI理解的世界图景,所以在生产力上,它不如Midjourney有价值,却很适合搭在ChatGPT里去完善能力,够用就行,而且经济普惠。

Sora还没用上,不过目测也会强在泛用性,两步抽卡的图转视频模式以后的市场会越来越小了——先在出图时抽卡,再去转视频抽卡,容错率太低了——越来越多的AI视频产品也都不接受第三方的图片了,没办法,因为没有介入图片的生产环节,需要重新对图片进行理解再去转化,这条路走歪了。

要么像是Sora这样,直接合并抽卡次数,用文本逻辑一次性生成视频,保持成本足够低,就一定能建立飞轮,要么和Midjourney的尝试方向一样,做封闭式的生态,发挥图片训练的优势去外延视频,而Runway和Pika这样来者不拒的视频工具,确实会压力巨大,很难维持付费规模。

多扯一点,字节跳动直接把抖音的CEO调去管剪映,是真的果断,年度大会上梁茹波刚反省了公司内部的技术讨论直到2023年才有GPT相关议题,没过几天核心产品的一把手就直接去负责一款工具产品,这样的执行效率在大公司里委实不多见,而Sora的王炸反应,又及时的证明了字节跳动还真不是杯弓蛇影,前瞻性拉满了。

2024年,会很精彩。当然了,英伟达也会继续赢麻⋯⋯
AI探索指南
这是构成Sora基础之一的Diffusion Transformer论文作者关于Sora的一些猜测和技术解释。#ai视频#Sora 这个老哥可能是除了这篇论文的另一个作者(现在在Open AI工作)之外最懂Diffusion Transformer的人了,非常值得关注。 有趣的是这篇论文曾经在2023年的计算机视觉会议(CVR2023)上因“缺少创新性”而遭到拒绝,短短一年时间就变成了Sora这怪物模型的理论基础。 -------------正文开始------------- 以下是我对Sora技术…
可扩展性是DiT论文的核心主题。首先,经过优化的DiT在每Flop的实际运行时间上比UNet要快得多。更重要的是,Sora证明了DiT的扩展法则不仅适用于图像,现在也适用于视频——Sora复制了在DiT中观察到的视觉扩展行为。

👀猜测:在Sora报告中,第一个视频的质量相当差,我怀疑它使用的是基础模型尺寸。粗略计算一下:DiT XL/2的GFLOPs是B/2模型的5倍,所以最终16倍计算模型可能是3倍DiT-XL模型的大小,这意味着Sora可能有约3亿参数——如果这是真的,这并非一个不合理的模型大小。这可能意味着,训练Sora模型可能不需要像人们预期的那样多的GPU——我预计未来的迭代速度会非常快。

关键的收获来自于“新兴模拟能力”部分。在Sora出现之前,人们不清楚是否可以自然形成长篇连贯性,或者是否需要复杂的以主题为导向的生成流程,甚至物理模拟器。OpenAI已经证明,尽管不完美,但这些行为可以通过端到端训练来实现。然而,有两个关键点尚未被讨论。

1. 训练数据:关于训练数据的来源和构建完全没有提及,这可能意味着数据很可能是Sora成功的关键因素。

👀猜测:关于来自游戏引擎的数据已有许多猜测。我也预计可能会包括电影、纪录片、电影长镜头等。质量非常重要。我非常好奇Sora从哪里获取这些数据的(肯定不仅仅是YouTube,对吧?)。

2.(自回归的)长视频生成:Sora的一大突破是能够生成非常长的视频。制作2秒视频和1分钟视频之间的差异是巨大的。 在Sora中,这可能是通过联合帧预测实现的,允许自回归采样,但一个主要的挑战是如何解决错误累积,并在时间上保持质量和一致性。是需要一个非常长的(并且是双向的)上下文来进行条件化?还是说仅仅通过扩大规模就可以减少问题?这些技术细节可能非常重要,希望未来能够被逐渐揭示。

扩散变换器(DiT)在Sora中的应用效果非常出色。我们纽约大学的团队最近发布了一款新的DiT模型,名为SiT。它保持了与DiT完全相同的架构,但在性能上有所提升,收敛速度更快。我对它在视频生成方面的表现也非常感兴趣!

DiT论文地址:网页链接
这是构成Sora基础之一的Diffusion Transformer论文作者关于Sora的一些猜测和技术解释。#ai视频#Sora
这个老哥可能是除了这篇论文的另一个作者(现在在Open AI工作)之外最懂Diffusion Transformer的人了,非常值得关注。

有趣的是这篇论文曾经在2023年的计算机视觉会议(CVR2023)上因“缺少创新性”而遭到拒绝,短短一年时间就变成了Sora这怪物模型的理论基础。

-------------正文开始-------------

以下是我对Sora技术报告的解读,其中包含了一些可能并不准确的猜测。首先,我非常感谢团队分享了极为有价值的见解和设计决策——Sora确实令人惊叹,它将彻底改变视频生成领域。

我们目前所了解到的情况如下:

架构:Sora基于我们的扩散变换器(Diffusion Transformer,简称DiT)模型构建,该模型已发表在2023年国际计算机视觉会议(ICCV 2023)上。简单来说,它是一个结合了变换器(Transformer)主干的扩散模型: DiT = [变分自编码器(VAE)编码器 + 视觉变换器(ViT)+ 去噪扩散概率模型(DDPM)+ VAE解码器]。 根据报告,这个模型似乎没有太多额外的复杂设计。

“视频压缩网络”:这看起来就像是一个在原始视频数据上训练的变分自编码器(VAE)。在实现良好的时间一致性方面,标记化(Tokenization)可能扮演着关键角色。顺便提一下,VAE本质上是一个卷积网络,所以从技术上说,DiT实际上是一个混合模型。 ;)

当Bill和我参与DiT项目时,我们并未专注于创新(详见我之前的推特🤷♂️),而是将重点放在了两个方面:简洁性和可扩展性。这些优先事项带来的不仅仅是概念上的优势。

简洁性代表着灵活性。关于标准的视觉变换器(ViT),人们常忽视的一个亮点是,它让模型在处理输入数据时变得更加灵活。例如,在遮蔽自编码器(MAE)中,ViT帮助我们只处理可见的区块,忽略被遮蔽的部分。同样,Sora可以通过在适当大小的网格中排列随机初始化的区块来控制生成视频的尺寸。而UNet并不直接提供这种灵活性。

👀猜测:Sora可能还使用了Google的Patch n’ Pack(NaViT)技术,使DiT能够适应不同的分辨率、持续时间和长宽比。
突然发现Midjourney的alpha网站已经更新了局部重绘和更改图片比例的功能,交互还非常舒服。#ai画图#

这下网站终于可以完全替代Discord了。我现在90的画图工作已经都在网站上了。 歸藏的AI工具箱的微博视频
关于 Sora 的十个赚钱方法:

1、售卖Sora账号或邀请码:利用Sora的早期访问限制,通过售卖账号或邀请码来获利。

2、售卖高质量的视频生成提示(prompt):在专门的平台上出售精心设计的prompt,帮助用户生成更好的视频。

3、制作/代生成AI视频:为那些不愿意自己操作AI工具的用户代生成视频,或者为有定制需求的用户提供服务。

4、使用Sora生成视频做自媒体:利用Sora生成的视频内容,发布到自媒体平台如抖音、快手等,吸引流量和粉丝。

5、上传Sora生成的视频到素材网站:将生成的视频上传到素材交易网站,通过销售视频素材获利。

6、知识付费,制作Sora使用教程:制作关于Sora的教程或课程,通过知识付费方式赚钱。

7、围绕Sora的电商生意:在电商平台上销售与Sora相关的工具、教程或课程,利用精准用户群体。

8、开发Sora相关的网站或工具:对于有技术背景的人,可以开发与Sora相关的网站或工具,如导航网站或AI写真工具。

9、AI小说推文:利用Sora生成视频内容,用于AI小说推文,可能会成为新的盈利点。

10、直播带货推广Sora相关产品:通过直播方式推广Sora或其他相关付费产品,帮助他人销售并从中获利。

这些机会涵盖了从直接销售账号、提供生成服务、内容创作、知识分享到电商平台销售等多个方面,为不同背景和技能的人提供了多样化的盈利途径。
最近各大机构的13F陆续公布,大家发现其实机构截止2023年底并没有重仓英伟达,我知道不少机构在400多卖了英伟达,在年初大家普遍观点是:1)英伟达需求很快见顶,25年可能DC业务不怎么增长;2)很快推理代替训练成为算力大头,而推理上可能被MI300,TPU等替代。

如果认为AI可能是人类历史上最重要的科技革命之一,那么认为这一科技革命最重要的基石NVDA在第三年就停止增长我认为是不太合理的;

如果NVDA在过去十几年的AI革命都保持了龙头的地位,那么认为这样的龙头很快就会被颠覆也是不太合理的;

历史上每一次科技创新都在美股产生了泡沫,而我认为生成式AI有可能成为人类历史上最大的科技泡沫。因为1)和还要解释用途的web3,metaverse不同,只要受过教育的人都能想象AI的100个用途;2)每个行业都可以想象自己被AI颠覆或大幅度改善;3)以前每次科技革命都是在人类使用的工具上创新,而AI有可能是第一次在工具的使用者上创新;4)无数公司和政府都无法承担万一错过AI革命的后果。

但我仍然认为AI的应用落地会大大低于现在大家的乐观预期,和互联网应用不一样,AI应用需要超过一定的阈值才能真正产生价值,我们肯定会迎来泡沫的破灭时刻(参见自动驾驶)。但是在那之前,我认为AI的泡沫之巅大概率会出现在第一波native AI应用上市的时候(参照第一波互联网native 应用如Netscape,Amazon,Yahoo!,Google上市之后)。

如果你在互联网泡沫巅峰买入思科,那么在25年后的今天,算上所有分红,依然亏损20%(21年短暂回本)。当时的思科ev/sales是31X,p/fcf是176X。这一方面说明买在泡沫之巅是非常危险的,但另一方面也说明要对泡沫的程度和持续时间有充分的想象力。
Open AI 公布了一个 Open AI论坛,参与者可以参加 open AI 组织的线上和线下活动并且同 Open AI 员工深入交流,更有机会可以提前测试一些相关功能(Sora?)。#ai#

加入条件:

展示出对申请者专业领域和AI交叉领域的浓厚兴趣。

有能力在每个财政季度中投入1小时的时间参与活动。

在你的专业领域或学术学科中展示出专业知识。

这里申请:网页链接
看关于Sora 乱七八糟所谓科普和解读(包括我发的)都不如仔仔细细的再看一遍技术报告和项目页面,包括所有演示视频的表现。#ai#
Back to Top