关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
我们至今仍未知道在人才流动性高度通畅的硅谷OpenAI是怎么做到如此断层领先的,要说屯人屯钱屯资源,谷歌脸书亚马逊都不可能比不过它,甚至按照估值来算的话,谷歌一年的利润(注意,还不是收入)就可以买下OpenAI了,但还是挡不住屡次被OpenAI截胡。

目前来看,OpenAI确实是距离AGI最近的那家公司,它的产品泛用性太高了,就像很多精调之后的垂直模型都宣称能在某个细分题库里打败GPT-4,这是事实吗,是的,但这种定向刷分行为没有意义,最后体验下来,还是只有ChatGPT能够全程跟用户说人话。

再比如我依然认为Midjourney的出图艺术性是独一档的,但DALL·E-3很明显训练方向和旨在临摹画师的Midjourney是不一样的,它更遵从文字逻辑,用朴实但准确的绘制反映AI理解的世界图景,所以在生产力上,它不如Midjourney有价值,却很适合搭在ChatGPT里去完善能力,够用就行,而且经济普惠。

Sora还没用上,不过目测也会强在泛用性,两步抽卡的图转视频模式以后的市场会越来越小了——先在出图时抽卡,再去转视频抽卡,容错率太低了——越来越多的AI视频产品也都不接受第三方的图片了,没办法,因为没有介入图片的生产环节,需要重新对图片进行理解再去转化,这条路走歪了。

要么像是Sora这样,直接合并抽卡次数,用文本逻辑一次性生成视频,保持成本足够低,就一定能建立飞轮,要么和Midjourney的尝试方向一样,做封闭式的生态,发挥图片训练的优势去外延视频,而Runway和Pika这样来者不拒的视频工具,确实会压力巨大,很难维持付费规模。

多扯一点,字节跳动直接把抖音的CEO调去管剪映,是真的果断,年度大会上梁茹波刚反省了公司内部的技术讨论直到2023年才有GPT相关议题,没过几天核心产品的一把手就直接去负责一款工具产品,这样的执行效率在大公司里委实不多见,而Sora的王炸反应,又及时的证明了字节跳动还真不是杯弓蛇影,前瞻性拉满了。

2024年,会很精彩。当然了,英伟达也会继续赢麻⋯⋯
AI探索指南
这是构成Sora基础之一的Diffusion Transformer论文作者关于Sora的一些猜测和技术解释。#ai视频#Sora 这个老哥可能是除了这篇论文的另一个作者(现在在Open AI工作)之外最懂Diffusion Transformer的人了,非常值得关注。 有趣的是这篇论文曾经在2023年的计算机视觉会议(CVR2023)上因“缺少创新性”而遭到拒绝,短短一年时间就变成了Sora这怪物模型的理论基础。 -------------正文开始------------- 以下是我对Sora技术…
可扩展性是DiT论文的核心主题。首先,经过优化的DiT在每Flop的实际运行时间上比UNet要快得多。更重要的是,Sora证明了DiT的扩展法则不仅适用于图像,现在也适用于视频——Sora复制了在DiT中观察到的视觉扩展行为。

👀猜测:在Sora报告中,第一个视频的质量相当差,我怀疑它使用的是基础模型尺寸。粗略计算一下:DiT XL/2的GFLOPs是B/2模型的5倍,所以最终16倍计算模型可能是3倍DiT-XL模型的大小,这意味着Sora可能有约3亿参数——如果这是真的,这并非一个不合理的模型大小。这可能意味着,训练Sora模型可能不需要像人们预期的那样多的GPU——我预计未来的迭代速度会非常快。

关键的收获来自于“新兴模拟能力”部分。在Sora出现之前,人们不清楚是否可以自然形成长篇连贯性,或者是否需要复杂的以主题为导向的生成流程,甚至物理模拟器。OpenAI已经证明,尽管不完美,但这些行为可以通过端到端训练来实现。然而,有两个关键点尚未被讨论。

1. 训练数据:关于训练数据的来源和构建完全没有提及,这可能意味着数据很可能是Sora成功的关键因素。

👀猜测:关于来自游戏引擎的数据已有许多猜测。我也预计可能会包括电影、纪录片、电影长镜头等。质量非常重要。我非常好奇Sora从哪里获取这些数据的(肯定不仅仅是YouTube,对吧?)。

2.(自回归的)长视频生成:Sora的一大突破是能够生成非常长的视频。制作2秒视频和1分钟视频之间的差异是巨大的。 在Sora中,这可能是通过联合帧预测实现的,允许自回归采样,但一个主要的挑战是如何解决错误累积,并在时间上保持质量和一致性。是需要一个非常长的(并且是双向的)上下文来进行条件化?还是说仅仅通过扩大规模就可以减少问题?这些技术细节可能非常重要,希望未来能够被逐渐揭示。

扩散变换器(DiT)在Sora中的应用效果非常出色。我们纽约大学的团队最近发布了一款新的DiT模型,名为SiT。它保持了与DiT完全相同的架构,但在性能上有所提升,收敛速度更快。我对它在视频生成方面的表现也非常感兴趣!

DiT论文地址:网页链接
这是构成Sora基础之一的Diffusion Transformer论文作者关于Sora的一些猜测和技术解释。#ai视频#Sora
这个老哥可能是除了这篇论文的另一个作者(现在在Open AI工作)之外最懂Diffusion Transformer的人了,非常值得关注。

有趣的是这篇论文曾经在2023年的计算机视觉会议(CVR2023)上因“缺少创新性”而遭到拒绝,短短一年时间就变成了Sora这怪物模型的理论基础。

-------------正文开始-------------

以下是我对Sora技术报告的解读,其中包含了一些可能并不准确的猜测。首先,我非常感谢团队分享了极为有价值的见解和设计决策——Sora确实令人惊叹,它将彻底改变视频生成领域。

我们目前所了解到的情况如下:

架构:Sora基于我们的扩散变换器(Diffusion Transformer,简称DiT)模型构建,该模型已发表在2023年国际计算机视觉会议(ICCV 2023)上。简单来说,它是一个结合了变换器(Transformer)主干的扩散模型: DiT = [变分自编码器(VAE)编码器 + 视觉变换器(ViT)+ 去噪扩散概率模型(DDPM)+ VAE解码器]。 根据报告,这个模型似乎没有太多额外的复杂设计。

“视频压缩网络”:这看起来就像是一个在原始视频数据上训练的变分自编码器(VAE)。在实现良好的时间一致性方面,标记化(Tokenization)可能扮演着关键角色。顺便提一下,VAE本质上是一个卷积网络,所以从技术上说,DiT实际上是一个混合模型。 ;)

当Bill和我参与DiT项目时,我们并未专注于创新(详见我之前的推特🤷♂️),而是将重点放在了两个方面:简洁性和可扩展性。这些优先事项带来的不仅仅是概念上的优势。

简洁性代表着灵活性。关于标准的视觉变换器(ViT),人们常忽视的一个亮点是,它让模型在处理输入数据时变得更加灵活。例如,在遮蔽自编码器(MAE)中,ViT帮助我们只处理可见的区块,忽略被遮蔽的部分。同样,Sora可以通过在适当大小的网格中排列随机初始化的区块来控制生成视频的尺寸。而UNet并不直接提供这种灵活性。

👀猜测:Sora可能还使用了Google的Patch n’ Pack(NaViT)技术,使DiT能够适应不同的分辨率、持续时间和长宽比。
突然发现Midjourney的alpha网站已经更新了局部重绘和更改图片比例的功能,交互还非常舒服。#ai画图#

这下网站终于可以完全替代Discord了。我现在90的画图工作已经都在网站上了。 歸藏的AI工具箱的微博视频
关于 Sora 的十个赚钱方法:

1、售卖Sora账号或邀请码:利用Sora的早期访问限制,通过售卖账号或邀请码来获利。

2、售卖高质量的视频生成提示(prompt):在专门的平台上出售精心设计的prompt,帮助用户生成更好的视频。

3、制作/代生成AI视频:为那些不愿意自己操作AI工具的用户代生成视频,或者为有定制需求的用户提供服务。

4、使用Sora生成视频做自媒体:利用Sora生成的视频内容,发布到自媒体平台如抖音、快手等,吸引流量和粉丝。

5、上传Sora生成的视频到素材网站:将生成的视频上传到素材交易网站,通过销售视频素材获利。

6、知识付费,制作Sora使用教程:制作关于Sora的教程或课程,通过知识付费方式赚钱。

7、围绕Sora的电商生意:在电商平台上销售与Sora相关的工具、教程或课程,利用精准用户群体。

8、开发Sora相关的网站或工具:对于有技术背景的人,可以开发与Sora相关的网站或工具,如导航网站或AI写真工具。

9、AI小说推文:利用Sora生成视频内容,用于AI小说推文,可能会成为新的盈利点。

10、直播带货推广Sora相关产品:通过直播方式推广Sora或其他相关付费产品,帮助他人销售并从中获利。

这些机会涵盖了从直接销售账号、提供生成服务、内容创作、知识分享到电商平台销售等多个方面,为不同背景和技能的人提供了多样化的盈利途径。
最近各大机构的13F陆续公布,大家发现其实机构截止2023年底并没有重仓英伟达,我知道不少机构在400多卖了英伟达,在年初大家普遍观点是:1)英伟达需求很快见顶,25年可能DC业务不怎么增长;2)很快推理代替训练成为算力大头,而推理上可能被MI300,TPU等替代。

如果认为AI可能是人类历史上最重要的科技革命之一,那么认为这一科技革命最重要的基石NVDA在第三年就停止增长我认为是不太合理的;

如果NVDA在过去十几年的AI革命都保持了龙头的地位,那么认为这样的龙头很快就会被颠覆也是不太合理的;

历史上每一次科技创新都在美股产生了泡沫,而我认为生成式AI有可能成为人类历史上最大的科技泡沫。因为1)和还要解释用途的web3,metaverse不同,只要受过教育的人都能想象AI的100个用途;2)每个行业都可以想象自己被AI颠覆或大幅度改善;3)以前每次科技革命都是在人类使用的工具上创新,而AI有可能是第一次在工具的使用者上创新;4)无数公司和政府都无法承担万一错过AI革命的后果。

但我仍然认为AI的应用落地会大大低于现在大家的乐观预期,和互联网应用不一样,AI应用需要超过一定的阈值才能真正产生价值,我们肯定会迎来泡沫的破灭时刻(参见自动驾驶)。但是在那之前,我认为AI的泡沫之巅大概率会出现在第一波native AI应用上市的时候(参照第一波互联网native 应用如Netscape,Amazon,Yahoo!,Google上市之后)。

如果你在互联网泡沫巅峰买入思科,那么在25年后的今天,算上所有分红,依然亏损20%(21年短暂回本)。当时的思科ev/sales是31X,p/fcf是176X。这一方面说明买在泡沫之巅是非常危险的,但另一方面也说明要对泡沫的程度和持续时间有充分的想象力。
Open AI 公布了一个 Open AI论坛,参与者可以参加 open AI 组织的线上和线下活动并且同 Open AI 员工深入交流,更有机会可以提前测试一些相关功能(Sora?)。#ai#

加入条件:

展示出对申请者专业领域和AI交叉领域的浓厚兴趣。

有能力在每个财政季度中投入1小时的时间参与活动。

在你的专业领域或学术学科中展示出专业知识。

这里申请:网页链接
看关于Sora 乱七八糟所谓科普和解读(包括我发的)都不如仔仔细细的再看一遍技术报告和项目页面,包括所有演示视频的表现。#ai#
Sora 的图片生成能力也非常牛皮。#ai##sora#
早上拿手机看还没发现,在写实照片生成上的美学表现和细节已经比 Midjourney V6 要强了,这模型真的离谱。
注意看人脸的绒毛和皱纹。

Invalid media: image
LangChain 的 LLM 应用开发平台LangSmith正式开放给了所有人使用,同时宣布获得了Sequoia 领投的 A 轮融资。#ai#

LangSmith 是一个统一的 DevOps 平台,用于开发、协作、测试、部署和监控LLM应用程序。

新的品牌形象和网站搞得也很不错,这里尝试:网页链接
《Sora爆火,普通人的10个赚钱机会。》
去年我们都知道是ai绘图的爆发年,mj和sd在国内爆火。
如果你没有赶上,那么ai视频这波可以快速切入。
那么对于普通人来说,这波sora的ai视频有哪些赚钱的机会可以早点切入呢?
1、售卖Sora账号或者邀请码
做过ai相关生意的朋友都知道,第一波最大的流量就是用上工具。
无论是ai绘图还是ai视频工具,你得先用上了才能考虑其他事情。
而且ai视频的生成成本很明显是不低的。
所以第一波好生意一定是在账号的交易上。
甚至早期不一定直接开放,而是需要邀请码。
2、售卖高质量的视频生成prompt
prompt对于接触过ai的人来说应该都不陌生。
一个好的prompt还是非常容易在一些prompt交易平台上售出的。
之前的ai绘画就有类似的交易平台,比如promptbase、prompthero。
上传你的咒语到平台,填写价格等信息即可。
3、制作/代生成ai视频
这个分两种用户。一种是尝鲜的用户,可能并不想自己去注册、研究ai视频,所以可以帮忙代生成。
另一种则是有定制化需求的用户,需要使用类似Sora这样的工具来生成ai视频素材。
当然,这个就依赖于你能否剪辑出一些具有独特风格的短视频内容,在社交平台吸引你的意向客户。
4、使用Sora生成的视频,做个人的自媒体账号
如果你是一个短视频,或者自媒体从业者。
那么你可以优先考虑,直接用sora生成短视频,然后发布到你的自媒体账号上。
国内的平台,比如抖音、快手、视频号、小红书、b站。
这些都是流量比较好的平台。
尤其是像小红书、视频号这样不那么内卷的平台。
比如今天我们有些朋友就已经开始用一些能找到的sora素材,开始发到视频号上,流量都还不错。
当然,长期来看,如果你想靠自媒体的流量进行转化变现,还是和上一条一样,需要形成自己独特的ai视频风格。
比如去年爆火的几类ai视频风格有复活ai名人进行访谈、宠物视频、二次元动漫混剪、电影混剪等等。
名人、宠物、大ip都是好的创作方向。
5、上传Sora生成的视频到各大素材网站赚钱。
国内类似的短视频素材交易网站也有很多。
当然,这类的赚钱方式相对来说比较短,平台不可能任由用户上传大量的ai短视频来薅羊毛的。
所以,这类方式的行动要快。
6、知识付费,制作Sora相关的使用教程
过去一年里,ai领域最经典的好生意就是知识付费,卖课、卖社群。
无论你是写一篇sora的文章,还是一系列的教程,或者一系列的课程视频。
这些都是比较好的知识付费产品。
光是今天一天,就出了好几篇sora相关的爆文,有大几百万的人对sora感兴趣。

所以,关于sora的知识付费教程,后续是肯定不会缺少用户买单的。
7、做电商,围绕sora相关的搜索词做生意。
很多人容易遗漏掉电商平台用户的精准性。
无论是主流的电商平台,比如某宝、某东、某多多。
还是类似某鱼、某转这样的平台,ai相关的精准付费用户是很多的。
所以,任何一个ai相关的需求出现,这些电商平台上就会出现好生意。
这些平台上无论是卖工具、卖教程还是卖课程,都非常多。
所以,盯紧电商平台关于sora的关键词,准没有错。
8、做套壳的sora网站、工具等产品。
这个对于普通人来说门槛有点高,但还是挺适合一些程序猿、产品经理等互联网从业者的。
比如去年ai绘图爆火后,做的比较好的ai绘图产品、导航网站。
还有类似妙鸭这种ai写真工具,都吃到了比较大的红利。
9、用sora做ai小说推文
如果说去年的ai小说推文还是集中在ai图片领域,那么今年,ai小说推文很可能直接跨越到ai视频。
去年这块爆款很多,赚到钱的也有,但是实际上做过的人都知道花费的精力不少,今年这块很可能还会爆发一次。
10、直播带货,帮忙推广sora相关的付费产品
对于没有产品制作能力的朋友,其实可以考虑通过直播进行售卖。
核心就在于,短视频的生成天然吸引用户的注意力。
比如去年很多runway的介绍直播间,流量都很高,但是因为不具备实际的应用场景,所以付费率不高,但是sora很明显更加成熟。
所以,如果你没有做产品的能力,可以考虑帮助别人推广。
无论如何,我们都知道一件事,这是短视频从业者最坏的年代,也是最好的年代
1分钟语音即可训练一个自己的TTS模型:GPT-SoVITS!

根据演示来看,它似乎是目前中文支持比较好的模型

试了试,只要 5 秒的数据,它就可以模仿我的声音,更牛的是,一分钟的录音就能训练出高质量的模型,完美克隆声音 YYDS!

项目地址:https://t.co/xB8R12bQTz GitHub - RVC-Boss/GPT-SoVITS: 1 min voice data can also be used to train a good TTS model! (few shot voice cloning)
周鸿炜一语道破sora的本质,AGI即将来临
IMG_2529.JPG
1.4 MB
振聋发聩。

1、对普通人来讲,比起先进AI工具,我们更缺创作动机和内容:

“在AI绘画领域内,我已经经历过这一切:所有人都可以用AI来绘画,但是紧接下来的问题和工具无关,和技术无关,而是那个古老的问题---【应该画什么?】

很多普通人浅尝辄止,在新鲜感过去之后,很快就停止了尝试。

为什么?因为他们并没有什么是需要图画来表达的,画小猫画小狗画风景画侍女,结束了。不要说普通人能够成为画师,就算是像我这样给自己的文章每天配图都做不到,更别说经年累月地持续用AI绘画。

现在AI绘画的工具还少吗?支持的风格、类型还有什么空白吗?普通人用吗?

视频AI来了,我认为问题也是同样的。”

2、出作品才是硬道理

“最好不要到了明年(2024年)4月1日,你对所有的AI工具如数家珍,对于所有的创始人个人经历都信口拈来。

但是你没有用这些AI工具做出任何一款个人作品,满足于自己知道的最多,自己知道的最新。这些都是虚幻的感觉。”

3、从最终结果来看,尝鲜者没啥好骄傲的

“在人群中愿意最先接触和尝试新鲜事物的人从来都很少,可能不超过人群总数的5%。

这样的人对于这个社会,对于这个世界,乃至于对于全人类都很宝贵。因为他们是先行者,经由他们的尝试,他们的反馈,他们的传播,使得一样新鲜事物可以进入人类社会,进而改变人们的生活。

但是通过观察可知,这样的人往往在创新大规模传播,转变为生产力或者产品的时候掉队,寂然无声。

靠着创新做出成绩,赚到钱,出了名,上了市的人,往往不是这些先行者,而是一开始看起来反应迟钝的土鳖,他们姗姗来迟,但是一刀下去就切走了最大的一块蛋糕。

【先行者通常都是先烈,这是中国互联网著名的段子。】”
Fhx3oGqWfKM2JgnPce5X2Ud6PG-Uv3.png
2.9 MB
Back to Top