关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
Jim Fan 详细介绍了一下 Sora 的实现原理,这不仅仅是一个视频生成模型这么简单,还是一个基于数据驱动的虚幻 5 引擎。#ai视频#

如果你以为OpenAI Sora只是一个像DALLE这样的创意小玩具,那你可要重新认识一下了。Sora实际上是一个基于数据驱动的物理引擎,能够模拟各种真实或奇幻的世界。这款模拟器能学会复杂的渲染技术、直观的物理规律、长期的逻辑推理以及语义理解,而这一切都是通过先进的去噪技术和梯度计算实现的。

我甚至猜测,Sora可能是通过使用Unreal Engine 5生成的大量合成数据来进行训练的。这听起来非常有可能!

下面我们来详细分析一段视频。这段视频的提示是:“一杯咖啡里,两艘海盗船相互战斗的逼真特写视频。”

•视频中,模拟器创建了两艘装饰各异的精美海盗船的3D模型。Sora需要在其庞大的数据空间中隐式地完成从文本到3D模型的转换。
•这些3D模型的海盗船在航行中能够自然地动起来,它们在避开对方的同时,动作流畅协调。
•还有咖啡的流体动力学表现,包括船只周围形成的泡沫。流体模拟本身就是计算机图形学中一个复杂的分支,通常需要复杂的算法和方程式来实现。
•视频的光影效果逼真,几乎可以媲美光线追踪技术的渲染效果。
•模拟器还考虑到了杯子与海洋相比较小的尺寸,并运用了移轴摄影技术(Tilt-shift photography),为整个场景增添了一种微观世界的感觉。
•虽然视频中的场景在现实世界里找不到对应,但模拟器还是根据我们的期望,准确实现了物理规则。

接下来的步骤是:引入更多的模态和条件变量,我们就可以得到一个全面的、基于数据驱动的Unreal Engine。它将有望替代所有现有的手工设计图形处理流程。 歸藏的AI工具箱的微博视频
震撼🫨!牛逼!OpenAI 发布了 Sora,一种文字生成视频的技术,从演示看,效果还是相当不错的。

Sora 的强大之处在于其能够根据文本描述,生成长达 60 秒的视频,其中包含精细复杂的场景、生动的角色表情以及复杂的镜头运动。

目前,Sora已对网络安全的红队成员开放,以评估其可能存在的风险或潜在伤害。同时,OpenAI 也邀请了视觉艺术家、设计师和电影制作人使用Sora,收集他们的反馈,以使模型更好地服务于创意行业。

Sora能够创造出包含多个角色、特定动作类型以及与主题和背景相符的详细场景。这款模型不仅能理解用户的指令,还能洞察这些元素在现实世界中的表现。

Sora对语言有着深刻的理解,能够精准地捕捉到用户的需求,并创造出充满生命力、情感丰富的角色。此外,Sora还能在同一视频中创造出多个画面,同时保持角色和视觉风格的一致性。

当然,Sora还不是完美的。比如在模拟复杂场景的物理效应,以及理解某些特定因果关系时,它可能会遇到难题。举个例子,视频中的人物可能会咬一口饼干,但饼干上可能看不到明显的咬痕。

在处理空间细节,比如分辨左右时,Sora也可能会出现混淆;在精确描述一段时间内发生的事件,如特定的摄影机移动轨迹时,也可能显得力不从心。
—-

视频二提示词:一位时髦的女士穿行在东京的街头,街道充满了温暖的霓虹灯光和动感的城市标志。她穿着一件黑色皮夹克,一条长红裙和黑色靴子,手拿一个黑色手提包。她戴着太阳镜和红色口红。她走路既自信又随意。街道潮湿且能反射,创造出彩色灯光的镜面效果。许多行人来来往往。

产品地址: openai.com/sora
谷歌发布了Gemini 1.5模型,最主要的升级是支持了高达 100 万的上下文长度,秒杀了所有模型。#ai##llm#

Gemini 1.5基于Transformer和MoE架构的研究和工程创新,提高了训练和服务的效率。

Gemini 1.5 Pro是一个中等规模的多模态模型,适用于多种任务,并引入了在长上下文理解方面的实验性特性。

它标准的上下文窗口为128,000个Token,但现在已经可以通过AI Studio和Vertex AI向开发者和企业客户提供高达100万个Token的私人预览。
1.5 Pro 可以一次处理大量信息——包括 1 小时的视频、11 小时的音频、包含超过 30,000 行代码的代码库或超过 700,000 个单词。

Gemini 1.5 Pro在文本、代码、图像、音频和视频评估的综合面板上的性能超过了Gemini 1.0 Pro,并且与1.0 Ultra在同样的基准测试上表现相当。

此外,Gemini 1.5 Pro在进行长上下文窗口的测试中表现出色,在NIAH评估中,它在长达100万个Token的数据块中99%的时间内找到了嵌入的文本。

了解更多: 网页链接#context-window
🧪一套非常简单的提示词效果却意外的好,可以生成八九十年代的电影质感照片,而且里面的人物装扮也非常复古和到位,MJ V6 真是太强大了,对画面氛围装扮和照片质感的把握都非常好。

把第一个逗号前面的提示词换掉就行,可以是中国道士,可以是刀客,也可以是将军女侠。

提示词:
Chinese swordsman wearing robe and hat, DVD screengrab, 1980s fantasy cinema, --ar 9:16 --style raw
🧪一套非常简单的提示词效果却意外的好,可以生成八九十年代的电影质感照片,而且里面的人物装扮也非常复古和到位,MJ V6 真是太强大了,对画面氛围装扮和照片质感的把握都非常好。

把第一个逗号前面的提示词换掉就行,可以是中国道士,可以是刀客,也可以是将军女侠。

提示词:
Chinese swordsman wearing robe and hat, DVD screengrab, 1980s fantasy cinema, --ar 9:16 --style raw
#midjourney##晚安提示词##catjourney##ai画图#
已经有人发布了第一个基于Stable Cascade微调的模型HelloWorld SC 1B。#ai画图#
看起来效果不错,不过还是没有比 SDXL 好太多目前微调 SC 模型的成本也很高。

这个模型总共使用了740张真实的训练图像,涵盖肖像、科幻等主题。所有图像均使用我们的开源 GPT4V 标记器进行标记。

使用的显卡是一张 48G VRAM RTX6000ada。总训练时间为3.5小时。上述参数在训练时会占用约45G的显存。

下面是一些作者的图片示例,这里下载模型:网页链接
Back to Top