关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
[整理]基于Sora是否真的像Open AI说的一样是个世界模型,又吵起来了。#ai视频##sora#

基本上就是两派一派类似杨立昆的论点,模型必须理解底层理论从底层理论推导出来物理现象才能叫世界模型。

另一派的意思是只要他表现出来相当程度的物理世界的表现,那就有继续优化的机会,就有可能变成完整的世界 ...
智能汽车更像是给AI机器人练手的前导产业
鉴于我们团队从去年开始就在做【世界模型(worldmodel)我必须要坚决地站在Yann 佬这边🤣地指出OpenAI的Sora根本不是世界模型,甚至除了都属于图像领域模型以外没有半毛钱关系。

事实上,人家openAI从未在任何官方宣传资料上使用过【世界模型(英文:world model)】这个名词来宣传sora,关于sora和世界模型的关系基本来自于翻译的误读、部分人群的颅内高潮外加营销号的刻意造势。

【世界模型】的定义并不在于它生成的东西能不能像一个世界。

一个模型如果能够被认定为【世界模型】它必须要向人们证明:其模型的预测结果可以随着环境中的主动交互进行变化,且这种变化还需要符合正确且统一的物理规律。(即图1中action的影响部分)

也正因为如此,【世界模型】才可以被应用到训练、测试和端到端的决策系统上。

从sora的技术方案中可看出(图2),sora的生成行为为:一次性生成视频而非不断地生成单帧图片。这意味着:sora生成的视频内容无法在其生成过程中被影响。

sora的生成行为从技术本质上来说是:一次生成=一个完整的视频。(抽一次卡一个视频),而基于【世界模型】的文生视频模型需要能够让你看到这个视频在时间线上的生成过程并且你还能够在这个过程没有走到结束的时候影响它的结果。

举个🌰,如果你让sora生成一个:林克在草丛中奔跑,它也许能很好的完成任务,比如模仿出塞尔达的场景,让一个穿着英杰服拿着大师剑的林克在草丛中奔跑,也许它还能更好比如能转个弯跳一下。但是如果它是【世界模型】的话,你可以随时按照你的需要改变他奔跑的轨迹,甚至让他停下来,就像在玩游戏一样。

sora当然做不到这些😓🤣🤣🤣甚至连物理规律都没学好🤣🤣🤣

如果还有人告诉你它是世界模型,那么要么它就不该是你收集信息的信息源了,要么ta想骗你点什么。
AI探索指南
正在用coze搭建一个聊天机器人,目前还很粗糙,但是从回答上看,已经呈现很不错的结构化知识了。 1. 我的问题 我想系统了解下MBTI,类似www.16personalities.com中的信息,它是否可信呢? 2. 回答 ## 理解信息 你提供的链接内容详细介绍了一个理解和分类人格类型的框架。这个框架似乎依赖于心理学家卡尔·古斯塔夫·荣格的研究,以及由凯瑟琳·库克·布里格斯和她的女儿伊莎贝尔·布里格斯·迈尔斯联合编写的广为人知的人格指标——Myers-Briggs型人格指标(MBTI)。 该文本解释…
我强烈推荐你阅读关于Myers-Briggs性格类型的这篇文章: https://www.myersbriggs.org/my-mbti-personality-type/myers-briggs-overview/。
这篇文章提供了关于Myers-Briggs框架和一般性格概念的深入理解。你可以了解“偏好”如何影响我们的思维方式,以及如何识别和发展你自己的个性类型。该框架包括了八种偏好,它们组合在四对相反的对中。此外,该文章也谈论了生来与后天学到的偏好如何影响我们的个性特征,并强调了Myers-Briggs性格类型指标的目标——帮助人们识别和理解自己如何获取信息和做决策。祝阅读愉快!如有疑问或需要进一步讨论,随时告诉我。
正在用coze搭建一个聊天机器人,目前还很粗糙,但是从回答上看,已经呈现很不错的结构化知识了。

1. 我的问题
我想系统了解下MBTI,类似www.16personalities.com中的信息,它是否可信呢?

2. 回答
## 理解信息
你提供的链接内容详细介绍了一个理解和分类人格类型的框架。这个框架似乎依赖于心理学家卡尔·古斯塔夫·荣格的研究,以及由凯瑟琳·库克·布里格斯和她的女儿伊莎贝尔·布里格斯·迈尔斯联合编写的广为人知的人格指标——Myers-Briggs型人格指标(MBTI)。
该文本解释了这个人格框架基于特性的概念,而非类型。换句话说,它们并不是将人们划分为严格的类型,而是根据他们展现出某种特质的程度进行考察。你的目的看起来是更清楚地理解这个人格框架。

## 思维模型
处理你问题的合适思维模型是“概念框架分析”。这将帮助我们将像这样的复杂概念和理论分解为易于理解的部分。

## 解决方法
我们来应用“概念框架分析”:

### 整体概念理解:
描述的人格框架基于特质,而不是类型。它衡量特定特质被展现的程度,而不是将人们分入预设的类别中。

### 历史背景:
这个框架的理论根基在荣格的理论以及布里格斯母女设计的Myers-Briggs型人格指标(MBTI)。

### 特性模型和类型模型的区别:
像文中描述的这样的特性模型,会衡量个体展现出某种特性的程度。比如,而不是将某人分类为内向者或外向者,他们可能会被定位到一个衡量内向和外向程度的连续体上。相反,类型模型将人们根据其属性划分为预设的类型,通常是二分的。

### 应用和解释:
这个框架通过承认特性间的连续性,而非绝对的类型,提供了更细微的人格理解。例如,有些人可能显示出内向和外向特性的双重特征,称为“中间性格”。

## 形象理解
可以想象一个滑杆。一个端是内向,另一个端是外向。而个人可以在这个滑杆上滑动到任何点,这样能更准确地展现他们的人格特质。如需深入阅读,你可以探索卡尔·古斯塔夫·荣格的原始文本或凯瑟琳·库克·布里格斯和伊莎贝尔·布里格斯·迈尔斯的著作。
请记得,标签和框架的存在是为了帮助我们理解,而不是限制或完全定义我们。我们每个人都以自己的方式独一无二。如果你需要更多的解释或有其他问题,尽管告诉我!

3. 追问
请给出你推荐的阅读内容的网页链接。

4. 回答
思考完全基于视频生成模型的视频剪辑工具是什么样的,也是一件非常有意思的事情。#ai视频#

设计稿来源:网页链接
🧪#晚安提示词# 一套Niji提示词,Niji V6挺有意思的,--s的值和是否开Raw格式对画面风格和生成内容的影响非常大,感兴趣可以自己改一下提示词的参数看看。#ai画图#

提示词的服装和人物特征部分都可以随便改,杂志和背景的部分不改就行。

提示词:k-pop girl, beautiful face, chubby, cyan hue, barcode, belt, black nails, green eyes, bracelet, cover, cover page, earrings, english text, fake cover, jewelry, short hair, bodysuit, shiny stocking, long sleeves, looking at viewer, magazine cover, nail polish, white hair, simple background, white background --ar 9:16 --style raw --niji 6
试了一下lllyasviel的Web UI分支Forge,太强了。#ai画图##stablediffusion#
在我的电脑上测试的时候图片生成速度快了一倍左右,Web UI需要3.7秒的图Forge只需要1.9秒。

而且lllyasviel还在Forge预装了很多非常有用的功能,比如提高图像质量的FreeU以及可以帮助SD1.5直接生成大图的Kohya的HRFix。

如果你平时就是用Web UI画画图不装一些奇怪复杂插件的话,或者你的显卡比较差,都推荐替换为Forge。

安装方式直接从下面链接替换整合包就行,如果你需要用你WebUI的模型文件的话可以鼠标右键用记事本打开web ui根目录的webui-user.bat文件。

把第二张图位置加上这段内容就行,文件夹目录改成你需要的目录(注意斜杠):--ckpt-dir D:/sd/novelai-webui-aki-v2/models/Stable-diffusion --vae-dir D:/sd/novelai-webui-aki-v2/models/VAE --lora-dir D:/sd/novelai-webui-aki-v2/models/Lora --gfpgan-models-path D:/sd/novelai-webui-aki-v2/models/GFPGAN --esrgan-models-path D:/sd/novelai-webui-aki-v2/models/ESRGAN --controlnet-dir D:/sd/novelai-webui-aki-v2/models/ControlNet

这里安装:网页链接
试了猎豹前首席科学家闵可锐做的这个密塔AI搜索,相当可以啊,某些方面比Perplexity还要好。

尤其是研究能力开启以后直接生成的内容比一些媒体写的报告好多了,非常全面逻辑性也很强。

下面是同一个问题跟Perplexity的对比,Perplexity开启co-pilot之后会引导你问下一个问题,密塔搜索则是自己把所有可能性都展示给你并且还搭配了思维导图了大纲。

不过现在还有些不稳定,比如有把DALL-E叫做视频生成模型,内容过长后引用链接丢失等问题。

这里体验:https://metaso.cn/s/EPCntW
试了猎豹前首席科学家闵可锐做的这个密塔AI搜索,相当可以啊,某些方面比Perplexity还要好。#ai#

尤其是研究能力开启以后直接生成的内容比一些媒体写的报告好多了,非常全面逻辑性也很强。

下面是同一个问题跟Perplexity的对比,Perplexity开启co-pilot之后会引导你问下一个问题,密塔搜索则是自己把所有可能性都展示给你并且还搭配了思维导图了大纲。

不过现在还有些不稳定,比如有把DALL-E叫做视频生成模型,内容过长后引用链接丢失等问题。

这里体验:网页链接
飞书文档《Sora模型全面指南:技术解析与商业应用前景》

关于OpenAI新推出的生成式人工智能模型“Sora”的详细介绍和学习资源。Sora模型能够根据文本指令直接生成长达60秒的视频,包含细致的背景、多角度镜头和情感丰富的角色。这一技术被认为是实现通用人工智能(AGI)的重要里程碑。

文档内容概要如下:

1. 基本介绍
正式发布时间预测、央视报道、博主解读、模型效果对比以及Sora的六大优势。
Sora可能带来的影响。
2. 技术拆解
官方技术报告(中英文对照)、腾讯科技拆解文、阿里巴巴分析文、素人笔记。
3. 演示案例
视频案例合集、官方示例。
4. 赚钱方法
提供了多种利用Sora模型赚钱的方法,如搞流量、卖账号、卖课程、套壳、投资、提示词交易、剧本创作、视频制作、原业务优化、企业服务、Sora+电商、开发与Sora相关的网站或工具。
5. 名人观点
360董事长周鸿祎的观点。
6. 适用人群
互联网关注AI视频发展的人群。
7. 使用建议
提供了快捷键搜索功能,以便快速定位到精确内容。

文档强调了Sora模型的重要性,并提供了持续更新的资讯动态、研究报告、赚钱案例和实用场景等内容。这些资源对于希望了解和利用Sora模型的读者来说非常有价值。文档还提到了与Sora模型相关的其他学习内容,如AIGC学习手册、ChatGPT学习手册和大厂AI实战应用案例库。

https://wiki.pmhub.cc/184.html
Back to Top