关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
发现一个开源的 Sora Web 客户端,准备等 Sora 上线就搞的开发者可以看看,提前研究一下。#ai#

支持在Vercel上面一键部署。由于目前还没有 Sora API 看了一下是通过模拟 DALL-E3 的 API 接口字段做的。

项目地址:网页链接
昨天的泄漏看起来是准确的,Gemini Advanced现在可以有似代码解释器的东西来运行 Python 代码。
006KpAl0ly1hn0vx2em9vj31wi0lak37.jpg
435.6 KB
Open AI传奇研究员Andrej Karpathy的新课,教你理解和构建GPT Tokenizer。#ai#

他可以把相当复杂的LLM概念用非常好理解的方式讲出来。希望了解LLM的强烈建议听一下他的课,包括一些历史课程。

用GPT-4翻译了一下这节课,感兴趣可以听一下。字幕文件下载和历史课程会放最后。

补充一下视频介绍:

分词器是大语言模型(LLM)处理流程中一个独立且关键的环节。它们有专属的训练数据集、采用特定的训练算法——字节对编码(Byte Pair Encoding),训练完成后,分词器能够执行两个核心功能:encode() 函数将普通文本字符串转换为词元,而 decode() 函数则能将词元还原为原始文本字符串。在这场讲座中,我们将一步步揭开 OpenAI GPT 系列分词器的构建过程。

我们将发现,许多大语言模型(LLM)表现出的异常行为和问题,其实都源于标记化(tokenization)这一环节。我们会针对这些问题进行详细讨论,探究标记化为何成为问题的关键所在,以及为什么最理想的情况是有人能够找到办法,完全去除这一处理阶段。

字幕及视频下载:网页链接
快就是优势,深夜推一个开源 Sora Web 客户端

开源代码: https://github.com/SoraWebui/SoraWebui
演示网站:https://sorawebui.com/

大家可以先基于这套代码,把网线部署上线,然后等待 Sora 官方 API 上线。

因为目前暂时无法调用 OpenAI 的官方接口,所以还有个配套项目 FakeSoraAPI。
FakeSoraAPI 基于 DALL-E 的接口,猜测 Sora 的接口参数和返回值,实现了一个假的 Sora API 来完成 Text to Video 流程。

大家如果自己要开发,也可以先基于 FakeSoraAPI ,把整个业务流程走通,等到 Sora 官方 API 上线之后就可以第一时间做一些小改动,就能够让自己的产品可以使用,而不是等到API上线了才开始开发。

开源代码:https://github.com/SoraWebui/FakeSoraAPI
既可以自己基于开源代码一键部署,也可以使用部署好的 https://fake-sora-api.sorawebui.com/
真没听说过。这人这么有名吗?
整个世间有不少类似“缝隙”的地方,找到适合自己的“缝隙”,就好歹能生存下去。
——《我的职业是小说家》
🧪一套可爱 3D 小动物的提示词,比较简单改一下动物名称和颜色就行。#ai画图##晚安提示词#

提示词:
Tiny cute isometric cat plush emoji, soft smooth lighting, with soft pastel colors, 3d icon clay render, pink background --ar 9:16 --style raw
[整理] 对 Groq 的 LUP 运行Llama 70B 模型和同等规模英伟达显卡的成本对比,目前成本上相比英伟达没啥优势。#ai#

先说结论由于 LUP 这个卡显存太低,所以运行同样的模型需要的数量比英伟达的 H100 多的多。

成本主要来自于卡的购买成本,比H100 贵 3 倍。运营成本也比 H100 贵很多。

------完整解释------

这可能是首次对使用 GroqInc 硬件运行 Llama2-70b 的运营成本进行分析。

首先,我必须说我非常欣赏 Groq 的产品。它们性能卓越,潜力巨大。下面的内容仅是展示在与行业领头羊竞争时可能遇到的挑战,但随着时间推移,我对它充满期待。

每张 Groq 卡的内存为 230MB。考虑到 LLaMA 70b 模型,假设采用 int8 量化技术(一种降低数据精度以减少存储需求的技术)并完全忽略在模型推理(即模型执行过程中的数据处理)时的内存消耗,至少需要 305 张这样的卡。但实际上,根据报告,需要的卡数多达 572 张,因此我们的计算将基于这个数字。

每张 Groq 卡的价格是 $20,000,因此购买 572 张卡的总成本为 $11.44 百万。当然,考虑到销售策略和大规模购买的优惠,实际价格可能会更低,但我们暂时按照标价来计算。

对于 572 张卡片,平均每张卡的功耗为 185W,总功耗达到 105.8kW,这还不包括附加的外围设备。(实际的能耗可能会更高)

目前,数据中心每千瓦每月的电费平均为 $200,这意味着每年的电费为 105.8 * 200 * 12 = $254,000。

事实上,使用 4 张 H100 卡可以达到 Groq 一半的性能,因此 8 张卡组成的 H100 盒子在性能上大致等同于上述 Groq 配置。一个 8 卡的 H100 盒子的名义最大功率是 10kW(实际上大约在 8-9 kW),因此其年电费约为 $24,000 或略低。

目前,一个 8 卡的 H100 盒子的价格大约为 $300,000。

因此,如果运营三年,Groq 硬件的购买成本是 $114.4 万,运营成本为 $76.2万。而对于一个 8 卡的 H100 盒子,硬件购买成本为 $30 万,运营成本约为 $7.2 万或稍低。

以上数字仅为估算值。如果我有任何重大错误,请不吝指正。

来源:网页链接
谷歌 Gemini 的更新公告又被泄露了。#ai#

20 号 Gemini Advanced用户可以使用类似 ChatGPT 的代码解释器功能,可以运行 python 代码。不过很多人表示没看到 20 号的这个更新公告。

21 号会推出Gemini商务和Gemini企业计划和 Open AI 类似,企业计划的内容不会用于模型训练。

-------完整更新内容-- ...
马斯克说 Grok 1.5 的发布有望在几周后完成。它将附带一个‘Grok Analysis’ 按钮,可以总结整个对话复。还将帮助人们创建帖子。#ai#
感觉 Midjourney 的接入也会在 1.5 发布的时候完成?

来源:网页链接歸藏的AI工具箱的微博视频
又一个Transformer架构的图像生成模型,FiT 专门为了生成不瘦分辨率和宽高比限制的图像制作的架构。#ai画图#

在模型的训练和推理都不需要专门适配对应的图片比例和分辨率。看演示的图像模型的美学表现也还行。

-----项目简介-----

推出了一种名为灵活视觉变换器(Flexible Vision Transformer,简称FiT)的新型变换器架构。它专门设计用于创造没有分辨率和宽高比限制的图像。不同于传统的将图像看作固定分辨率网格的方法,FiT将图像视为一系列可变大小的图像块( Token )。

这种独特的处理方式使得FiT能够在训练和应用过程中灵活适应不同的图像宽高比,提高了对不同分辨率的适应能力,并避免了由于裁剪图像而产生的偏差。FiT还通过精心设计的网络结构和一些不需要额外训练的技术,能够在图像分辨率的扩展方面展现出极大的灵活性。

通过一系列全面的实验,FiT证明了其在处理各种不同分辨率的图像方面具有卓越的性能,无论是在其训练的分辨率范围内还是超出这一范围,都表现出色。

项目地址:网页链接
𝕏正在与 Midjourney 就潜在的合作伙伴关系进行谈判。#ai##ai画图#
马斯克两三个月之前就说 Midjoureny 给他们展示了一些东西,终于要到实质推进阶段了啊。

估计会首先在 Grok 里面接入,推特高级会员买对了?

来源:网页链接
这个有意思,第一个能在 Minecraft 中与你亲自互动的 AI Agent。演示视频翻译为中文了。#ai##Agents#

以前AI 控制的非玩家角色(NPC)主要只能进行简单的行走和对话。

Altera bots 不仅能够建造、聊天,还能进行团队合作,就跟一个正常的游戏内好友一样跟你一起玩。

这里申请体验:网页链接歸藏的AI工具箱的微博视频
[实践] Comfyui 官方又对 Stable Cascade进行了更新,原来需要下载 7 个模型现在开源社区将其整合为了两个,只需要选择 C 阶段和 B 阶段的模型文件就行。#ai##ai画图#

同时Comfyui官方还放出了多种Stable Cascade玩法的示例工作流,包括文生图、图生图、图片融合。这次更新之后用合并的模型生成图片质量和美观度上都很不错,我都是直接用的 Midjourney的提示词。

就是还有个问题,生成的图片都有伪影,这个比较离谱,非常影响画面效果。希望过段时间可以修复一下。

工作流及模型下载:网页链接
Back to Top