关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
支持在Vercel上面一键部署。由于目前还没有 Sora API 看了一下是通过模拟 DALL-E3 的 API 接口字段做的。
项目地址:https://github.com/SoraWebui/SoraWebui
他可以把相当复杂的LLM概念用非常好理解的方式讲出来。希望了解LLM的强烈建议听一下他的课,包括一些历史课程。
用GPT-4翻译了一下这节课,感兴趣可以听一下。字幕文件下载和历史课程会放最后。
补充一下视频介绍:
分词器是大语言模型(LLM)处理流程中一个独立且关键的环节。它们有专属的训练数据集、采用特定的训练算法——字节对编码(Byte Pair Encoding),训练完成后,分词器能够执行两个核心功能:encode() 函数将普通文本字符串转换为词元,而 decode() 函数则能将词元还原为原始文本字符串。在这场讲座中,我们将一步步揭开 OpenAI GPT 系列分词器的构建过程。
我们将发现,许多大语言模型(LLM)表现出的异常行为和问题,其实都源于标记化(tokenization)这一环节。我们会针对这些问题进行详细讨论,探究标记化为何成为问题的关键所在,以及为什么最理想的情况是有人能够找到办法,完全去除这一处理阶段。
字幕及视频下载:网页链接
开源代码: https://github.com/SoraWebui/SoraWebui
演示网站:https://sorawebui.com/
大家可以先基于这套代码,把网线部署上线,然后等待 Sora 官方 API 上线。
因为目前暂时无法调用 OpenAI 的官方接口,所以还有个配套项目 FakeSoraAPI。
FakeSoraAPI 基于 DALL-E 的接口,猜测 Sora 的接口参数和返回值,实现了一个假的 Sora API 来完成 Text to Video 流程。
大家如果自己要开发,也可以先基于 FakeSoraAPI ,把整个业务流程走通,等到 Sora 官方 API 上线之后就可以第一时间做一些小改动,就能够让自己的产品可以使用,而不是等到API上线了才开始开发。
开源代码:https://github.com/SoraWebui/FakeSoraAPI
既可以自己基于开源代码一键部署,也可以使用部署好的 https://fake-sora-api.sorawebui.com/ 。
先说结论由于 LUP 这个卡显存太低,所以运行同样的模型需要的数量比英伟达的 H100 多的多。
成本主要来自于卡的购买成本,比H100 贵 3 倍。运营成本也比 H100 贵很多。
------完整解释------
这可能是首次对使用 GroqInc 硬件运行 Llama2-70b 的运营成本进行分析。
首先,我必须说我非常欣赏 Groq 的产品。它们性能卓越,潜力巨大。下面的内容仅是展示在与行业领头羊竞争时可能遇到的挑战,但随着时间推移,我对它充满期待。
每张 Groq 卡的内存为 230MB。考虑到 LLaMA 70b 模型,假设采用 int8 量化技术(一种降低数据精度以减少存储需求的技术)并完全忽略在模型推理(即模型执行过程中的数据处理)时的内存消耗,至少需要 305 张这样的卡。但实际上,根据报告,需要的卡数多达 572 张,因此我们的计算将基于这个数字。
每张 Groq 卡的价格是 $20,000,因此购买 572 张卡的总成本为 $11.44 百万。当然,考虑到销售策略和大规模购买的优惠,实际价格可能会更低,但我们暂时按照标价来计算。
对于 572 张卡片,平均每张卡的功耗为 185W,总功耗达到 105.8kW,这还不包括附加的外围设备。(实际的能耗可能会更高)
目前,数据中心每千瓦每月的电费平均为 $200,这意味着每年的电费为 105.8 * 200 * 12 = $254,000。
事实上,使用 4 张 H100 卡可以达到 Groq 一半的性能,因此 8 张卡组成的 H100 盒子在性能上大致等同于上述 Groq 配置。一个 8 卡的 H100 盒子的名义最大功率是 10kW(实际上大约在 8-9 kW),因此其年电费约为 $24,000 或略低。
目前,一个 8 卡的 H100 盒子的价格大约为 $300,000。
因此,如果运营三年,Groq 硬件的购买成本是 $114.4 万,运营成本为 $76.2万。而对于一个 8 卡的 H100 盒子,硬件购买成本为 $30 万,运营成本约为 $7.2 万或稍低。
以上数字仅为估算值。如果我有任何重大错误,请不吝指正。
来源:网页链接
20 号 Gemini Advanced用户可以使用类似 ChatGPT 的代码解释器功能,可以运行 python 代码。不过很多人表示没看到 20 号的这个更新公告。
21 号会推出Gemini商务和Gemini企业计划和 Open AI 类似,企业计划的内容不会用于模型训练。
-------完整更新内容-- ...
马斯克说 Grok 1.5 的发布有望在几周后完成。它将附带一个‘Grok Analysis’ 按钮,可以总结整个对话复。还将帮助人们创建帖子。#ai#
感觉 Midjourney 的接入也会在 1.5 发布的时候完成?
来源:网页链接歸藏的AI工具箱的微博视频
感觉 Midjourney 的接入也会在 1.5 发布的时候完成?
来源:网页链接歸藏的AI工具箱的微博视频
在模型的训练和推理都不需要专门适配对应的图片比例和分辨率。看演示的图像模型的美学表现也还行。
-----项目简介-----
推出了一种名为灵活视觉变换器(Flexible Vision Transformer,简称FiT)的新型变换器架构。它专门设计用于创造没有分辨率和宽高比限制的图像。不同于传统的将图像看作固定分辨率网格的方法,FiT将图像视为一系列可变大小的图像块( Token )。
这种独特的处理方式使得FiT能够在训练和应用过程中灵活适应不同的图像宽高比,提高了对不同分辨率的适应能力,并避免了由于裁剪图像而产生的偏差。FiT还通过精心设计的网络结构和一些不需要额外训练的技术,能够在图像分辨率的扩展方面展现出极大的灵活性。
通过一系列全面的实验,FiT证明了其在处理各种不同分辨率的图像方面具有卓越的性能,无论是在其训练的分辨率范围内还是超出这一范围,都表现出色。
项目地址:网页链接