关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
早上尝试Stable Cascade的时候,试了几张图发现 SC 模型生成图片质量比 SDXL 刚发布的时候好不少。#ai画图#

于是就做了一个更详细的测试,SC 和 Midjoureny 使用完全相同的提示词,Midjoureny不是用特殊的参数,一次生成 4 张,各选出一张比较好的进行测试。

下面是对应的测试图,先说我的结论:

在写实场景 SC 生成的内容在美学表现上和细节上跟 Midjourney 差别不是很大,细节上差一些,偶尔可以替代使用。

SC 由于模型规模的原因对于一些概念的理解不够,提示词响应比 SDXL 好但是比 Midjourney 要差。

整体美学表现上相比 SDXL 更发布的时候有大幅提高,虽然还是不如 Midjourney,但是风格表现上很相似,估计拿 MJ 图片做的训练。
字节发布了一个用类似 SDXL Turbo 的模型SDXL-Lightning,只需几步即可生成高质量的 1024px 图像。#ai画图#

包括了 unet 模型和 Lora 模型都已经发布,Lora 模型可以用在其他 SDXL 模型上。感兴趣可以试试。

模型下载:网页链接
又来帮在快手的朋友招人了,这次是 2-5 年的成产品设计岗位。#ai##招聘#
除开正常的要求外,需要有 AIGC 实践经验和设计系统的搭建经验,有代码能力更好。

-----完整 JD-----

我们是快手研发设计中心团队,负责面向公司内部的产品交互设计。我们正在进行前沿的 AIGC 设计探索,并把探索的成果变成产品,希望找到志同道合的朋友一起同行:

1. 招聘交互设计师(UE) 或者产品设计师(UX)
2. 有 2 ~ 5 年 B 端或工具类产品设计工作经验
3. 有良好的逻辑性
4. 对 AIGC 方向感兴趣,在 AIGC(MJ,SD,GPT 等)有实践经验优先
5. 有设计系统建设 / 设计规范建设经验优先
6. 有代码基础优先
7. Base 北京

如果你对我们的工作感兴趣,请和我联系,我的微信:ding_zu,邮箱 dzwangyihan@gmail.com
006KpAl0ly1hn15bojmloj30wi2epapd.jpg
561.3 KB
发现一个开源的 Sora Web 客户端,准备等 Sora 上线就搞的开发者可以看看,提前研究一下。

支持在Vercel上面一键部署。由于目前还没有 Sora API 看了一下是通过模拟 DALL-E3 的 API 接口字段做的。

项目地址:https://github.com/SoraWebui/SoraWebui
跑起来的 Asimo 人形机器人
虽然是十多年前的视频
本田公司在测试时
Asimo 可以跑 9 公里/小时
现在看依然感到震撼🤖
昨天 Stable Cascade 创建图片有伪影的问题解决了,主要原因是我随便打得图像比例和分辨率不是Stable Cascade支持的分辨率。#ai画图#

更换成 2048*1152 就没问题了,没有伪影的图片质量相当不错,下面是昨天同样提示词生成的四张图,2K 分辨率直出。
发现一个开源的 Sora Web 客户端,准备等 Sora 上线就搞的开发者可以看看,提前研究一下。#ai#

支持在Vercel上面一键部署。由于目前还没有 Sora API 看了一下是通过模拟 DALL-E3 的 API 接口字段做的。

项目地址:网页链接
昨天的泄漏看起来是准确的,Gemini Advanced现在可以有似代码解释器的东西来运行 Python 代码。
006KpAl0ly1hn0vx2em9vj31wi0lak37.jpg
435.6 KB
Open AI传奇研究员Andrej Karpathy的新课,教你理解和构建GPT Tokenizer。#ai#

他可以把相当复杂的LLM概念用非常好理解的方式讲出来。希望了解LLM的强烈建议听一下他的课,包括一些历史课程。

用GPT-4翻译了一下这节课,感兴趣可以听一下。字幕文件下载和历史课程会放最后。

补充一下视频介绍:

分词器是大语言模型(LLM)处理流程中一个独立且关键的环节。它们有专属的训练数据集、采用特定的训练算法——字节对编码(Byte Pair Encoding),训练完成后,分词器能够执行两个核心功能:encode() 函数将普通文本字符串转换为词元,而 decode() 函数则能将词元还原为原始文本字符串。在这场讲座中,我们将一步步揭开 OpenAI GPT 系列分词器的构建过程。

我们将发现,许多大语言模型(LLM)表现出的异常行为和问题,其实都源于标记化(tokenization)这一环节。我们会针对这些问题进行详细讨论,探究标记化为何成为问题的关键所在,以及为什么最理想的情况是有人能够找到办法,完全去除这一处理阶段。

字幕及视频下载:网页链接
快就是优势,深夜推一个开源 Sora Web 客户端

开源代码: https://github.com/SoraWebui/SoraWebui
演示网站:https://sorawebui.com/

大家可以先基于这套代码,把网线部署上线,然后等待 Sora 官方 API 上线。

因为目前暂时无法调用 OpenAI 的官方接口,所以还有个配套项目 FakeSoraAPI。
FakeSoraAPI 基于 DALL-E 的接口,猜测 Sora 的接口参数和返回值,实现了一个假的 Sora API 来完成 Text to Video 流程。

大家如果自己要开发,也可以先基于 FakeSoraAPI ,把整个业务流程走通,等到 Sora 官方 API 上线之后就可以第一时间做一些小改动,就能够让自己的产品可以使用,而不是等到API上线了才开始开发。

开源代码:https://github.com/SoraWebui/FakeSoraAPI
既可以自己基于开源代码一键部署,也可以使用部署好的 https://fake-sora-api.sorawebui.com/
真没听说过。这人这么有名吗?
整个世间有不少类似“缝隙”的地方,找到适合自己的“缝隙”,就好歹能生存下去。
——《我的职业是小说家》
🧪一套可爱 3D 小动物的提示词,比较简单改一下动物名称和颜色就行。#ai画图##晚安提示词#

提示词:
Tiny cute isometric cat plush emoji, soft smooth lighting, with soft pastel colors, 3d icon clay render, pink background --ar 9:16 --style raw
[整理] 对 Groq 的 LUP 运行Llama 70B 模型和同等规模英伟达显卡的成本对比,目前成本上相比英伟达没啥优势。#ai#

先说结论由于 LUP 这个卡显存太低,所以运行同样的模型需要的数量比英伟达的 H100 多的多。

成本主要来自于卡的购买成本,比H100 贵 3 倍。运营成本也比 H100 贵很多。

------完整解释------

这可能是首次对使用 GroqInc 硬件运行 Llama2-70b 的运营成本进行分析。

首先,我必须说我非常欣赏 Groq 的产品。它们性能卓越,潜力巨大。下面的内容仅是展示在与行业领头羊竞争时可能遇到的挑战,但随着时间推移,我对它充满期待。

每张 Groq 卡的内存为 230MB。考虑到 LLaMA 70b 模型,假设采用 int8 量化技术(一种降低数据精度以减少存储需求的技术)并完全忽略在模型推理(即模型执行过程中的数据处理)时的内存消耗,至少需要 305 张这样的卡。但实际上,根据报告,需要的卡数多达 572 张,因此我们的计算将基于这个数字。

每张 Groq 卡的价格是 $20,000,因此购买 572 张卡的总成本为 $11.44 百万。当然,考虑到销售策略和大规模购买的优惠,实际价格可能会更低,但我们暂时按照标价来计算。

对于 572 张卡片,平均每张卡的功耗为 185W,总功耗达到 105.8kW,这还不包括附加的外围设备。(实际的能耗可能会更高)

目前,数据中心每千瓦每月的电费平均为 $200,这意味着每年的电费为 105.8 * 200 * 12 = $254,000。

事实上,使用 4 张 H100 卡可以达到 Groq 一半的性能,因此 8 张卡组成的 H100 盒子在性能上大致等同于上述 Groq 配置。一个 8 卡的 H100 盒子的名义最大功率是 10kW(实际上大约在 8-9 kW),因此其年电费约为 $24,000 或略低。

目前,一个 8 卡的 H100 盒子的价格大约为 $300,000。

因此,如果运营三年,Groq 硬件的购买成本是 $114.4 万,运营成本为 $76.2万。而对于一个 8 卡的 H100 盒子,硬件购买成本为 $30 万,运营成本约为 $7.2 万或稍低。

以上数字仅为估算值。如果我有任何重大错误,请不吝指正。

来源:网页链接
Back to Top