关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
早上尝试Stable Cascade的时候,试了几张图发现 SC 模型生成图片质量比 SDXL 刚发布的时候好不少。#ai画图#

于是就做了一个更详细的测试,SC 和 Midjoureny 使用完全相同的提示词,Midjoureny不是用特殊的参数,一次生成 4 张,各选出一张比较好的进行测试。

下面是对应的测试图,先说我的结论:

在写实场景 SC 生成的内容在美学表现上和细节上跟 Midjourney 差别不是很大,细节上差一些,偶尔可以替代使用。

SC 由于模型规模的原因对于一些概念的理解不够,提示词响应比 SDXL 好但是比 Midjourney 要差。

整体美学表现上相比 SDXL 更发布的时候有大幅提高,虽然还是不如 Midjourney,但是风格表现上很相似,估计拿 MJ 图片做的训练。
字节发布了一个用类似 SDXL Turbo 的模型SDXL-Lightning,只需几步即可生成高质量的 1024px 图像。#ai画图#

包括了 unet 模型和 Lora 模型都已经发布,Lora 模型可以用在其他 SDXL 模型上。感兴趣可以试试。

模型下载:网页链接
又来帮在快手的朋友招人了,这次是 2-5 年的成产品设计岗位。#ai##招聘#
除开正常的要求外,需要有 AIGC 实践经验和设计系统的搭建经验,有代码能力更好。

-----完整 JD-----

我们是快手研发设计中心团队,负责面向公司内部的产品交互设计。我们正在进行前沿的 AIGC 设计探索,并把探索的成果变成产品,希望找到志同道合的朋友一起同行:

1. 招聘交互设计师(UE) 或者产品设计师(UX)
2. 有 2 ~ 5 年 B 端或工具类产品设计工作经验
3. 有良好的逻辑性
4. 对 AIGC 方向感兴趣,在 AIGC(MJ,SD,GPT 等)有实践经验优先
5. 有设计系统建设 / 设计规范建设经验优先
6. 有代码基础优先
7. Base 北京

如果你对我们的工作感兴趣,请和我联系,我的微信:ding_zu,邮箱 dzwangyihan@gmail.com
006KpAl0ly1hn15bojmloj30wi2epapd.jpg
561.3 KB
发现一个开源的 Sora Web 客户端,准备等 Sora 上线就搞的开发者可以看看,提前研究一下。

支持在Vercel上面一键部署。由于目前还没有 Sora API 看了一下是通过模拟 DALL-E3 的 API 接口字段做的。

项目地址:https://github.com/SoraWebui/SoraWebui
跑起来的 Asimo 人形机器人
虽然是十多年前的视频
本田公司在测试时
Asimo 可以跑 9 公里/小时
现在看依然感到震撼🤖
昨天 Stable Cascade 创建图片有伪影的问题解决了,主要原因是我随便打得图像比例和分辨率不是Stable Cascade支持的分辨率。#ai画图#

更换成 2048*1152 就没问题了,没有伪影的图片质量相当不错,下面是昨天同样提示词生成的四张图,2K 分辨率直出。
发现一个开源的 Sora Web 客户端,准备等 Sora 上线就搞的开发者可以看看,提前研究一下。#ai#

支持在Vercel上面一键部署。由于目前还没有 Sora API 看了一下是通过模拟 DALL-E3 的 API 接口字段做的。

项目地址:网页链接
昨天的泄漏看起来是准确的,Gemini Advanced现在可以有似代码解释器的东西来运行 Python 代码。
006KpAl0ly1hn0vx2em9vj31wi0lak37.jpg
435.6 KB
Open AI传奇研究员Andrej Karpathy的新课,教你理解和构建GPT Tokenizer。#ai#

他可以把相当复杂的LLM概念用非常好理解的方式讲出来。希望了解LLM的强烈建议听一下他的课,包括一些历史课程。

用GPT-4翻译了一下这节课,感兴趣可以听一下。字幕文件下载和历史课程会放最后。

补充一下视频介绍:

分词器是大语言模型(LLM)处理流程中一个独立且关键的环节。它们有专属的训练数据集、采用特定的训练算法——字节对编码(Byte Pair Encoding),训练完成后,分词器能够执行两个核心功能:encode() 函数将普通文本字符串转换为词元,而 decode() 函数则能将词元还原为原始文本字符串。在这场讲座中,我们将一步步揭开 OpenAI GPT 系列分词器的构建过程。

我们将发现,许多大语言模型(LLM)表现出的异常行为和问题,其实都源于标记化(tokenization)这一环节。我们会针对这些问题进行详细讨论,探究标记化为何成为问题的关键所在,以及为什么最理想的情况是有人能够找到办法,完全去除这一处理阶段。

字幕及视频下载:网页链接
快就是优势,深夜推一个开源 Sora Web 客户端

开源代码: https://github.com/SoraWebui/SoraWebui
演示网站:https://sorawebui.com/

大家可以先基于这套代码,把网线部署上线,然后等待 Sora 官方 API 上线。

因为目前暂时无法调用 OpenAI 的官方接口,所以还有个配套项目 FakeSoraAPI。
FakeSoraAPI 基于 DALL-E 的接口,猜测 Sora 的接口参数和返回值,实现了一个假的 Sora API 来完成 Text to Video 流程。

大家如果自己要开发,也可以先基于 FakeSoraAPI ,把整个业务流程走通,等到 Sora 官方 API 上线之后就可以第一时间做一些小改动,就能够让自己的产品可以使用,而不是等到API上线了才开始开发。

开源代码:https://github.com/SoraWebui/FakeSoraAPI
既可以自己基于开源代码一键部署,也可以使用部署好的 https://fake-sora-api.sorawebui.com/
真没听说过。这人这么有名吗?
整个世间有不少类似“缝隙”的地方,找到适合自己的“缝隙”,就好歹能生存下去。
——《我的职业是小说家》
Back to Top