关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
字节跳动家的AI绘画工具dreamina,生成的图片版权归你,应该是SD的模型改版的,勉强能当midjourney国内平替版本吧,关键是免费,不限量,太秀了https://www.capcut.cn/ai-tool/platform
一个面向零基础新人的提示词小册,从最基础的内容开始逐步帮助大家补齐方法和概念,并提供一些基础实践案例,希望给读者带来一定的参考和帮助。
专栏作者:小七姐, 13 年产品经理,微软 / ZelinAI 企业服务合作提示词工程师,AI 开源社区《 通往AGI之路 》共创作者。

小册共分四小专栏:提示词学习地图、提示词编写误区、ChatGPT 最佳实践、国产大模型提示词。

关键词:AI,提示词,副业

推荐理由:小七姐可以说是AI提示词领域的大V了,如果你想要在AI绘画领域有所作为,那么一定要订阅这个专栏
Runway 的首席产品经理 Joel 约了我国内时间早上 8:30 线上 chat. (什么魔鬼时间)

刚刚看了下他的 bio,发现他还做过 Figma 的程序、Botnik 的 data science、微软的产品管理、Lunry 的自由撰稿人、Chrome 的插件开发者、哈佛大学区块链教材的作者之一。

最主要的是,他还讲单口喜剧开放麦!有加入的单口喜剧俱乐部,还有每年一次的慈善演出,实在是太酷了。

我的摇摆舞和爵士钢琴事业不知道能不能也这样。海辛:工作时间服务AI公司,下班后是摇摆舞舞者,每周三晚上在爵士酒吧演出。
服了你们这些会玩梗的
想起 Instagram 当年的一个洞察
重要的不是照片像素和摄影技巧
而是希望被别人看见的原始冲动

那么,当生成一个自己任意模样的图像
几乎没有成本时
或者当图像不能当做实际发生的证明时
这背后隐藏的原始动力是什么?

又或者,根本视角不在自身,而在他者?
就像未来我们终究会死,
但我们的数字分身却可以慰藉还在世的人
【好文推荐】《优化 Stable Diffusion XL 的终极指南》#ai画图#

详细介绍和测试了 SDXL 的模型优化方式,可以让 SDXL 在低显存显卡上稳定运行。同时大幅提高生成速度降低图像质量的损失。

推荐有部署和优化 SDXL 需求的朋友收藏阅读,写的真的很好。

--------详细介绍-------

该文详细介绍了如何优化Stable Diffusion XL (SDXL)以在任何显卡上获得最佳质量和性能。文章的核心目标是通过不同的优化技术,使SDXL能够在仅使用6GB内存的情况下生成图像,从而允许使用低端显卡。

作者使用Hugging Face的diffusers库进行脚本编写和开发,旨在让读者了解和应用这些优化技术,以便在各种应用中,如Automatic1111的Stable Diffusion web UI或特别是ComfyUI中,充分利用它们。

测试使用RunPod平台在Secure Cloud上生成了一个搭载RTX 3090显卡的GPU Pod进行。文章比较了不同优化技术的性能,包括感知图像质量、生成每张图像所需时间、以及使用的最大内存量。

优化技术包括CUDA和PyTorch版本选择、注意力机制优化、FP16、TF32、以及多种管道优化技术,如模型CPU卸载、批处理处理、Stable Fast、DeepCache和TensorRT。

文章的结论部分提供了一个表格,总结了所有测试的结果,并提供了在寻求质量、速度或在内存限制下运行推理过程时的建议。

例如,FP16优化通过使用半精度浮点格式显著降低了内存使用量并提高了计算速度,而Stable Fast项目通过运行时优化显著提高了推理速度。DeepCache通过使用缓存系统在保持较小的内存使用增加的同时,大幅减少了推理时间,但可能会略微降低图像质量。

总的来说,这篇文章为那些希望在不同硬件配置下优化Stable Diffusion XL性能的开发者提供了一份详尽的指南,展示了通过各种优化技术实现性能提升的可能性。

文章地址:网页链接
Snap Video 一种基于transformer的视频生成模型架构,其训练速度比 U-Net 快 3.31 倍(推理速度约快 4.5 倍)。#ai视频#

这个架构可以高效训练一个包含数十亿参数的文本到视频模型。(arxiv 的 PDF 转 HTML 居然又好了)

项目地址:网页链接歸藏的AI工具箱的微博视频
Gamma:下一代的 PPT 制作方式。
文本转 PPT,这里用 ChatGPT 生成了一段关于 ChatGPT 介绍的大纲和详细内容的 Markdown,然后将这段内容交给 Gamma,看它能做出什么样的效果。

Gamma 的基本功能是完全免费的,
而使用 AI 功能则需要相应的积分(credits),注册赠送 400 credits。
或者直接开通 Pro 账户(16美元/每月)(还挺贵)。

用我的邀请链接注册也会双方各赠送 200 credits:https://gamma.app/signup?r=5gesmvu4uy95nkg
医院里有个机器人采血,旁边有医生辅助
但是操作时间比较长,大概是人工采血3-5倍时间
虽然不用排队,但是大家都还是愿意花更长的时间在人工窗口等待。
看来人对新鲜事物都有所抗拒
如果是你,你愿意试试机器人采血吗?
目前市面上做人形机器人的,

稚晖君,电子科技大学,华为入局了。

陈建宇,星动纪元,清华的。

王兴兴,宇树科技,浙江理工的,唯一一个不是top院校在这个行列。
燃油车企做AI机器人,很难拥有现实世界的推理能力
1个1人AI公司的年度复盘(长文慎入)

10个月前,我决定把公司开在@飞书 上,开启这个“危险”的探索。 这是个开工前的复盘……欢迎点赞转发给个鼓励,更欢迎提点需求和建议。如果对AI视频和RPA感兴趣,一起做点事,咱们私聊🙃😊
昨天的 Midjourney 透露的一些消息,Midjourney 将会在六个月内开放 API,V7 模型可以生成视频,将会有产品在中国推出。一致性和 ControlNet 能力还在打磨。

-------完整内容-------

网站方面#ai画图##midjourney#

正在开发网站的新社交功能

v6版本

正在完成 v6 版本的相关工作
正在开发用户最期待的角色一致性特性,尚需测试和确定监管策略
提升视觉美感
可能改进角色身体的一致性
提高 v6 的运行速度
即将推出的描述功能(预计1至2周内发布)
计划加入颜色参考功能,类似于现有的风格和角色参考
v6的加速模式

v7版本

在 v6 完成后将重点开发 v7
将打造更加清晰高效的系统
考虑将视频功能推迟到 v7 版本

其他动态

对目前的 ControlNet 进展不太满意,尤其是其外观方面
将继续推进视频功能的开发
未来六个月,我们可能会开始与一些顶尖 AI 实验室进行合作或建立伙伴关系(届时我们会拥有 MJ API)。我们也可能会与一些大型语言模型进行合作。

中国正在研发一个类似于 MJ 的项目,预计不久后将亮相。

来源:网页链接
Andrej Karpathy 提出了一个工作流希望自动将长视频内容转换为带对应示例的播客文章。现在虽然也有一些类似工具但是都做的不好。#ai##llm#

同时他还把前几天自己的视频教程转成了文字内容,觉得视频太浪费时间的可以看文本。

AK 设想的完整工作流:

一个有趣的大语言模型 (Large Language Model) 挑战是:将我的2小时13分钟的分词器视频转换成一本书的章节(或者博客文章)形式,专门讨论分词。具体步骤如下:

为视频添加字幕或解说文字。
将视频切割成若干带有配套图片和文字的段落。
利用大语言模型的提示工程技术,逐段进行翻译。
将结果输出为网页形式,其中包含指向原始视频各部分的链接。

从更广泛的角度来看,这样的工作流程可以应用于任何视频输入,自动生成各种教程的“配套指南”,使其格式更加便于阅读、浏览和搜索。这听起来是可行的,但也颇具挑战。

LLM Tokenization课程文字版本:网页链接
Back to Top