关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
详情页还给出了对应提示词的示例回答和 API,可以去看看学一下 Claude 的提示词写法。
这里访问:https://docs.anthropic.com/claude/prompt-library
同时可以与现有的IPadapter以及Controlnet模型兼容。
项目简介:
近期,像Stable Diffusion这样的文本到图像模型和DreamBooth、LoRA等个性化技术的发展,让我们能够创造出既高质量又充满创意的图像。但这些技术在生成超出它们训练时所用分辨率的图像时,往往会受到限制。
为了突破这一难题,我们推出了一种新型工具——分辨率适配器(ResAdapter)。
它是一种专门为扩散模型(比如Stable Diffusion和个性化模型)设计的适配器,能够生成任何分辨率和长宽比的图像。与其它多分辨率生成方法不同,ResAdapter能直接生成动态分辨率的图像,而不是在后期处理中调整静态分辨率的图像。这种方法使得图像处理变得更加高效,避免了重复的去噪步骤和复杂的后期处理流程,显著缩短了处理时间。
在不包含任何训练领域风格信息的情况下,ResAdapter利用广泛的分辨率先验,即使只有0.5M的容量,也能为个性化扩散模型生成不同于原训练领域的高分辨率图像,同时保持原有风格。
大量实验显示,ResAdapter在提高分辨率方面与扩散模型配合得天衣无缝。此外,更多的实验表明,ResAdapter可以与ControlNet、IP-Adapter和LCM-LoRA等其他模块兼容,适用于创建不同分辨率的图像,也可以整合进如ElasticDiffusion这样的多分辨率模型中,高效生成更高清晰度的图像。
项目页面:网页链接
今晚斗胆在清华人工智能联盟群里diss了一位前辈 主要他show的那个机器人我真觉得很low 完全没解释环境感知和精准导航 所以demo看着很灵 其实无法验真 就顺口说了我的方案 毕竟行业巨头已经采纳了 所以怎么说.. 长江后浪推前浪吧..
最近很多朋友说找不到封面图片的时候就去 Catjourney 看看,这也是我们不强调提示词而是强调图片的原因.#ai画图#
不是每个人都有 MJ 账号的,很多时候就是找张好看的图片用就行,没必要自己去生成。
这几天 Catjourney 也在更新,下面是最近更新的图片,欢迎有需求就来看看。
这里访问:catjourney.life
不是每个人都有 MJ 账号的,很多时候就是找张好看的图片用就行,没必要自己去生成。
这几天 Catjourney 也在更新,下面是最近更新的图片,欢迎有需求就来看看。
这里访问:catjourney.life
据他们所说,SD3 在排版质量、美学质量和提示词理解上超过了目前所有的开源模型和商业模型,是目前最强的图片生成模型。
技术报告要点如下:
◆根据人类偏好评估,SD3 在排版质量和对提示的理解程度上,均优于目前最先进的文本生成图像系统,例如 DALL·E 3、Midjourney v6 和 Ideogram v1。
◆提出了新的多模态扩散 Transformer (Multimodal Diffusion Transformer,简称 MMDiT) 架构,其使用独立的权重集分别表示图像和语言。与 SD3 的先前版本相比,该架构改善了系统对文本的理解能力和拼写能力。
◆SD3 8B 大小的模型可以在 GTX 4090 24G 显存上运行。
◆SD3 将发布多个参数规模不等的模型方便在消费级硬件上运行,参数规模从 800M 到 8B 。
◆SD3 架构以 Diffusion Transformer (简称"DiT",参见 Peebles & Xie,2023)为基础。鉴于文本嵌入和图像嵌入在概念上存在较大差异,我们为这两种模态使用了独立的权重集。
◆通过这种方法,信息得以在图像 Token 和文本 Token 之间流动,从而提高了模型生成结果的整体理解力和排版质量。我们在论文中还讨论了如何轻松地将这一架构扩展至视频等多模态场景。
◆SD3 采用了矫正流 (Rectified Flow,简称 RF) 的公式 (Liu et al.,2022;Albergo & Vanden-Eijnden,2022;Lipman et al.,2023),在训练过程中,数据和噪声被连接在一条线性轨迹上。这导致了更直的推理路径,从而可以使用更少的步骤进行采样。
◆扩展矫正流 Transformer 模型:使用重新加权的 RF 公式和 MMDiT 主干网络,对文本到图像的合成任务开展了模型扩展研究。我们训练了一系列模型,其规模从 15 个 。Transformer 块 (4.5 亿参数) 到 38 个块 (80 亿参数) 不等。