关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
尝试了一下Dashtoon 这个 AI 漫画生成应用,发现做的挺成熟的,该有的功能都有,可以一次性生成也给了充分的编辑和自定义空间。#ai画图#

国内的很多小说视频还是手工用各种 AI 工具拼凑的阶段,可以借鉴一下这个产品的实现方式,是个机会。

他的人物一致性是通过内置的非常多人物 Lora 实现的,目前来看这确实是最稳定的方案。

具体的生成逻辑是你输入大概的故事描述,他会为你生成很多个场景描述,你修改确认之后就会根据文字场景描述生成图片和漫画的对话。后两张是我一次性生成的漫画。

这里尝试:网页链接
Beeble AI和纽约大学一起发布的论文,支持一非常低的成本让人物同虚拟环境的光照相融合,效果看起来非常好。#ai#

他们最新的模型还支持从图片和视频中提取非常丰富的深度信息,可以从单个图像中提取反照率、法线、深度、粗糙度、镜面反射和照明等信息。

论文简介:

我们提出了一种新的人像重照明技术——一种融合物理指导架构和预训练框架的协同设计方法。这种方法基于库克-托伦斯(Cook-Torrance)反射模型,我们精心设计了架构,从而能够精准地模拟光线与物体表面的交互效果。

此外,为了解决高质量光源数据稀缺的问题,我们还开发了一种自我监督的预训练策略。通过这种结合了精确物理建模和扩展训练数据集的创新方法,我们为提高重照明效果的真实感设定了新的标准。

论文地址:网页链接歸藏的AI工具箱的微博视频
先别吹sora,ComfyUI+SVD才是你2024年必须掌握的ai视频工具!

周末把comfyui +svd的教程又简化了一下。

操作起来更加简单了,还是图生视频的思路,有兴趣的可以冲。
Vercel昨晚推出了 AI SDK 3.0 ,其中这个生成UI的功能太强了,比之前的V0进步非常大。

比如下面这个演示,可以生成股票交易中的所有可交互组件。感觉很快会有在聊天机器人中展示自动生成组件的产品。

这里试试:https://sdk.vercel.ai/demo
技术发展给公司和组织也带来了「Scaling Law」。

一方面随着AI工具能力越来越强,使用越来越便利,小团队的创造力可能会越来越强,比如说Midjourney实现一亿美金ARR的时候只有十几个人,SORA团队只有13个人。甚至Sam Altman表示可能出现一个人的独角兽公司。其实类似的情况在互联网快速发展的时候也出现过,新技术可以给小组织加很大的杠杆。Instagram被10亿美金收购的时候只有13位员工,WhatAPP被190亿美金收购的时候只有50个左右的工程师。而Gmail也是Google员工在20%灵活时间开发出来的。

另一方面新技术往往可以让更大更多样性的组织变得可能。线上通讯和协作工具让大规模跨国公司效率也提高了,AI显然也可能带来进一步的提升。例如字节内部有一批同声传译用于跨国视频会议时候的翻译,但显然随着AI技术提升,完全可以展望很快我们在视频会议的时候就可以自由选择要听什么语言的音频,每个人都可以听到自己母语的实时音频流了,这势必会把跨国公司的管理能力进一步加强,让更大更强的组织成为可能。

互联网时代的新巨头崛起时,如Google、Amazon、Facebook、Tesla、阿里、腾讯、美团、字节、拼多多等,往往都在组织和文化建设上有很多特点和创新,有时候是创始人个人特点使然,有时候来源于团队的思考和规划。创业者如果致力于成为AI时代的新巨头,这样的思考规划也是必备的。
ComfyUI的LayerDiffusion透明图层生成插件也已经发布了,目前还只支持生成。

插件主要有两个节点,工作流需要用的那个遮罩节点需要安装comfyui-tooling-nodes插件。#ai画图#

插件地址:网页链接
Vercel昨晚推出了 AI SDK 3.0 ,其中这个生成UI的功能太强了,比之前的V0进步非常大。

比如下面这个演示,可以生成股票交易中的所有可交互组件。感觉很快会有在聊天机器人中展示自动生成组件的产品。

这里试试:网页链接歸藏的AI工具箱的微博视频
柔软可爱的 Punyo
与其它硬朗风格的人形机器人相比
这会令人更亲近,讨喜和易接受些
https://mp.weixin.qq.com/s/1Kk6b0v7NhB4tHvezc6qUA
iztro - 一套轻量级的紫微斗数排盘工具库

文档:https://iztro.com
体验:https://ziwei.pub

📄搭建好之后你可以获得如图展示的效果,如果想知道这些数据代表什么意思,可以查看文档

紫微斗数是中国古代的一种算命术数,通常认为可用于性格推演、子女教育、职业规划、社交谈资、择偶等
LayerDiffusion 这个可以直接生成透明背景图片的项目已经可以在forge的扩展上使用了,试了一下确实非常牛批。#ai画图#

不仅支持直接生成透明的图片元素,还支持在已有图片上生成跟环境融合的透明图片,这个就可以做很多事情了。

不得不怀疑老哥只支持forge是为了推广他的项目,哈哈

forge是WebUI的一个分支操作逻辑和交互完全跟Web UI一样不过进行了一些底层修改,让生成速度更快,插件运行时会自动下载模型。

你可以在这里下载LayerDiffusion扩展:网页链接歸藏的AI工具箱的微博视频
和朋友新做了一个 AI 小产品。https://summarize.ing/
上线第一天获取了 6300名自然用户,并且获得了当日 Product Hunt 第 3 名,还获得了 Twitter 大量用户的自然转发,还获得了数名付费用户。
这是我们近期以来,上线当日数据最好的一个产品了。

ProductHunt 链接:https://www.producthunt.com/posts/summarize-ing

产品链接:
https://summarize.ing/
这个真不错,TCD 模型解决了 LCM 模型由于多步采样中累积的错误导致的图像细节丢失和性能下降的问题。#ai画图#

可以快速生成图片,并且保证生成图片的质量和细节。还支持 SDXL 生态的所有内容,比如 Lora 和 Controlnet 。

详细介绍:

潜在一致性模型(Latent Consistency Model, LCM)通过将一致性模型扩展到潜在空间,并利用引导一致性蒸馏技术,在加速文本到图像合成方面取得了令人印象深刻的性能。然而,研究人员观察到LCM在生成清晰且细节精致的图像方面存在困难。

为了解决这一限制,研究人员首先深入研究并阐明了潜在的原因,发现主要问题源自三个不同的领域的错误。因此,他们引入了轨迹一致性蒸馏(Trajectory Consistency Distillation, TCD),包括轨迹一致性函数(Trajectory Consistency Function, TCF)和战略性随机采样(Strategic Stochastic Sampling, SSS)。

轨迹一致性函数通过扩大自我一致性边界条件的范围,减少了蒸馏错误,并使TCD能够准确追踪整个概率流常微分方程(Probability Flow ODE)的轨迹。此外,战略性随机采样专门设计用于规避多步一致性采样中固有的累积错误,这种采样方式被精心设计以补充TCD模型。

实验表明,TCD不仅在低噪声函数评估次数(Number of Function Evaluations, NFEs)时显著提高了图像质量,而且与教师模型相比,在高NFEs时产生了更详细的结果。TCD在低NFEs和高NFEs时都保持了优越的生成质量,甚至超过了带有原始SDXL的DPM-Solver++(2S)的性能。值得注意的是,在训练期间没有额外的鉴别器或LPIPS监督。研究人员展示了在20 NFEs下的一些示例。

与Turbo系列相比,TCD采样的NFEs可以随意变化,而不会对结果质量产生不利影响;与LCMs相比,TCD解决了由于多步采样中累积的错误导致的图像细节丢失和性能下降的问题。

在推理过程中,可以通过调整一个超参数gamma来简单地修改图像的细节水平,这不需要引入任何额外的参数。TCD可以适应社区中基于SDXL的各种扩展和插件,例如LoRA、ControlNet、IP Adapter以及其他基础模型,例如Animagine XL。

项目地址:网页链接

Invalid media: image
Back to Top