关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
央视这个AI视频做得真的很不错。
初步拆解下,这个AI视频的工作流大概是mj+sd+runway/pika,sd有用到animatediff和deforum插件。
央视最近跟疯了一样地拥抱AI,从春晚到专题报道再到实际工作中的素材都在全面拥抱AI,激进得和老大哥稳重形象一点都不符,用的还都是要科学上网才能用的工具…
是有什么kpi吗?
初步拆解下,这个AI视频的工作流大概是mj+sd+runway/pika,sd有用到animatediff和deforum插件。
央视最近跟疯了一样地拥抱AI,从春晚到专题报道再到实际工作中的素材都在全面拥抱AI,激进得和老大哥稳重形象一点都不符,用的还都是要科学上网才能用的工具…
是有什么kpi吗?
终于来了! Midjourney角色一致性功能发布.
下面视频是网站的使用方法和介绍:
这个功能和之前的风格参照很相似,不同之处在于它不是匹配一个特定风格,而是让角色与给定的角色参照图像相符合。
如何使用:
在你输入的指令后面加上 --cref URL,URL是你选择的角色图像的链接。
你还可以用 --cw 来调整参照的“强度”,范围从100到0。
默认的强度是100 (--cw 100),这时会参考人物的脸部、发型和衣着。
如果设置为强度0 (--cw 0),那么系统只会关注脸部(这对于更换服饰或发型很有帮助)。
适用范围:
这个功能最适合用于Midjourney创作的角色图像。不太适合用于真人照片(可能会产生一些扭曲,就像普通图像提示那样)。
Cref的工作方式类似于普通图像提示,但它更专注于角色的特征。
但请注意,这项技术的精确度是有限的,它无法复制极其细微的特征,比如特定的酒窝、雀斑或T恤上的标志。 Cref同样适用于Niji和普通MJ模型,并且可以与--sref一起使用。
高级功能:
你可以使用多个URL,通过 --cref URL1 URL2 的方式来结合多个图像中的角色信息(这和使用多重图像或风格提示类似)。
在web alpha版本中如何操作:
只需将图片拖动或粘贴到想象工具栏,你会看到三个图标。选择这些图标之一,可以设置图片用作图像提示、风格参照或角色参照。如果你想让一张图像同时用于多个类别,只需按住Shift键再选择。
请记住,由于MJ V6目前还处于alpha测试阶段,这个和其他功能可能会有所变化。但不久后,我们会推出官方的V6 beta版。
下面视频是网站的使用方法和介绍:
这个功能和之前的风格参照很相似,不同之处在于它不是匹配一个特定风格,而是让角色与给定的角色参照图像相符合。
如何使用:
在你输入的指令后面加上 --cref URL,URL是你选择的角色图像的链接。
你还可以用 --cw 来调整参照的“强度”,范围从100到0。
默认的强度是100 (--cw 100),这时会参考人物的脸部、发型和衣着。
如果设置为强度0 (--cw 0),那么系统只会关注脸部(这对于更换服饰或发型很有帮助)。
适用范围:
这个功能最适合用于Midjourney创作的角色图像。不太适合用于真人照片(可能会产生一些扭曲,就像普通图像提示那样)。
Cref的工作方式类似于普通图像提示,但它更专注于角色的特征。
但请注意,这项技术的精确度是有限的,它无法复制极其细微的特征,比如特定的酒窝、雀斑或T恤上的标志。 Cref同样适用于Niji和普通MJ模型,并且可以与--sref一起使用。
高级功能:
你可以使用多个URL,通过 --cref URL1 URL2 的方式来结合多个图像中的角色信息(这和使用多重图像或风格提示类似)。
在web alpha版本中如何操作:
只需将图片拖动或粘贴到想象工具栏,你会看到三个图标。选择这些图标之一,可以设置图片用作图像提示、风格参照或角色参照。如果你想让一张图像同时用于多个类别,只需按住Shift键再选择。
请记住,由于MJ V6目前还处于alpha测试阶段,这个和其他功能可能会有所变化。但不久后,我们会推出官方的V6 beta版。
我认为,自动化软件工程的发展轨迹会与自动驾驶类似。以自动驾驶为例,它的发展过程大致可以分为以下几个阶段:
起初,人们完全手动驾驶。
随后,AI开始帮忙控制车辆保持车道。
接着,AI能够根据前车速度调整自己的行驶速度。
之后,AI进一步能够自主变道和选择分叉路口。
然后,AI还能在交通标志和红绿灯前停车,并执行转弯操作。
最终,随着功能的完善和质量的不断提升,实现完全自动驾驶成为可能。
在这个过程中,AI的参与程度越来越高,而人类的直接操作则逐渐减少,但仍需进行监督。软件工程的发展也遵循着类似的模式:
最初,开发者完全手动编写代码。
然后,GitHub Copilot能够自动补全几行代码。
进一步地,ChatGPT可以编写较大的代码块。
之后,我们会处理越来越大的代码差异(例如,Cursor copilot++风格,可以参考这个精彩的演示 网页链接)。
5.... “Devin”是一个非常引人注目的演示,它可能预示着软件工程的下一步发展方向:协调多种开发工具(如终端、浏览器、代码编辑器等)的集成应用,同时人类监督者的角色也逐渐转变为进行更高层次的抽象管理。
在这一过程中,不仅AI技术本身需要大量的工作,用户界面和用户体验设计也同样重要。我们需要思考,开发者如何有效地进行监督?他们需要关注哪些信息?他们如何引导AI朝向不同的发展路径?遇到问题时,他们又该如何进行调试?为了适应这些变化,我们可能需要对代码编辑器进行根本性的改进。
总之,软件工程正处于一个重大变革的时期。在未来,它更可能呈现为监督自动化过程的形式,同时贡献高层次的指令、创意或发展策略,而这一切都将通过英语来实现。
来源:网页链接
这些超级计算集群将用于支持多种人工智能任务,包括培训 Llama 3 大型人工智能模型。Meta 特别强调,他们致力于开放式计算和开源技术,这些集群基于 Grand Teton、OpenRack 和 PyTorch 等平台构建而成。
这些集群设计用于支撑大型和复杂的人工智能模型,着重于提升性能、确保可靠性和扩展能力。
Meta 的策略包括了设计定制化的硬件设备、采用先进的网络解决方案,比如 RDMA over converged Ethernet (RoCE) 和 NVIDIA Quantum2 InfiniBand 网络技术,还有利用 FUSE API 和 Tectonic 分布式存储等技术的优化存储方案。
此外,Meta 也在注重通过软件优化和与框架开发者(例如 PyTorch)合作,使其人工智能集群在最大化性能的同时,也易于使用。
来源:网页链接
Cognition发布首位AI软件工程师Devin,这个演示相当惊艳。#ai#
Devin 是一个自主Agents,它通过使用自己的 shell、代码编辑器和网络浏览器来解决工程任务。
Devin成功通过了知名人工智能公司的实际工程面试,甚至还在 Upwork 上完成了实际工作。
Devin 在无辅助情况下正确解决了 13.86% 的问题, ...
Devin 是一个自主Agents,它通过使用自己的 shell、代码编辑器和网络浏览器来解决工程任务。
Devin成功通过了知名人工智能公司的实际工程面试,甚至还在 Upwork 上完成了实际工作。
Devin 在无辅助情况下正确解决了 13.86% 的问题, ...
Turrit是一款Telegram第三方客户端,默认支持全语言,除原版功能,还包括:
💡Features:
- Upload and download speed boost(上传下载极速,最高提速20倍)
- Pre-send translation through ChatGPT (内置自动翻译器,发送前翻译,支持Chatgpt翻译)
- Set up privacy with just a click to block random people from pulling you into groups. (一键隐私设置,防止陌生人拉群)
- Add friends through QR code scanning (扫二维码快速加好友)
- Hide Stories from chat page (支持移除Story)
⬇Google Play:
https://play.google.com/store/apps/details?id=org.telegram.group
⬇iOS:
https://apps.apple.com/us/app/turrit-messenger-for-telegram/id6471781238
📱 Platform: #Android #iOS
这个利用 3D 制作白膜然后 SD 重绘生成视频的项目,最后的效果非常好,同时作者给了相对详细的操作步骤。#ai视频##ai画图#
下面是他的工作流:
基础渲染:
首先在Cinema 4D软件中创建并动画化了一个3D虚拟角色,这个角色的体型和面部结构都是依照客户的样貌设计的。
我还细致地给这个3D角色做了纹理处理,以便使用EbSynth软件更好地追踪角色身体的不同部位。这里还涉及到了我为角色设计的3D服装,我将它们作为一个独立的渲染通道,在后期合成阶段加入。
AI输出:
接着,我利用了一个AI模型(SD 1.5版本,当然是得到客户许可后进行的)来处理客户的相貌特征,并使用了一个名为Warp Fusion的技术来生成你现在看到的图像序列。使用Warp Fusion的过程非常耗时,主要是因为它需要不断地尝试和调整。
去闪烁:
这是最复杂的一个步骤。我使用EbSynth进行初步处理,然后通过Davinci Resolve和Topaz Video AI软件来平滑化Warp Fusion的输出结果,同时尽量保持细节。
此外,我还使用了Google Research的帧插值工具来优化角色脸部的某些动作(这些动作在EbSynth中无法得到很好的处理),然后在After Effects软件中把这些处理后的画面加入到视频中。
3D服装:
这一步主要是把之前“基础渲染”阶段制作的服装渲染通道加入进来,并尽可能地进行蒙版处理和合成。由于去闪烁过程对角色动作的插值有所改变,所以服装渲染并不完全同步于角色,但效果依然可以接受。
后期处理:
这个步骤主要是在After Effects中进行常规的视频合成工作。
来源:Reddit 用户Jushooter 歸藏的AI工具箱的微博视频
下面是他的工作流:
基础渲染:
首先在Cinema 4D软件中创建并动画化了一个3D虚拟角色,这个角色的体型和面部结构都是依照客户的样貌设计的。
我还细致地给这个3D角色做了纹理处理,以便使用EbSynth软件更好地追踪角色身体的不同部位。这里还涉及到了我为角色设计的3D服装,我将它们作为一个独立的渲染通道,在后期合成阶段加入。
AI输出:
接着,我利用了一个AI模型(SD 1.5版本,当然是得到客户许可后进行的)来处理客户的相貌特征,并使用了一个名为Warp Fusion的技术来生成你现在看到的图像序列。使用Warp Fusion的过程非常耗时,主要是因为它需要不断地尝试和调整。
去闪烁:
这是最复杂的一个步骤。我使用EbSynth进行初步处理,然后通过Davinci Resolve和Topaz Video AI软件来平滑化Warp Fusion的输出结果,同时尽量保持细节。
此外,我还使用了Google Research的帧插值工具来优化角色脸部的某些动作(这些动作在EbSynth中无法得到很好的处理),然后在After Effects软件中把这些处理后的画面加入到视频中。
3D服装:
这一步主要是把之前“基础渲染”阶段制作的服装渲染通道加入进来,并尽可能地进行蒙版处理和合成。由于去闪烁过程对角色动作的插值有所改变,所以服装渲染并不完全同步于角色,但效果依然可以接受。
后期处理:
这个步骤主要是在After Effects中进行常规的视频合成工作。
来源:Reddit 用户Jushooter 歸藏的AI工具箱的微博视频
与其他画笔快速生成图片的尴尬应用不同, Musepro 这个iPad 应用看起来是真的可用了。#ai画图#
借助 iPad 搭配的 Apple Pencil以及内置的丰富笔刷,应该可以极大的提高画图效率。
还支持非常精细的种子和重绘幅度调整,支持图像放大以及分图层绘制。
官网: 网页链接歸藏的AI工具箱的微博视频
借助 iPad 搭配的 Apple Pencil以及内置的丰富笔刷,应该可以极大的提高画图效率。
还支持非常精细的种子和重绘幅度调整,支持图像放大以及分图层绘制。
官网: 网页链接歸藏的AI工具箱的微博视频
这个系统融合了自动解释功能和稀疏自动编码技术(Sparse Autoencoders),使得用户在无需编写代码的情况下就能快速探索和理解各种模型。
它能够同时处理神经网络中的神经元和关注焦点(Attention Heads)。使用这个系统,你可以在模型的前向传播过程中进行干预,比如移除某个特定的神经元,然后观察这样的操作会对结果产生怎样的影响。
简单来说,它提供了一种快速而简便的方法,让我们能够手动地去发现和理解神经网络中的“电路”——这里的“电路”是指神经网络中特定的功能组件和它们之间的联系。
项目地址:网页链接
LaVague 一个开源的浏览器自动化操作 Agents。#ai#
通过提供一个将自然语言查询转化为 Selenium 代码的引擎,LaVague 可让用户或其他人工智能轻松实现自动化,轻松表达网络工作流程并在浏览器上执行。
LaVague的特点:
自然语言处理:理解自然语言指令,执行浏览器交互。
Selenium 集成:与 Selenium 无缝集成,实现网络浏览器自动化。
用于隐私和控制的本地模型支持 Gemma-7b 等本地模型。
项目地址:网页链接歸藏的AI工具箱的微博视频
通过提供一个将自然语言查询转化为 Selenium 代码的引擎,LaVague 可让用户或其他人工智能轻松实现自动化,轻松表达网络工作流程并在浏览器上执行。
LaVague的特点:
自然语言处理:理解自然语言指令,执行浏览器交互。
Selenium 集成:与 Selenium 无缝集成,实现网络浏览器自动化。
用于隐私和控制的本地模型支持 Gemma-7b 等本地模型。
项目地址:网页链接歸藏的AI工具箱的微博视频
终于来了! Midjourney角色一致性功能发布.#ai画图#
下面视频是网站的使用方法和介绍:
这个功能和之前的风格参照很相似,不同之处在于它不是匹配一个特定风格,而是让角色与给定的角色参照图像相符合。
如何使用:
在你输入的指令后面加上 --cref URL,URL是你选择的角色图像的链接。
你还可以用 --cw 来调整参照的“强度”,范围从100到0。
默认的强度是100 (--cw 100),这时会参考人物的脸部、发型和衣着。
如果设置为强度0 (--cw 0),那么系统只会关注脸部(这对于更换服饰或发型很有帮助)。
适用范围:
这个功能最适合用于Midjourney创作的角色图像。不太适合用于真人照片(可能会产生一些扭曲,就像普通图像提示那样)。
Cref的工作方式类似于普通图像提示,但它更专注于角色的特征。
但请注意,这项技术的精确度是有限的,它无法复制极其细微的特征,比如特定的酒窝、雀斑或T恤上的标志。 Cref同样适用于Niji和普通MJ模型,并且可以与--sref一起使用。
高级功能:
你可以使用多个URL,通过 --cref URL1 URL2 的方式来结合多个图像中的角色信息(这和使用多重图像或风格提示类似)。
在web alpha版本中如何操作:
只需将图片拖动或粘贴到想象工具栏,你会看到三个图标。选择这些图标之一,可以设置图片用作图像提示、风格参照或角色参照。如果你想让一张图像同时用于多个类别,只需按住Shift键再选择。
请记住,由于MJ V6目前还处于alpha测试阶段,这个和其他功能可能会有所变化。但不久后,我们会推出官方的V6 beta版。 歸藏的AI工具箱的微博视频
下面视频是网站的使用方法和介绍:
这个功能和之前的风格参照很相似,不同之处在于它不是匹配一个特定风格,而是让角色与给定的角色参照图像相符合。
如何使用:
在你输入的指令后面加上 --cref URL,URL是你选择的角色图像的链接。
你还可以用 --cw 来调整参照的“强度”,范围从100到0。
默认的强度是100 (--cw 100),这时会参考人物的脸部、发型和衣着。
如果设置为强度0 (--cw 0),那么系统只会关注脸部(这对于更换服饰或发型很有帮助)。
适用范围:
这个功能最适合用于Midjourney创作的角色图像。不太适合用于真人照片(可能会产生一些扭曲,就像普通图像提示那样)。
Cref的工作方式类似于普通图像提示,但它更专注于角色的特征。
但请注意,这项技术的精确度是有限的,它无法复制极其细微的特征,比如特定的酒窝、雀斑或T恤上的标志。 Cref同样适用于Niji和普通MJ模型,并且可以与--sref一起使用。
高级功能:
你可以使用多个URL,通过 --cref URL1 URL2 的方式来结合多个图像中的角色信息(这和使用多重图像或风格提示类似)。
在web alpha版本中如何操作:
只需将图片拖动或粘贴到想象工具栏,你会看到三个图标。选择这些图标之一,可以设置图片用作图像提示、风格参照或角色参照。如果你想让一张图像同时用于多个类别,只需按住Shift键再选择。
请记住,由于MJ V6目前还处于alpha测试阶段,这个和其他功能可能会有所变化。但不久后,我们会推出官方的V6 beta版。 歸藏的AI工具箱的微博视频
其实有个非常简单的办法来缓解焦虑提升认知
1.简单来说就是选定一个你认为的值得学习的人(初学者最好选择公认的比你厉害很多的人。)
2.不用经过ta的允许当ta的远程助理。
3.跟着ta学习至少三个月基本你的感觉就培养起来了
4.此方法也适合出海、调研某个群体等
怎么当其实很简单,在推特上选择你想要关注的某个领域的人,然后每隔一段时间查看回复栏就行。
这里面的逻辑是评论是所有用户行为最花时间也最有价值的,尤其是财富水平或者科研水平在世界顶尖的人都愿意花时间评论的内容是不是值得你花一点点时间了解一下呢?
当然这么做最大的好处是了解未知的未知,你可以把你关注的人的每一次评论和转发都当做是你的老板带你去见“某件事”并且你不需要做任何事。很多未知的未知都会随着你关注的人的高频转发和评论在你记忆中变成已知的未知,再之后就看你的热情有多高了。
a16z 合伙人 Martin Casado 的演讲主要举例阐述 AI 将催生新一轮技术革命和产业变革。他们确实挺看重 AI 新募集了 70 亿美元的产业基金,相当一部分专注于 AI 应用。
不是给内行讲的,煽动性挺强,可以学一下他的表述方法。
我整理了一个文字版,翻译了视频,可以选择自己喜欢的方式观看。
文字版:
人工智能新浪潮的激动人心的经济学
人工智能已经存在很长时间了,在解决各种曾被认为是人类智能领域的问题方面有着成功的历史。从20世纪50年代和60年代用于医疗诊断的专家系统,到80年代和90年代在国际象棋中击败俄罗斯人,再到图像检测和机器人技术,人工智能已经在一系列应用中证明了其能力。在许多情况下,人工智能解决方案甚至超越了人类的表现。
尽管如此,投资界对缺乏类似于移动和互联网的平台转变感到困惑。研究指出了几个原因,包括许多人工智能解决方案的利基性质、某些应用(如机器人技术)中正确性的高度重要性、某些情况下对硬件的需求,以及人工智能常常与人脑令人难以置信的效率和低成本竞争的事实。
然而,当前的人工智能浪潮,其特点是大型模型或基础模型,在经济学方面有着根本的不同。这些模型可以从简单的输入生成图像、文本、对话等。它们擅长以前人工智能未涉及的领域,如创造力、自然语言推理,以及充当普通在线任务的 "副驾驶"。
阻碍传统人工智能应用的原因不适用于这些新模型。它们的应用市场是巨大的,在许多情况下正确性不是大问题,使用案例主要是基于软件的,最令人惊讶的是,计算机在曾经被认为是人类独有的任务上远比人类更便宜和更好。例如,使用人工智能将自己生成为皮克斯角色的图像成本约为1/100美分,只需一秒钟,而雇佣一名图形艺术家每小时需要100美元。类似地,使用人工智能语言模型来理解复杂的法律文件比与律师合作要便宜四到五个数量级,而且速度更快。
这种经济错位正在推动互联网历史上增长最快的公司。历史上,这种边际成本的下降创造了平台转变并改变了行业,正如微芯片将计算成本降至零,互联网将分销成本降至零一样。大型模型现在正在将图像生成和语言理解等广泛领域的创作边际成本降至零。
虽然这种经济破坏会引起人们对就业错位的担忧,但微芯片和互联网时代的经验表明,如果需求是有弹性的,正如计算和分销的情况一样,总吞吐量和使用量会大幅增加,从而导致增长扩大,而不是失业。人工智能的这一新浪潮可能也会发生同样的情况。
我们正处于标志性公司新时代的风口浪尖,这不仅是由开创性技术推动的,也是由令人信服的经济案例推动的。尽管具体结果难以预测,但我们可以从社会秩序、创造力和生产力等领域的变化中瞥见未来。有史以来第一次,经济上可行的具身AGI成为现实,可以解决现实世界的问题。
充分发挥这一人工智能浪潮的潜力将需要风险投资界、科技界和华盛顿政策制定者之间的伙伴关系和合作。这是一个令人兴奋的时刻,我们都应该为人工智能在未来几年的变革性影响做好准备。
视频链接:https://www.youtube.com/watch?v=gKvVcEAua7s&t=26s
Invalid media: video
不是给内行讲的,煽动性挺强,可以学一下他的表述方法。
我整理了一个文字版,翻译了视频,可以选择自己喜欢的方式观看。
文字版:
人工智能新浪潮的激动人心的经济学
人工智能已经存在很长时间了,在解决各种曾被认为是人类智能领域的问题方面有着成功的历史。从20世纪50年代和60年代用于医疗诊断的专家系统,到80年代和90年代在国际象棋中击败俄罗斯人,再到图像检测和机器人技术,人工智能已经在一系列应用中证明了其能力。在许多情况下,人工智能解决方案甚至超越了人类的表现。
尽管如此,投资界对缺乏类似于移动和互联网的平台转变感到困惑。研究指出了几个原因,包括许多人工智能解决方案的利基性质、某些应用(如机器人技术)中正确性的高度重要性、某些情况下对硬件的需求,以及人工智能常常与人脑令人难以置信的效率和低成本竞争的事实。
然而,当前的人工智能浪潮,其特点是大型模型或基础模型,在经济学方面有着根本的不同。这些模型可以从简单的输入生成图像、文本、对话等。它们擅长以前人工智能未涉及的领域,如创造力、自然语言推理,以及充当普通在线任务的 "副驾驶"。
阻碍传统人工智能应用的原因不适用于这些新模型。它们的应用市场是巨大的,在许多情况下正确性不是大问题,使用案例主要是基于软件的,最令人惊讶的是,计算机在曾经被认为是人类独有的任务上远比人类更便宜和更好。例如,使用人工智能将自己生成为皮克斯角色的图像成本约为1/100美分,只需一秒钟,而雇佣一名图形艺术家每小时需要100美元。类似地,使用人工智能语言模型来理解复杂的法律文件比与律师合作要便宜四到五个数量级,而且速度更快。
这种经济错位正在推动互联网历史上增长最快的公司。历史上,这种边际成本的下降创造了平台转变并改变了行业,正如微芯片将计算成本降至零,互联网将分销成本降至零一样。大型模型现在正在将图像生成和语言理解等广泛领域的创作边际成本降至零。
虽然这种经济破坏会引起人们对就业错位的担忧,但微芯片和互联网时代的经验表明,如果需求是有弹性的,正如计算和分销的情况一样,总吞吐量和使用量会大幅增加,从而导致增长扩大,而不是失业。人工智能的这一新浪潮可能也会发生同样的情况。
我们正处于标志性公司新时代的风口浪尖,这不仅是由开创性技术推动的,也是由令人信服的经济案例推动的。尽管具体结果难以预测,但我们可以从社会秩序、创造力和生产力等领域的变化中瞥见未来。有史以来第一次,经济上可行的具身AGI成为现实,可以解决现实世界的问题。
充分发挥这一人工智能浪潮的潜力将需要风险投资界、科技界和华盛顿政策制定者之间的伙伴关系和合作。这是一个令人兴奋的时刻,我们都应该为人工智能在未来几年的变革性影响做好准备。
视频链接:https://www.youtube.com/watch?v=gKvVcEAua7s&t=26s
Invalid media: video
最近半年 all in A.I.,朋友们一直在让我做一下总结和分享。昨天在@yusen 的场地支持下,和一帮产品人共同探索了 Stable Diffusion 的底层原理以及发展历程。后半部分还有这半年自己学习 AI 的方法和感悟,希望对各位产品、运营、设计等非研发岗的朋友们能有帮助。