关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
和 @然后好奇屋 一起搞了个 ComfyUI 插件,在你生成图片/视频时,会随机出现一只猫咪跳舞。
⭐️ 项目地址:https://github.com/jw782cn/ComfyUI-Catcat
⭐️ 这是我们的第一个 ComfyUI 插件,如果你喜欢的话,请在 GitHub 上帮我们点一颗星星。🙇♀️🙇♂️
Invalid media: video
⭐️ 项目地址:https://github.com/jw782cn/ComfyUI-Catcat
⭐️ 这是我们的第一个 ComfyUI 插件,如果你喜欢的话,请在 GitHub 上帮我们点一颗星星。🙇♀️🙇♂️
Invalid media: video
我们正处于标志性公司新时代的风口浪尖,这不仅是由开创性技术推动的,也是由令人信服的经济案例推动的。尽管具体结果难以预测,但我们可以从社会秩序、创造力和生产力等领域的变化中瞥见未来。有史以来第一次,经济上可行的具身AGI成为现实,可以解决现实世界的问题。
充分发挥这一人工智能浪潮的潜力将需要风险投资界、科技界和华盛顿政策制定者之间的伙伴关系和合作。这是一个令人兴奋的时刻,我们都应该为人工智能在未来几年的变革性影响做好准备。
视频链接:网页链接歸藏的AI工具箱的微博视频
充分发挥这一人工智能浪潮的潜力将需要风险投资界、科技界和华盛顿政策制定者之间的伙伴关系和合作。这是一个令人兴奋的时刻,我们都应该为人工智能在未来几年的变革性影响做好准备。
视频链接:网页链接歸藏的AI工具箱的微博视频
a16z 合伙人 Martin Casado 的演讲主要举例阐述 AI 将催生新一轮技术革命和产业变革。他们确实挺看重 AI 新募集了 70 亿美元的产业基金,相当一部分专注于 AI 应用。
不是给内行讲的,煽动性挺强,可以学一下他的表述方法。
我整理了一个文字版,翻译了视频,可以选择自己喜欢的方式观看。
文字版:
人工智能新浪潮的激动人心的经济学
人工智能已经存在很长时间了,在解决各种曾被认为是人类智能领域的问题方面有着成功的历史。从20世纪50年代和60年代用于医疗诊断的专家系统,到80年代和90年代在国际象棋中击败俄罗斯人,再到图像检测和机器人技术,人工智能已经在一系列应用中证明了其能力。在许多情况下,人工智能解决方案甚至超越了人类的表现。
尽管如此,投资界对缺乏类似于移动和互联网的平台转变感到困惑。研究指出了几个原因,包括许多人工智能解决方案的利基性质、某些应用(如机器人技术)中正确性的高度重要性、某些情况下对硬件的需求,以及人工智能常常与人脑令人难以置信的效率和低成本竞争的事实。
然而,当前的人工智能浪潮,其特点是大型模型或基础模型,在经济学方面有着根本的不同。这些模型可以从简单的输入生成图像、文本、对话等。它们擅长以前人工智能未涉及的领域,如创造力、自然语言推理,以及充当普通在线任务的 "副驾驶"。
阻碍传统人工智能应用的原因不适用于这些新模型。它们的应用市场是巨大的,在许多情况下正确性不是大问题,使用案例主要是基于软件的,最令人惊讶的是,计算机在曾经被认为是人类独有的任务上远比人类更便宜和更好。例如,使用人工智能将自己生成为皮克斯角色的图像成本约为1/100美分,只需一秒钟,而雇佣一名图形艺术家每小时需要100美元。类似地,使用人工智能语言模型来理解复杂的法律文件比与律师合作要便宜四到五个数量级,而且速度更快。
这种经济错位正在推动互联网历史上增长最快的公司。历史上,这种边际成本的下降创造了平台转变并改变了行业,正如微芯片将计算成本降至零,互联网将分销成本降至零一样。大型模型现在正在将图像生成和语言理解等广泛领域的创作边际成本降至零。
虽然这种经济破坏会引起人们对就业错位的担忧,但微芯片和互联网时代的经验表明,如果需求是有弹性的,正如计算和分销的情况一样,总吞吐量和使用量会大幅增加,从而导致增长扩大,而不是失业。人工智能的这一新浪潮可能也会发生同样的情况。
不是给内行讲的,煽动性挺强,可以学一下他的表述方法。
我整理了一个文字版,翻译了视频,可以选择自己喜欢的方式观看。
文字版:
人工智能新浪潮的激动人心的经济学
人工智能已经存在很长时间了,在解决各种曾被认为是人类智能领域的问题方面有着成功的历史。从20世纪50年代和60年代用于医疗诊断的专家系统,到80年代和90年代在国际象棋中击败俄罗斯人,再到图像检测和机器人技术,人工智能已经在一系列应用中证明了其能力。在许多情况下,人工智能解决方案甚至超越了人类的表现。
尽管如此,投资界对缺乏类似于移动和互联网的平台转变感到困惑。研究指出了几个原因,包括许多人工智能解决方案的利基性质、某些应用(如机器人技术)中正确性的高度重要性、某些情况下对硬件的需求,以及人工智能常常与人脑令人难以置信的效率和低成本竞争的事实。
然而,当前的人工智能浪潮,其特点是大型模型或基础模型,在经济学方面有着根本的不同。这些模型可以从简单的输入生成图像、文本、对话等。它们擅长以前人工智能未涉及的领域,如创造力、自然语言推理,以及充当普通在线任务的 "副驾驶"。
阻碍传统人工智能应用的原因不适用于这些新模型。它们的应用市场是巨大的,在许多情况下正确性不是大问题,使用案例主要是基于软件的,最令人惊讶的是,计算机在曾经被认为是人类独有的任务上远比人类更便宜和更好。例如,使用人工智能将自己生成为皮克斯角色的图像成本约为1/100美分,只需一秒钟,而雇佣一名图形艺术家每小时需要100美元。类似地,使用人工智能语言模型来理解复杂的法律文件比与律师合作要便宜四到五个数量级,而且速度更快。
这种经济错位正在推动互联网历史上增长最快的公司。历史上,这种边际成本的下降创造了平台转变并改变了行业,正如微芯片将计算成本降至零,互联网将分销成本降至零一样。大型模型现在正在将图像生成和语言理解等广泛领域的创作边际成本降至零。
虽然这种经济破坏会引起人们对就业错位的担忧,但微芯片和互联网时代的经验表明,如果需求是有弹性的,正如计算和分销的情况一样,总吞吐量和使用量会大幅增加,从而导致增长扩大,而不是失业。人工智能的这一新浪潮可能也会发生同样的情况。
只需要一张 24GB 内存的消费级 GPU(RTX 4090),就可以预训练 Llama 7B 大语言模型。
详细介绍:
训练大语言模型 (Large Language Models, LLMs) 面临着显著的内存挑战,主要是由于权重和优化器状态 ...
还记得DragGAN吗?可以拖动锚点进行图像编辑,当时代码发布以后大家发现生成速度慢,而且不能自己自定义外部图片就没人理了。
现在又有一个StableDrag,是基于Diffusion 模型的,也可以完成类似的拖动锚点编辑图片的能力。如果真的跟演示的效果一样的话,那图片编辑就太方便了。#ai画图#
论文简介:
自 DragGAN 出现以来,基于点的图像编辑引起了显著的关注。最近,DragDiffusion 通过将这种拖动技术适配到扩散模型中,进一步推进了生成质量。尽管取得了巨大成功,但这种拖动方案存在两个主要缺点:不准确的点跟踪和不完整的运动监督,这可能导致拖动效果不理想。
为了解决这些问题,我们设计了一种判别式点跟踪方法和一种基于置信度的潜在增强策略,构建了一个稳定和精确的基于拖动的编辑框架,称为 StableDrag。其中,判别式点跟踪方法允许我们精确定位更新的控制点,从而提高长距离操作的稳定性;而基于置信度的潜在增强策略则负责确保优化后的潜在表示在所有操作步骤中都尽可能保持高质量。
得益于这些独特的设计,我们实现了两种类型的图像编辑模型:StableDrag-GAN 和 StableDrag-Diff。通过在 DragBench 上进行广泛的定性实验和定量评估,证明了这两种模型能够实现更稳定的拖动性能。
项目地址:网页链接歸藏的AI工具箱的微博视频
现在又有一个StableDrag,是基于Diffusion 模型的,也可以完成类似的拖动锚点编辑图片的能力。如果真的跟演示的效果一样的话,那图片编辑就太方便了。#ai画图#
论文简介:
自 DragGAN 出现以来,基于点的图像编辑引起了显著的关注。最近,DragDiffusion 通过将这种拖动技术适配到扩散模型中,进一步推进了生成质量。尽管取得了巨大成功,但这种拖动方案存在两个主要缺点:不准确的点跟踪和不完整的运动监督,这可能导致拖动效果不理想。
为了解决这些问题,我们设计了一种判别式点跟踪方法和一种基于置信度的潜在增强策略,构建了一个稳定和精确的基于拖动的编辑框架,称为 StableDrag。其中,判别式点跟踪方法允许我们精确定位更新的控制点,从而提高长距离操作的稳定性;而基于置信度的潜在增强策略则负责确保优化后的潜在表示在所有操作步骤中都尽可能保持高质量。
得益于这些独特的设计,我们实现了两种类型的图像编辑模型:StableDrag-GAN 和 StableDrag-Diff。通过在 DragBench 上进行广泛的定性实验和定量评估,证明了这两种模型能够实现更稳定的拖动性能。
项目地址:网页链接歸藏的AI工具箱的微博视频
1、各GPU云算力提供商所提供的算力,质量差异之巨大,已经可以称为“硬件盲盒”了(hardware lottery),你完全无法预测自己租用的GPU集群的算力质量和运行情况;
2、作者亲身经历过各种质量的集群,从虽然有点毛病但总体上修修补补能持续跑,到每隔几个小时就宕机完全不能用的都有;
3、主要的问题不在单卡,而是不同云算力提供商组织单卡的方式(cabling)、I/O、文件系统等方面,有些集训甚至需要你自己重新写一个软件层才能跑起来;
4、云算力服务商提供服务质量不一,交付周期无法控制,客服水平和态度也是有好有坏,有的甚至会误删你的checkpoints....;
5、不同的集群Model Flop Utilisation (MFU) 表现不一致,且差异不可忽略,导致集群的理论算力利用不充分。
挺接地气的一篇文章,相信不少创业的小伙伴也或多或少遇到过相同的问题。希望能看到国内团队的类似经验分享,大家看了能少走弯路。此外,我很好奇的是,如果美国startups所面对的商用cluster市场都是如此的话,我们国内的各种“超算中心”、“大规模人工智能计算集群”的实际服务质量和MFU又是如何呢?国资委一纸令下,国央企已经开始动起来要大干快上建设算力了,这些算力,未来又将会是何种结果呢?
原文链接:https://www.yitay.net/blog/training-great-llms-entirely-from-ground-zero-in-the-wilderness
Image generated by Dall-E
Midjourney 今天上线了/describe,也就是 V6 版本的图片提示词生成能力,图片分析能力比 V5 的强很多。#ai#
然后发现 alpha 网站居然也可以使用/describe了,就是藏的比较深,于是录了一个视频演示一下。
生成的提示词会包括三部分第一部分是主体,然后是艺术家风格和描述词。
主体的部分通常会一次生成四条,不要全部用,描述词和艺术家的部分可以按需选择。
这里使用 alpha 网站,需要用 MJ 生成超过 1000 张图:网页链接歸藏的AI工具箱的微博视频
然后发现 alpha 网站居然也可以使用/describe了,就是藏的比较深,于是录了一个视频演示一下。
生成的提示词会包括三部分第一部分是主体,然后是艺术家风格和描述词。
主体的部分通常会一次生成四条,不要全部用,描述词和艺术家的部分可以按需选择。
这里使用 alpha 网站,需要用 MJ 生成超过 1000 张图:网页链接歸藏的AI工具箱的微博视频
代码:https://github.com/myshell-ai/MeloTTS
体验:https://huggingface.co/spaces/mrfakename/MeloTTS
哥飞给大家介绍下,目前 MeloTTS 支持英语、西班牙语、法语、中文、日语和韩语,号称是目前最好的高质量多语言文本转语音库。
还支持中英混杂,有点优秀哦。
语义空间理论是一种用于理解情感的前沿方法,它采用计算方法和数据驱动的手段来绘制我们情感的全谱。
这种理论认为情感是高维的,并且可以通过数据驱动的统计建模来映射。
SST的方法揭示了三个主要的见解:情感是高维的,情感类别并非离散的,而是多样且经常混合的;特定的情感是真实存在的,并且它们组织了情感行为。
SST的研究表明,价值和唤醒只能捕捉到情感状态评分变化的一小部分,而情感类别的评分几乎可以捕捉到价值和唤醒的全部变化。因此,Hume公司的表情测量模型提供的输出与情感类别(如恐惧、胜利和悲伤)相对应,而不是试图将它们简化为底层维度。
SST为情感科学提供了一种数据驱动、计算方法,克服了现有方法的限制,并为情感的科学研究提供了一个框架,承认人类经验和情感的全部复杂性。
详情:网页链接
Inflection-2.5 接近 GPT-4 的性能,但仅使用了 40% 的计算量用于训练。
我们在编码和数学等智商领域取得了特别的进步。
Pi 现在还融入了世界一流的实时网络搜索功能,以确保用户获得高质量的突发新闻和最新信息。
Inflection-1 使用的训练 FLOP 约为 GPT-4 的 4%,平均而言,在各种 IQ 导向的任务中,其表现约为 GPT-4 水平的 72%。现在为 Pi 提供支持的 Inflection-2.5,尽管只使用了 40% 的训练 FLOP,但其平均性能却达到了 GPT-4 的 94% 以上。
详细信息:网页链接