关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
只需要一张 24GB 内存的消费级 GPU(RTX 4090),就可以预训练 Llama 7B 大语言模型。
详细介绍:
训练大语言模型 (Large Language Models, LLMs) 面临着显著的内存挑战,主要是由于权重和优化器状态 ...
还记得DragGAN吗?可以拖动锚点进行图像编辑,当时代码发布以后大家发现生成速度慢,而且不能自己自定义外部图片就没人理了。
现在又有一个StableDrag,是基于Diffusion 模型的,也可以完成类似的拖动锚点编辑图片的能力。如果真的跟演示的效果一样的话,那图片编辑就太方便了。#ai画图#
论文简介:
自 DragGAN 出现以来,基于点的图像编辑引起了显著的关注。最近,DragDiffusion 通过将这种拖动技术适配到扩散模型中,进一步推进了生成质量。尽管取得了巨大成功,但这种拖动方案存在两个主要缺点:不准确的点跟踪和不完整的运动监督,这可能导致拖动效果不理想。
为了解决这些问题,我们设计了一种判别式点跟踪方法和一种基于置信度的潜在增强策略,构建了一个稳定和精确的基于拖动的编辑框架,称为 StableDrag。其中,判别式点跟踪方法允许我们精确定位更新的控制点,从而提高长距离操作的稳定性;而基于置信度的潜在增强策略则负责确保优化后的潜在表示在所有操作步骤中都尽可能保持高质量。
得益于这些独特的设计,我们实现了两种类型的图像编辑模型:StableDrag-GAN 和 StableDrag-Diff。通过在 DragBench 上进行广泛的定性实验和定量评估,证明了这两种模型能够实现更稳定的拖动性能。
项目地址:网页链接歸藏的AI工具箱的微博视频
现在又有一个StableDrag,是基于Diffusion 模型的,也可以完成类似的拖动锚点编辑图片的能力。如果真的跟演示的效果一样的话,那图片编辑就太方便了。#ai画图#
论文简介:
自 DragGAN 出现以来,基于点的图像编辑引起了显著的关注。最近,DragDiffusion 通过将这种拖动技术适配到扩散模型中,进一步推进了生成质量。尽管取得了巨大成功,但这种拖动方案存在两个主要缺点:不准确的点跟踪和不完整的运动监督,这可能导致拖动效果不理想。
为了解决这些问题,我们设计了一种判别式点跟踪方法和一种基于置信度的潜在增强策略,构建了一个稳定和精确的基于拖动的编辑框架,称为 StableDrag。其中,判别式点跟踪方法允许我们精确定位更新的控制点,从而提高长距离操作的稳定性;而基于置信度的潜在增强策略则负责确保优化后的潜在表示在所有操作步骤中都尽可能保持高质量。
得益于这些独特的设计,我们实现了两种类型的图像编辑模型:StableDrag-GAN 和 StableDrag-Diff。通过在 DragBench 上进行广泛的定性实验和定量评估,证明了这两种模型能够实现更稳定的拖动性能。
项目地址:网页链接歸藏的AI工具箱的微博视频
1、各GPU云算力提供商所提供的算力,质量差异之巨大,已经可以称为“硬件盲盒”了(hardware lottery),你完全无法预测自己租用的GPU集群的算力质量和运行情况;
2、作者亲身经历过各种质量的集群,从虽然有点毛病但总体上修修补补能持续跑,到每隔几个小时就宕机完全不能用的都有;
3、主要的问题不在单卡,而是不同云算力提供商组织单卡的方式(cabling)、I/O、文件系统等方面,有些集训甚至需要你自己重新写一个软件层才能跑起来;
4、云算力服务商提供服务质量不一,交付周期无法控制,客服水平和态度也是有好有坏,有的甚至会误删你的checkpoints....;
5、不同的集群Model Flop Utilisation (MFU) 表现不一致,且差异不可忽略,导致集群的理论算力利用不充分。
挺接地气的一篇文章,相信不少创业的小伙伴也或多或少遇到过相同的问题。希望能看到国内团队的类似经验分享,大家看了能少走弯路。此外,我很好奇的是,如果美国startups所面对的商用cluster市场都是如此的话,我们国内的各种“超算中心”、“大规模人工智能计算集群”的实际服务质量和MFU又是如何呢?国资委一纸令下,国央企已经开始动起来要大干快上建设算力了,这些算力,未来又将会是何种结果呢?
原文链接:https://www.yitay.net/blog/training-great-llms-entirely-from-ground-zero-in-the-wilderness
Image generated by Dall-E
Midjourney 今天上线了/describe,也就是 V6 版本的图片提示词生成能力,图片分析能力比 V5 的强很多。#ai#
然后发现 alpha 网站居然也可以使用/describe了,就是藏的比较深,于是录了一个视频演示一下。
生成的提示词会包括三部分第一部分是主体,然后是艺术家风格和描述词。
主体的部分通常会一次生成四条,不要全部用,描述词和艺术家的部分可以按需选择。
这里使用 alpha 网站,需要用 MJ 生成超过 1000 张图:网页链接歸藏的AI工具箱的微博视频
然后发现 alpha 网站居然也可以使用/describe了,就是藏的比较深,于是录了一个视频演示一下。
生成的提示词会包括三部分第一部分是主体,然后是艺术家风格和描述词。
主体的部分通常会一次生成四条,不要全部用,描述词和艺术家的部分可以按需选择。
这里使用 alpha 网站,需要用 MJ 生成超过 1000 张图:网页链接歸藏的AI工具箱的微博视频
代码:https://github.com/myshell-ai/MeloTTS
体验:https://huggingface.co/spaces/mrfakename/MeloTTS
哥飞给大家介绍下,目前 MeloTTS 支持英语、西班牙语、法语、中文、日语和韩语,号称是目前最好的高质量多语言文本转语音库。
还支持中英混杂,有点优秀哦。
语义空间理论是一种用于理解情感的前沿方法,它采用计算方法和数据驱动的手段来绘制我们情感的全谱。
这种理论认为情感是高维的,并且可以通过数据驱动的统计建模来映射。
SST的方法揭示了三个主要的见解:情感是高维的,情感类别并非离散的,而是多样且经常混合的;特定的情感是真实存在的,并且它们组织了情感行为。
SST的研究表明,价值和唤醒只能捕捉到情感状态评分变化的一小部分,而情感类别的评分几乎可以捕捉到价值和唤醒的全部变化。因此,Hume公司的表情测量模型提供的输出与情感类别(如恐惧、胜利和悲伤)相对应,而不是试图将它们简化为底层维度。
SST为情感科学提供了一种数据驱动、计算方法,克服了现有方法的限制,并为情感的科学研究提供了一个框架,承认人类经验和情感的全部复杂性。
详情:网页链接
Inflection-2.5 接近 GPT-4 的性能,但仅使用了 40% 的计算量用于训练。
我们在编码和数学等智商领域取得了特别的进步。
Pi 现在还融入了世界一流的实时网络搜索功能,以确保用户获得高质量的突发新闻和最新信息。
Inflection-1 使用的训练 FLOP 约为 GPT-4 的 4%,平均而言,在各种 IQ 导向的任务中,其表现约为 GPT-4 水平的 72%。现在为 Pi 提供支持的 Inflection-2.5,尽管只使用了 40% 的训练 FLOP,但其平均性能却达到了 GPT-4 的 94% 以上。
详细信息:网页链接
以下是我在做和想做的一些产品,大家有什么偏好或建议吗?👇
1. 套壳对话/画图/generator, trys.ai
2. RAG 联网搜索, thinkany.ai
3. 信息处理文章/音频/视频/pdf解析与摘要, zknown.ai, readknown.cn
4. 群聊总结/群管理工具, chatsum.ai
5. 取名智能体服务, namep.ing
6. GPTs 导航站, gpts.works
7. AI 通用导航站, aix.ing
8. 一键发布文章/视频/动态,提交产品工具, onepub.io
9. AI 数字人,声音转换/数字人克隆/复活,整合 heygen / whisper 的一些能力
10. 智能体工作流编排平台,类似 dify/fastgpt/coze
11. 代码生成平台,text-to-code,类似 v0.dev
12. 视频创作者工具,text->脚本->插画->视频->发布
13. AI 音乐播放器,类似网易云音乐,播放 suno AI 生成的音乐
1. 套壳对话/画图/generator, trys.ai
2. RAG 联网搜索, thinkany.ai
3. 信息处理文章/音频/视频/pdf解析与摘要, zknown.ai, readknown.cn
4. 群聊总结/群管理工具, chatsum.ai
5. 取名智能体服务, namep.ing
6. GPTs 导航站, gpts.works
7. AI 通用导航站, aix.ing
8. 一键发布文章/视频/动态,提交产品工具, onepub.io
9. AI 数字人,声音转换/数字人克隆/复活,整合 heygen / whisper 的一些能力
10. 智能体工作流编排平台,类似 dify/fastgpt/coze
11. 代码生成平台,text-to-code,类似 v0.dev
12. 视频创作者工具,text->脚本->插画->视频->发布
13. AI 音乐播放器,类似网易云音乐,播放 suno AI 生成的音乐
每天一个优化,Catjourney.life 现在不需要跳转详情页复制提示词了,直接在对应页面就可以复制。移动端也做了对应的处理。
Framer 时不时就给个惊喜,经常出一些神奇 bug,做组件十分钟,修 Bug 两小时。 歸藏的AI工具箱的微博视频
Framer 时不时就给个惊喜,经常出一些神奇 bug,做组件十分钟,修 Bug 两小时。 歸藏的AI工具箱的微博视频