关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
华为发布 DiT 架构的图像生成模型,可以直出 4K 分辨率图像。#ai画图#

论文简介:

我们引入了 PixArt-\Sigma,一个能够直接生成 4K 分辨率图像的 Diffusion Transformer (Diffusion Transformer, DiT) 模型。相比其前身 PixArt-\alpha,PixArt-\Sigma 有了显著进步,提供了明显更高保真度的图像,并改进了与文本提示的一致性。

PixArt-\Sigma 的一个关键特点是其训练效率。借助 PixArt-\alpha 的基础预训练,它通过合并更高质量的数据,从"较弱"的基线演变为"较强"的模型,我们将这个过程称为"弱到强训练"。PixArt-\Sigma 的进步主要体现在两个方面:

高质量训练数据:PixArt-\Sigma 结合了更高质量的图像数据,与更精确和详细的图像标题配对。

高效的 Token 压缩:我们在 DiT 框架内提出了一个新的注意力模块,可以压缩键 (Key) 和值 (Value),显著提高效率,并促进超高分辨率图像生成。

得益于这些改进,PixArt-\Sigma 以显著较小的模型规模 (6 亿参数) 实现了优于现有文本到图像扩散模型 (如 SDXL (26 亿参数) 和 SD Cascade (51 亿参数)) 的图像质量和用户提示遵从能力。

此外,PixArt-\Sigma 生成 4K 图像的能力支持创建高分辨率海报和壁纸,有效地增强了电影和游戏等行业中高质量视觉内容的制作。

项目地址:网页链接
昨天比较重要的一篇论文,通过他们的方案可以在整个大语言模型训练过程中显著降低内存占用。#ai#

只需要一张 24GB 内存的消费级 GPU(RTX 4090),就可以预训练 Llama 7B 大语言模型。

详细介绍:

训练大语言模型 (Large Language Models, LLMs) 面临着显著的内存挑战,主要是由于权重和优化器状态 ...
还记得DragGAN吗?可以拖动锚点进行图像编辑,当时代码发布以后大家发现生成速度慢,而且不能自己自定义外部图片就没人理了。

现在又有一个StableDrag,是基于Diffusion 模型的,也可以完成类似的拖动锚点编辑图片的能力。如果真的跟演示的效果一样的话,那图片编辑就太方便了。#ai画图#

论文简介:

自 DragGAN 出现以来,基于点的图像编辑引起了显著的关注。最近,DragDiffusion 通过将这种拖动技术适配到扩散模型中,进一步推进了生成质量。尽管取得了巨大成功,但这种拖动方案存在两个主要缺点:不准确的点跟踪和不完整的运动监督,这可能导致拖动效果不理想。

为了解决这些问题,我们设计了一种判别式点跟踪方法和一种基于置信度的潜在增强策略,构建了一个稳定和精确的基于拖动的编辑框架,称为 StableDrag。其中,判别式点跟踪方法允许我们精确定位更新的控制点,从而提高长距离操作的稳定性;而基于置信度的潜在增强策略则负责确保优化后的潜在表示在所有操作步骤中都尽可能保持高质量。

得益于这些独特的设计,我们实现了两种类型的图像编辑模型:StableDrag-GAN 和 StableDrag-Diff。通过在 DragBench 上进行广泛的定性实验和定量评估,证明了这两种模型能够实现更稳定的拖动性能。

项目地址:网页链接歸藏的AI工具箱的微博视频
前两天AK转发的一条关于在大规模GPU集群上训练LLM的推文,原文比AK的评述要精彩得多,建议大家一读。可能是我过于cynical了,原文读起来让我觉得作者(Yi Tay,前Google Brain高级研究员)优越感有点太强,反复讲自己在Google时infra如何稳定,codebase如何优雅,称一切Google体系之外的软硬件生态是“wilderness”,吐槽有点太密了.... 但瑕不掩瑜,这篇文章还是特别真诚地分享了初创公司在租用的GPU集群上训练LLM时(想必是大多数公司的情况)遇到的一些问题,我简单总结了一下:

1、各GPU云算力提供商所提供的算力,质量差异之巨大,已经可以称为“硬件盲盒”了(hardware lottery),你完全无法预测自己租用的GPU集群的算力质量和运行情况;
2、作者亲身经历过各种质量的集群,从虽然有点毛病但总体上修修补补能持续跑,到每隔几个小时就宕机完全不能用的都有;
3、主要的问题不在单卡,而是不同云算力提供商组织单卡的方式(cabling)、I/O、文件系统等方面,有些集训甚至需要你自己重新写一个软件层才能跑起来;
4、云算力服务商提供服务质量不一,交付周期无法控制,客服水平和态度也是有好有坏,有的甚至会误删你的checkpoints....;
5、不同的集群Model Flop Utilisation (MFU) 表现不一致,且差异不可忽略,导致集群的理论算力利用不充分。

挺接地气的一篇文章,相信不少创业的小伙伴也或多或少遇到过相同的问题。希望能看到国内团队的类似经验分享,大家看了能少走弯路。此外,我很好奇的是,如果美国startups所面对的商用cluster市场都是如此的话,我们国内的各种“超算中心”、“大规模人工智能计算集群”的实际服务质量和MFU又是如何呢?国资委一纸令下,国央企已经开始动起来要大干快上建设算力了,这些算力,未来又将会是何种结果呢?

原文链接:https://www.yitay.net/blog/training-great-llms-entirely-from-ground-zero-in-the-wilderness

Image generated by Dall-E
Midjourney 今天上线了/describe,也就是 V6 版本的图片提示词生成能力,图片分析能力比 V5 的强很多。#ai#

然后发现 alpha 网站居然也可以使用/describe了,就是藏的比较深,于是录了一个视频演示一下。

生成的提示词会包括三部分第一部分是主体,然后是艺术家风格和描述词。

主体的部分通常会一次生成四条,不要全部用,描述词和艺术家的部分可以按需选择。

这里使用 alpha 网站,需要用 MJ 生成超过 1000 张图:网页链接歸藏的AI工具箱的微博视频
MyShell 开源了号称目前全世界效果最好的 TTS 库 MeloTTS
代码:https://github.com/myshell-ai/MeloTTS
体验:https://huggingface.co/spaces/mrfakename/MeloTTS
哥飞给大家介绍下,目前 MeloTTS 支持英语、西班牙语、法语、中文、日语和韩语,号称是目前最好的高质量多语言文本转语音库。
还支持中英混杂,有点优秀哦。
Hume发布了他们的新研究语义空间理论(SST),可以科学的测量和理解情感。#ai#

语义空间理论是一种用于理解情感的前沿方法,它采用计算方法和数据驱动的手段来绘制我们情感的全谱。
这种理论认为情感是高维的,并且可以通过数据驱动的统计建模来映射。

SST的方法揭示了三个主要的见解:情感是高维的,情感类别并非离散的,而是多样且经常混合的;特定的情感是真实存在的,并且它们组织了情感行为。

SST的研究表明,价值和唤醒只能捕捉到情感状态评分变化的一小部分,而情感类别的评分几乎可以捕捉到价值和唤醒的全部变化。因此,Hume公司的表情测量模型提供的输出与情感类别(如恐惧、胜利和悲伤)相对应,而不是试图将它们简化为底层维度。

SST为情感科学提供了一种数据驱动、计算方法,克服了现有方法的限制,并为情感的科学研究提供了一个框架,承认人类经验和情感的全部复杂性。

详情:网页链接
Raycast可能要发布手机启动器软件。想看看他们做的手机桌面是什么样的。
LLM竞争白热化了,Inflection发布Inflection-2.5模型,他们称这是世界上最好的语言模型,Inflection-2.5 现已向所有 Pi 用户开放。#ai#

Inflection-2.5 接近 GPT-4 的性能,但仅使用了 40% 的计算量用于训练。

我们在编码和数学等智商领域取得了特别的进步。

Pi 现在还融入了世界一流的实时网络搜索功能,以确保用户获得高质量的突发新闻和最新信息。

Inflection-1 使用的训练 FLOP 约为 GPT-4 的 4%,平均而言,在各种 IQ 导向的任务中,其表现约为 GPT-4 水平的 72%。现在为 Pi 提供支持的 Inflection-2.5,尽管只使用了 40% 的训练 FLOP,但其平均性能却达到了 GPT-4 的 94% 以上。

详细信息:网页链接
发现了一个小众应用,用 instant-id + logo lora 给自己做产品 logo!成为下一个老干妈!
来点中式克苏鲁吧#ai画图#

Invalid media: image
以下是我在做和想做的一些产品,大家有什么偏好或建议吗?👇

1. 套壳对话/画图/generator, trys.ai
2. RAG 联网搜索, thinkany.ai
3. 信息处理文章/音频/视频/pdf解析与摘要, zknown.ai, readknown.cn
4. 群聊总结/群管理工具, chatsum.ai
5. 取名智能体服务, namep.ing
6. GPTs 导航站, gpts.works
7. AI 通用导航站, aix.ing
8. 一键发布文章/视频/动态,提交产品工具, onepub.io
9. AI 数字人,声音转换/数字人克隆/复活,整合 heygen / whisper 的一些能力
10. 智能体工作流编排平台,类似 dify/fastgpt/coze
11. 代码生成平台,text-to-code,类似 v0.dev
12. 视频创作者工具,text->脚本->插画->视频->发布
13. AI 音乐播放器,类似网易云音乐,播放 suno AI 生成的音乐
一个非常好的方向,人和动物的面部特征结合,类似于抖音那个发动物走秀的。#ai视频#

来源:网页链接歸藏的AI工具箱的微博视频
每天一个优化,Catjourney.life 现在不需要跳转详情页复制提示词了,直接在对应页面就可以复制。移动端也做了对应的处理。

Framer 时不时就给个惊喜,经常出一些神奇 bug,做组件十分钟,修 Bug 两小时。 歸藏的AI工具箱的微博视频
昨天比较热的一条推,作者在测试Claude 3 Opus模型时,发现它能够在极少量平行语料(5700个翻译对)的基础上,近乎完美地翻译和分析一门复杂的低资源语言Circassian。#ai#

Calude 3 在这方面确实非常强大,基本上很少的数据就可以学会你想要教给他的内容。

推文详细介绍:

作者在测试Anthropic公司新模型Claude 3 Opus时,见证了令人惊叹的事情。作者一直在研究一门叫Circassian的低资源语言,这是一门孤立语言,语料稀缺,语法和形态极其复杂,对语言模型是巨大挑战。

作者之前花了两年时间搜集了6.4万对俄语-Circassian语的平行语料,训练专门的机器翻译模型才取得了不错的效果。作为实验,他只给Claude Opus输入了5700对随机抽取的单词/句子对作为示例,然后让它翻译一些新句子。

令人惊讶的是,Claude Opus不仅给出了完美的翻译,还对语法和词态进行了分析。即使是作者精心设计的,不太可能在示例数据中出现的复杂句子,Claude Opus也给出了无可挑剔的翻译和分析。它展现了对这门语言的深刻理解,在翻译文学作品、新闻、方言时也保持了原文的风格,遇到生词还能推测含义,提供词源分析,必要时甚至造新词。

作者强调,用同样的输入数据,一个不懂Circassian语的语言学家可能需要一年时间才能达到类似水平。而Claude Opus只用几千个翻译对,一分钟内就掌握了语言的精髓。相比之下,GPT-4 和作者之前微调的GPT-3.5模型都完全失败了。

作者最初以为Claude Opus完全是从他提供的少量示例中学到了Circassian语的知识,后来发现其实它在预训练时已经学到了一些。尽管如此,Anthropic在训练数据中纳入了Circassian这样的小语种,效果令人印象深刻。

尽管作者的初始假设有误,但Claude Opus展现的低资源语言能力依然令人惊叹,这预示着小语种和许多其他领域的重大突破。未来已经到来,而且令人惊喜。

来源:网页链接
Back to Top