关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
还记得DragGAN吗?可以拖动锚点进行图像编辑,当时代码发布以后大家发现生成速度慢,而且不能自己自定义外部图片就没人理了。
现在又有一个StableDrag,是基于Diffusion 模型的,也可以完成类似的拖动锚点编辑图片的能力。如果真的跟演示的效果一样的话,那图片编辑就太方便了。#ai画图#
论文简介:
自 DragGAN 出现以来,基于点的图像编辑引起了显著的关注。最近,DragDiffusion 通过将这种拖动技术适配到扩散模型中,进一步推进了生成质量。尽管取得了巨大成功,但这种拖动方案存在两个主要缺点:不准确的点跟踪和不完整的运动监督,这可能导致拖动效果不理想。
为了解决这些问题,我们设计了一种判别式点跟踪方法和一种基于置信度的潜在增强策略,构建了一个稳定和精确的基于拖动的编辑框架,称为 StableDrag。其中,判别式点跟踪方法允许我们精确定位更新的控制点,从而提高长距离操作的稳定性;而基于置信度的潜在增强策略则负责确保优化后的潜在表示在所有操作步骤中都尽可能保持高质量。
得益于这些独特的设计,我们实现了两种类型的图像编辑模型:StableDrag-GAN 和 StableDrag-Diff。通过在 DragBench 上进行广泛的定性实验和定量评估,证明了这两种模型能够实现更稳定的拖动性能。
项目地址:网页链接歸藏的AI工具箱的微博视频
现在又有一个StableDrag,是基于Diffusion 模型的,也可以完成类似的拖动锚点编辑图片的能力。如果真的跟演示的效果一样的话,那图片编辑就太方便了。#ai画图#
论文简介:
自 DragGAN 出现以来,基于点的图像编辑引起了显著的关注。最近,DragDiffusion 通过将这种拖动技术适配到扩散模型中,进一步推进了生成质量。尽管取得了巨大成功,但这种拖动方案存在两个主要缺点:不准确的点跟踪和不完整的运动监督,这可能导致拖动效果不理想。
为了解决这些问题,我们设计了一种判别式点跟踪方法和一种基于置信度的潜在增强策略,构建了一个稳定和精确的基于拖动的编辑框架,称为 StableDrag。其中,判别式点跟踪方法允许我们精确定位更新的控制点,从而提高长距离操作的稳定性;而基于置信度的潜在增强策略则负责确保优化后的潜在表示在所有操作步骤中都尽可能保持高质量。
得益于这些独特的设计,我们实现了两种类型的图像编辑模型:StableDrag-GAN 和 StableDrag-Diff。通过在 DragBench 上进行广泛的定性实验和定量评估,证明了这两种模型能够实现更稳定的拖动性能。
项目地址:网页链接歸藏的AI工具箱的微博视频
1、各GPU云算力提供商所提供的算力,质量差异之巨大,已经可以称为“硬件盲盒”了(hardware lottery),你完全无法预测自己租用的GPU集群的算力质量和运行情况;
2、作者亲身经历过各种质量的集群,从虽然有点毛病但总体上修修补补能持续跑,到每隔几个小时就宕机完全不能用的都有;
3、主要的问题不在单卡,而是不同云算力提供商组织单卡的方式(cabling)、I/O、文件系统等方面,有些集训甚至需要你自己重新写一个软件层才能跑起来;
4、云算力服务商提供服务质量不一,交付周期无法控制,客服水平和态度也是有好有坏,有的甚至会误删你的checkpoints....;
5、不同的集群Model Flop Utilisation (MFU) 表现不一致,且差异不可忽略,导致集群的理论算力利用不充分。
挺接地气的一篇文章,相信不少创业的小伙伴也或多或少遇到过相同的问题。希望能看到国内团队的类似经验分享,大家看了能少走弯路。此外,我很好奇的是,如果美国startups所面对的商用cluster市场都是如此的话,我们国内的各种“超算中心”、“大规模人工智能计算集群”的实际服务质量和MFU又是如何呢?国资委一纸令下,国央企已经开始动起来要大干快上建设算力了,这些算力,未来又将会是何种结果呢?
原文链接:https://www.yitay.net/blog/training-great-llms-entirely-from-ground-zero-in-the-wilderness
Image generated by Dall-E
Midjourney 今天上线了/describe,也就是 V6 版本的图片提示词生成能力,图片分析能力比 V5 的强很多。#ai#
然后发现 alpha 网站居然也可以使用/describe了,就是藏的比较深,于是录了一个视频演示一下。
生成的提示词会包括三部分第一部分是主体,然后是艺术家风格和描述词。
主体的部分通常会一次生成四条,不要全部用,描述词和艺术家的部分可以按需选择。
这里使用 alpha 网站,需要用 MJ 生成超过 1000 张图:网页链接歸藏的AI工具箱的微博视频
然后发现 alpha 网站居然也可以使用/describe了,就是藏的比较深,于是录了一个视频演示一下。
生成的提示词会包括三部分第一部分是主体,然后是艺术家风格和描述词。
主体的部分通常会一次生成四条,不要全部用,描述词和艺术家的部分可以按需选择。
这里使用 alpha 网站,需要用 MJ 生成超过 1000 张图:网页链接歸藏的AI工具箱的微博视频
代码:https://github.com/myshell-ai/MeloTTS
体验:https://huggingface.co/spaces/mrfakename/MeloTTS
哥飞给大家介绍下,目前 MeloTTS 支持英语、西班牙语、法语、中文、日语和韩语,号称是目前最好的高质量多语言文本转语音库。
还支持中英混杂,有点优秀哦。
语义空间理论是一种用于理解情感的前沿方法,它采用计算方法和数据驱动的手段来绘制我们情感的全谱。
这种理论认为情感是高维的,并且可以通过数据驱动的统计建模来映射。
SST的方法揭示了三个主要的见解:情感是高维的,情感类别并非离散的,而是多样且经常混合的;特定的情感是真实存在的,并且它们组织了情感行为。
SST的研究表明,价值和唤醒只能捕捉到情感状态评分变化的一小部分,而情感类别的评分几乎可以捕捉到价值和唤醒的全部变化。因此,Hume公司的表情测量模型提供的输出与情感类别(如恐惧、胜利和悲伤)相对应,而不是试图将它们简化为底层维度。
SST为情感科学提供了一种数据驱动、计算方法,克服了现有方法的限制,并为情感的科学研究提供了一个框架,承认人类经验和情感的全部复杂性。
详情:网页链接
Inflection-2.5 接近 GPT-4 的性能,但仅使用了 40% 的计算量用于训练。
我们在编码和数学等智商领域取得了特别的进步。
Pi 现在还融入了世界一流的实时网络搜索功能,以确保用户获得高质量的突发新闻和最新信息。
Inflection-1 使用的训练 FLOP 约为 GPT-4 的 4%,平均而言,在各种 IQ 导向的任务中,其表现约为 GPT-4 水平的 72%。现在为 Pi 提供支持的 Inflection-2.5,尽管只使用了 40% 的训练 FLOP,但其平均性能却达到了 GPT-4 的 94% 以上。
详细信息:网页链接
以下是我在做和想做的一些产品,大家有什么偏好或建议吗?👇
1. 套壳对话/画图/generator, trys.ai
2. RAG 联网搜索, thinkany.ai
3. 信息处理文章/音频/视频/pdf解析与摘要, zknown.ai, readknown.cn
4. 群聊总结/群管理工具, chatsum.ai
5. 取名智能体服务, namep.ing
6. GPTs 导航站, gpts.works
7. AI 通用导航站, aix.ing
8. 一键发布文章/视频/动态,提交产品工具, onepub.io
9. AI 数字人,声音转换/数字人克隆/复活,整合 heygen / whisper 的一些能力
10. 智能体工作流编排平台,类似 dify/fastgpt/coze
11. 代码生成平台,text-to-code,类似 v0.dev
12. 视频创作者工具,text->脚本->插画->视频->发布
13. AI 音乐播放器,类似网易云音乐,播放 suno AI 生成的音乐
1. 套壳对话/画图/generator, trys.ai
2. RAG 联网搜索, thinkany.ai
3. 信息处理文章/音频/视频/pdf解析与摘要, zknown.ai, readknown.cn
4. 群聊总结/群管理工具, chatsum.ai
5. 取名智能体服务, namep.ing
6. GPTs 导航站, gpts.works
7. AI 通用导航站, aix.ing
8. 一键发布文章/视频/动态,提交产品工具, onepub.io
9. AI 数字人,声音转换/数字人克隆/复活,整合 heygen / whisper 的一些能力
10. 智能体工作流编排平台,类似 dify/fastgpt/coze
11. 代码生成平台,text-to-code,类似 v0.dev
12. 视频创作者工具,text->脚本->插画->视频->发布
13. AI 音乐播放器,类似网易云音乐,播放 suno AI 生成的音乐
每天一个优化,Catjourney.life 现在不需要跳转详情页复制提示词了,直接在对应页面就可以复制。移动端也做了对应的处理。
Framer 时不时就给个惊喜,经常出一些神奇 bug,做组件十分钟,修 Bug 两小时。 歸藏的AI工具箱的微博视频
Framer 时不时就给个惊喜,经常出一些神奇 bug,做组件十分钟,修 Bug 两小时。 歸藏的AI工具箱的微博视频
Calude 3 在这方面确实非常强大,基本上很少的数据就可以学会你想要教给他的内容。
推文详细介绍:
作者在测试Anthropic公司新模型Claude 3 Opus时,见证了令人惊叹的事情。作者一直在研究一门叫Circassian的低资源语言,这是一门孤立语言,语料稀缺,语法和形态极其复杂,对语言模型是巨大挑战。
作者之前花了两年时间搜集了6.4万对俄语-Circassian语的平行语料,训练专门的机器翻译模型才取得了不错的效果。作为实验,他只给Claude Opus输入了5700对随机抽取的单词/句子对作为示例,然后让它翻译一些新句子。
令人惊讶的是,Claude Opus不仅给出了完美的翻译,还对语法和词态进行了分析。即使是作者精心设计的,不太可能在示例数据中出现的复杂句子,Claude Opus也给出了无可挑剔的翻译和分析。它展现了对这门语言的深刻理解,在翻译文学作品、新闻、方言时也保持了原文的风格,遇到生词还能推测含义,提供词源分析,必要时甚至造新词。
作者强调,用同样的输入数据,一个不懂Circassian语的语言学家可能需要一年时间才能达到类似水平。而Claude Opus只用几千个翻译对,一分钟内就掌握了语言的精髓。相比之下,GPT-4 和作者之前微调的GPT-3.5模型都完全失败了。
作者最初以为Claude Opus完全是从他提供的少量示例中学到了Circassian语的知识,后来发现其实它在预训练时已经学到了一些。尽管如此,Anthropic在训练数据中纳入了Circassian这样的小语种,效果令人印象深刻。
尽管作者的初始假设有误,但Claude Opus展现的低资源语言能力依然令人惊叹,这预示着小语种和许多其他领域的重大突破。未来已经到来,而且令人惊喜。
来源:网页链接
工程师需要像"保姆"一样密切监控训练过程,关注关键指标,一旦出现问题要及时排查,否则会浪费大量计算资源。
训练常常因为各种未知原因失败,需要重启尝试。训练大模型考验整个计算系统的容错能力,因此除了考虑性能和成本,还要评估整体服务质量和团队效率。
原文翻译:
这篇文章精彩地讨论了一个鲜为人知的话题:训练大语言模型(LLM)的难点。在成熟的公司里,有专门的团队负责维护这些计算集群。当规模扩大时,这些集群的管理从传统的工程学转变成更接近生物学的领域,这也是为什么会有专门负责“硬件健康”的团队的原因。
训练大型模型的日常可能充满挑战。作为工程师,你需要像“保姆”一样密切监控训练过程。这包括关注运行的关键指标:损失函数的突然升高、数值问题、处理速度、梯度的规范性、策略的熵值等。一旦训练过程出现退化或停滞——这种情况经常发生——你就得迅速查找错误原因。如果处理不及时,可能导致成千上万的GPU资源闲置。
来源:网页链接
你经常会遇到一些新的、陌生的、令人畏惧的错误,需要紧急求助于同事。最糟糕的情况往往发生在凌晨4点。有时候,问题无法解决,你只能选择停用一些异常的节点,尝试重新开始训练。有时候,训练失败仅仅是因为运气不佳,这时你可能会在启动命令中加入一个while True:循环以期望运气好转。
这些问题可能涉及多种原因,从GPU过热导致计算错误,到路由器故障降低网络文件系统的输入输出速度,甚至是数据中心内部因未通报的维护工作而导致的物理连接中断。有时候,问题的根源可能永远成谜。
这里还需要特别提到一个重要的参考资料:OPT-175B的日志本。希望未来能有更多类似的资料能够公开。(详见git仓库中的chronicles/OPT175B_Logbook.pdf) 网页链接
总之,大语言模型的训练过程实质上是对一个庞大计算系统整体容错能力的极端考验,这个系统在某种程度上像一个生物实体。因此,在选择计算资源时,除了考虑浮点运算性能(FLOPs)和成本外,还要全面考虑从硬件到软件的整体服务,包括存储、网络和计算能力。更重要的是,考虑维护这些系统的团队是否像《复仇者联盟》那样高效,并思考你是否能与他们建立良好的合作关系。
一个可以帮助开发者利用 Claude 3 优化代码问题的提示词,中文翻译只是为了理解,还是建议用英文提示。微博的朋友们见谅,由于微博的脑瘫话题匹配机制,markdown里面的【#】 会被判断为话题。
--------------提示词翻译--------------
你是加速代码运行的世界级专家。你将利用一切可能的资源来实现这一目标。
首先,针对一段给定的代码,向我解释这段代码的运作原理。
然后,对代码的每个部分进行运行时间分析,估算其运行所需时间。
接着,找出哪些部分是提速的关键点。
之后,制作一个“影响力”与“复杂度”双轴的表格。对于每一个提速点,评估提升速度的复杂程度以及可能带来的速度影响程度。
然后,根据评估结果对这些提速点进行排序。
选取排名最高的提速点,更详细地解释如何重写代码来提高效率。随后,重写实际的代码段。完成后,检查新编写的代码是否存在问题。如果有,继续下一个步骤。如果没有,重新编写代码以解决这些问题。
接下来,对排名第二的提速点进行类似的详细解释和代码重写。然后,检查新编写的代码是否存在问题。如果有,继续下一个步骤。如果没有,重新编写代码以解决这些问题。
对排名第三的提速点也执行同样的步骤。
最后,将所有的速度提升改进整合起来,重写整个代码。
你应该按以下格式回应:
## 解释:
$explanation
## 运行时间分析:
$runtime_analysis
## 提速关键点:
$candidates
## 影响力与复杂度表:
|提速点|影响力|复杂度|
|---|---|---|
|$candidate_table|||
## 按评估排名的提速点:
$ordered_candidates
## 排名最高提速点的详细解释和代码重写:
# 解释
$top_candidate_explanation
# 代码重写
$top_candidate_code
# 新代码中的问题:_(仅在存在问题时包含此部分)_
$top_candidate_issues
# 代码重写,第二次尝试:_(仅在问题存在时包含)_
$top_candidate_code_try2
## 排名第二的提速点的详细解释和代码重写:
# 解释
$second_candidate_explanation
# 代码重写
$second_candidate_code
# 新代码中的问题:_(仅在存在问题时包含此部分)_
$second_candidate_issues
# 代码重写,第二次尝试:_(仅在问题存在时包含)_
$second_candidate_code_try2
## 排名第三的提速点的详细解释和代码重写:
# 解释
$third_candidate_explanation
# 代码重写
$third_candidate_code
# 新代码中的问题:_(仅在存在问题时包含此部分)_
$third_candidate_issues
# 代码重写,第二次尝试:_(仅在问题存在时包含)_
$third_candidate_code_try2
## 整体代码重写,包含所有速度改进:
## $full_code_rewrite
--------------提示词原文--------------
You are a world expert in making code run faster. You use any resource you can to do so. Given some code, first, explain how the code works to me. Next, for each part of the code, identify how long it might take to run. After that, identify which parts are key candidates to speed up. Then, make a table with axes 'Impact' and 'Complexity'. For each of the candidates, rank how complex it will be to speed it up and how much of a speed impact it could have. After that, order the candidates by ranking. Take the top-ranked candidate and explain in more detail how to rewrite the code to be faster. Then, rewrite the actual code. After you've done that, determine if there are issues with the new code you wrote. If so, move on. Otherwise, rewrite the code again to fix them. Next, take the second-highest-ranked candidate and explain in more detail how to rewrite the code to be faster. Then, rewrite the actual code. After you've done that, determine if there are issues with the new code you wrote. If so, move on. Otherwise, rewrite the code again to fix them. Then do the same for the third-highest-ranked candidate. Finally, rewrite the code in full with all of the speed improvements incorporated. Here is the format you should respond in: ## Explanation: $explanation ## Runtime Analysis: $runtime_analysis ## Key Candidates for Speed Up: $candidates ## Impact and Complexity Table: | Candidate | Impact | Complexity | | --------- | ------ | ---------- | $candidate_table ## Candidates Ordered by Ranking: $ordered_candidates ## Detailed Explanation and Code Rewrite for Top Candidate: # Explanation $top_candidate_explanation # Code Rewrite $top_candidate_code # Issues with New Code: *(include this section only if they exist)* $top_candidate_issues # Code Rewrite, Try 2: *(include this section only if issues exist)* $top_candidate_code_try2 ## Detailed Explanation and Code Rewrite for Second-Highest Candidate: # Explanation $second_candidate_explanation # Code Rewrite $second_candidate_code # Issues with New Code: *(include this section only if issues exist)* $second_candidate_issues # Code Rewrite, Try 2: *(include this section only if issues exist)* $second_candidate_code_try2 ## Detailed Explanation and Code Rewrite for Third-Highest Candidate: # Explanation $third_candidate_explanation # Code Rewrite $third_candidate_code # Issues with New Code: *(include this section only if issues exist)* $third_candidate_issues # Code Rewrite, Try 2: *(include this section only if issues exist)* $third_candidate_code_try2 ## Full Code Rewrite with Speed Improvements: $full_code_rewrite ---
来源:网页链接
--------------提示词翻译--------------
你是加速代码运行的世界级专家。你将利用一切可能的资源来实现这一目标。
首先,针对一段给定的代码,向我解释这段代码的运作原理。
然后,对代码的每个部分进行运行时间分析,估算其运行所需时间。
接着,找出哪些部分是提速的关键点。
之后,制作一个“影响力”与“复杂度”双轴的表格。对于每一个提速点,评估提升速度的复杂程度以及可能带来的速度影响程度。
然后,根据评估结果对这些提速点进行排序。
选取排名最高的提速点,更详细地解释如何重写代码来提高效率。随后,重写实际的代码段。完成后,检查新编写的代码是否存在问题。如果有,继续下一个步骤。如果没有,重新编写代码以解决这些问题。
接下来,对排名第二的提速点进行类似的详细解释和代码重写。然后,检查新编写的代码是否存在问题。如果有,继续下一个步骤。如果没有,重新编写代码以解决这些问题。
对排名第三的提速点也执行同样的步骤。
最后,将所有的速度提升改进整合起来,重写整个代码。
你应该按以下格式回应:
## 解释:
$explanation
## 运行时间分析:
$runtime_analysis
## 提速关键点:
$candidates
## 影响力与复杂度表:
|提速点|影响力|复杂度|
|---|---|---|
|$candidate_table|||
## 按评估排名的提速点:
$ordered_candidates
## 排名最高提速点的详细解释和代码重写:
# 解释
$top_candidate_explanation
# 代码重写
$top_candidate_code
# 新代码中的问题:_(仅在存在问题时包含此部分)_
$top_candidate_issues
# 代码重写,第二次尝试:_(仅在问题存在时包含)_
$top_candidate_code_try2
## 排名第二的提速点的详细解释和代码重写:
# 解释
$second_candidate_explanation
# 代码重写
$second_candidate_code
# 新代码中的问题:_(仅在存在问题时包含此部分)_
$second_candidate_issues
# 代码重写,第二次尝试:_(仅在问题存在时包含)_
$second_candidate_code_try2
## 排名第三的提速点的详细解释和代码重写:
# 解释
$third_candidate_explanation
# 代码重写
$third_candidate_code
# 新代码中的问题:_(仅在存在问题时包含此部分)_
$third_candidate_issues
# 代码重写,第二次尝试:_(仅在问题存在时包含)_
$third_candidate_code_try2
## 整体代码重写,包含所有速度改进:
## $full_code_rewrite
--------------提示词原文--------------
You are a world expert in making code run faster. You use any resource you can to do so. Given some code, first, explain how the code works to me. Next, for each part of the code, identify how long it might take to run. After that, identify which parts are key candidates to speed up. Then, make a table with axes 'Impact' and 'Complexity'. For each of the candidates, rank how complex it will be to speed it up and how much of a speed impact it could have. After that, order the candidates by ranking. Take the top-ranked candidate and explain in more detail how to rewrite the code to be faster. Then, rewrite the actual code. After you've done that, determine if there are issues with the new code you wrote. If so, move on. Otherwise, rewrite the code again to fix them. Next, take the second-highest-ranked candidate and explain in more detail how to rewrite the code to be faster. Then, rewrite the actual code. After you've done that, determine if there are issues with the new code you wrote. If so, move on. Otherwise, rewrite the code again to fix them. Then do the same for the third-highest-ranked candidate. Finally, rewrite the code in full with all of the speed improvements incorporated. Here is the format you should respond in: ## Explanation: $explanation ## Runtime Analysis: $runtime_analysis ## Key Candidates for Speed Up: $candidates ## Impact and Complexity Table: | Candidate | Impact | Complexity | | --------- | ------ | ---------- | $candidate_table ## Candidates Ordered by Ranking: $ordered_candidates ## Detailed Explanation and Code Rewrite for Top Candidate: # Explanation $top_candidate_explanation # Code Rewrite $top_candidate_code # Issues with New Code: *(include this section only if they exist)* $top_candidate_issues # Code Rewrite, Try 2: *(include this section only if issues exist)* $top_candidate_code_try2 ## Detailed Explanation and Code Rewrite for Second-Highest Candidate: # Explanation $second_candidate_explanation # Code Rewrite $second_candidate_code # Issues with New Code: *(include this section only if issues exist)* $second_candidate_issues # Code Rewrite, Try 2: *(include this section only if issues exist)* $second_candidate_code_try2 ## Detailed Explanation and Code Rewrite for Third-Highest Candidate: # Explanation $third_candidate_explanation # Code Rewrite $third_candidate_code # Issues with New Code: *(include this section only if issues exist)* $third_candidate_issues # Code Rewrite, Try 2: *(include this section only if issues exist)* $third_candidate_code_try2 ## Full Code Rewrite with Speed Improvements: $full_code_rewrite ---
来源:网页链接
2024年上半年,人形机器人市场将迎来一大波新产品和新品牌,谁有更先进的技术,谁就更有望从资本市场拿到资金,谁就能走得更远。至于优必选,政策的风已经吹过来,接下来就是考验经营能力了。