关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
一个可以在多个 GPU 之间处理来加速图像生成的项目DistriFusion。#ai#

实现了在八个NVIDIA A100 GPU上比单个GPU 生成速度快6.1倍。且不会降低图像质量。

论文简介:
提出了一种名为DistriFusion的新方法。该方法通过在多个GPU之间实现并行处理来加速图像生成。具体来说,我们将输入的图像分割成多个小块,每块分配给一个GPU处理。

不过,简单地这样做会导致不同块之间缺乏有效交互,影响图像的整体质量。而想要增加这些块之间的交互,又会带来巨大的通信负担。

为了解决这个矛盾,我们发现相邻扩散步骤中输入数据的高度相似,于是提出了一种“移位块并行机制”。这种机制利用了扩散过程的连续特性,通过重用上一步计算好的特征图为当前步骤提供背景信息。

因此,我们的方法能够支持异步通信,并且能够与计算过程并行运行。通过广泛的实验,我们证明了这种方法可以应用于最新的Stable Diffusion XL模型,而且不会降低图像质量,并且在八个NVIDIA A100 GPU上比单个GPU快达6.1倍。

项目地址:github.com
老周最近非常关心AI,他本人的方向也一定程度代表了360这家公司的方向,所以360肯定是对AI下了重注的。昨天下午的 AI 免费课上 360 演示了自己的 AI 浏览器和搭配的 AI 搜索功能,其中 AI 浏览器这个非常强。#ai#

360浏览器

这玩意确实离谱,AI功能大杂烩,真正的All in one。

浏览器是最大的且最 ...
AI探索指南
看了几遍腾讯新闻对月之暗面杨植麟的专访,把我认为一些认同的重点的内容记了一下,分成两部分重点的底层认知和其他要点。各位有什么看法也可以在下面讨论。#ai# 重点认知: * AI 组织的要素:更多的人才,更多的资本。 * AI不是我在接下来一两年找到什么PMF,而是接下来十到二十年如何改变世界。 * 真正的 AGI 肯定是全球化的,不存在由于某种保护机制你可以只做某个区域的 AGI 公司,全球化、 AGI 、和大用户量产品是成功的必要条件。 * AI 领域接下来的竞争中会有更多的差异化,需要提前做…
* 上下文在接下来还有很大扩展空间,会有几个数量级,不能只看长度,要看它在这个窗口下能实现的推理能力、the faithfulness的能力(对原始信息的忠实度)、the instruction following的能力(遵循指令的能力)——不应该只追求单一指标,而是结合指标和能力。

* 除了综合能力,在很多空间可以产生独特的能力,能在一些方向做到state of the art(世界领先),比如 Midjourney V6。

* 三年后会有一定程度的AGI。我们今天在做的很多事AI也能做,甚至它做得更好。但关键看我们怎么用它。

* 月之暗面接下来的两件事第一件是世界模型,第二件AI 持续进化的能力。

* (GPT-4)是AGI的必经之路。核心是,不能只满足做到GPT-4的效果。一是要想现在真正的非共识是什么,除了GPT-4,下一步是什么?GPT-5和GPT-6应该是什么样?二是看,你在这里面有哪些独特能力,这点更重要。

* 月之暗面北极星指标:独特价值是你增量的智能。要抓住这个点,智能永远是最核心的增量价值。如果你这个产品最核心价值只有10%-20%来自于AI,就不成立。

* AI不是我在接下来一两年找到什么PMF,而是接下来十到二十年如何改变世界,你的目的假设是商业化,你不可能脱离AGI去思考。只做应用很容易被碾压。

* 技术是这个时代唯一新变量,其他变量没变。AGI是所有事情的核心。

* 为什么开源追不上闭源?因为开源的开发方式跟以前不一样了,以前是所有人都可以contribute(贡献)到开源,现在开源本身还是中心化的。

* 这一轮和上一轮创业的最大区别就是,这次会更加技术驱动。

* Sora 主要瓶颈,核心还是数据,你怎么去规模化地拟合这个数据?之前没被验证过。剩下的是它也没有完全解决,比如需要一个统一的architecture(架构)。DiT这个architecture仍然不是非常通用。

* Sora现在就有点像(视频生成的)GPT-3.5,是阶跃式提升。

* Sora+GPT 会产生什么?对世界的理解更好了,可以在数字世界里做更加端到端的任务,甚至去架起一座桥梁,连接物理世界,完成一些物理世界里的任务。这是起点(这也是 Open AI 投资机器人公司的原因?)。

* 我个人判断至少在接下来一到两年,卡不会成为很大瓶颈。

* 招人思路发生过一些变化。世界上AGI人才非常有限,有经验的人很少。我们最早期的画像是,专注找对口的genius(天才)。

* 解决幻觉问题主要还是靠scaling law,就是scale的是不一样的东西。

* 在能力上应该今年下半年会有一些比较大的突破,很多会来自OpenAI,它肯定还有下一代模型——有可能是4.5,也有可能是5,感觉是大概率事件。视频的生成模型肯定还能继续scale。

* 国内大模型公司的预测:一是可以看到新的独特能力产生。你会看到国产模型,因为前期的投入,有合适的团队,做出世界领先的某一些维度的能力。二是会出现更多用户量级更大的产品,这是大概率的。三是会有进一步的consolidation和路线选择的分化。

访谈原文:对话月之暗面杨植麟:向延绵而未知的雪山前进
看了几遍腾讯新闻对月之暗面杨植麟的专访,把我认为一些认同的重点的内容记了一下,分成两部分重点的底层认知和其他要点。各位有什么看法也可以在下面讨论。#ai#

重点认知:

* AI 组织的要素:更多的人才,更多的资本。

* AI不是我在接下来一两年找到什么PMF,而是接下来十到二十年如何改变世界。

* 真正的 AGI 肯定是全球化的,不存在由于某种保护机制你可以只做某个区域的 AGI 公司,全球化、 AGI 、和大用户量产品是成功的必要条件。

* AI 领域接下来的竞争中会有更多的差异化,需要提前做预判和准备到底什么是“成立的非共识”。

* 接下来会有两个大的milestone(里程碑)。一是真正的统一的世界模型,就是它能统一各种不同模态,一个真正的scalable和general的architecture(可扩展、通用的系统结构)(Sora 启发)。二是能在没有人类数据输入的情况下,使AI持续进化(详细见 AK 10 月份视频倒数第二部分)。

* “应用”本身是实现 AGI 的手段,也是实现 AGI 的目的。

* AI唯一work就是next token prediction + scaling law,只要token足够完整,都是可以做的。

* 想知道但还不知道的事情:我不知道AGI的上限是什么样的,它会产生一个什么样的公司,这个公司能产生出来什么样的产品。这是我现在最想知道的事。(重点)

其他要点:

* “搞定”不是一个好的词,背后本质是合作。合作就是能双赢,因为双赢是合作的前提。所以也没什么区别,需要给别人提供独特价值

* 为AI 时代的组织形式,有很多自顶向下的规划,但规划中又有创新空间,并不是所有技术都确定。

* Sam 去微软里领导新的团队有什么问题?需要在就文化中产生新组织,难度很大(这也是很多大厂选择投资而不是自己做的原因?)。

* AGI最终会是一个跟所有用户协作产生的东西。所以,不光是技术,也需要功利主义和现实追求。

* 长文本是新计算机的内容(AK在 10 月份的科普视频最后有类似比喻),要变成通用的世界模型,是需要long context的。

* 重要内容是个性化,AI最核心的价值是个性化互动,价值落脚点还是个性化,AGI会比上一代推荐引擎更加个性化。
1、没有 AI 的汽车、手机、电脑、平板等,将是一堆废铁;
2、一家公司的核心战略不能同时放在两个大方向上。

综上,停下造车全攻 AI 是非常明智的。

连键盘侠都知道「不难」的造车,没造出来不是造不出来,是制定的目标太远太高。苹果之前想一步到位搞出 L4 的移动座舱,但现阶段的人类还没有办法,这太难了。在他们之前的设想中,自动驾驶的汽车和 Apple Vision Pro 是可以放在同一个场景里的。但很显然,这个步子太大了。用新势力们的方式当然可以,但那不是苹果想做的。

最关键的是,AI 的大爆发是此前大家都没料到的。没有这事儿,车还是一个重要的方向,但这一波爆发的 AI 不是资本热潮,而是实打实的浪潮了,此时不全力转向,是真的会死的。况且苹果并不是没有在 AI 上投入的,这些年一直都在积累,只是权重还没拉到那么高。现在切方向,即是大势所趋的必须,也是归拢资源的必要。

过去 Jony 可以对供应商说,这里有一桶取不完的钱,你能做到你就能拿走,以此把工业设计拉高到一个令人望尘莫及的程度;今天的苹果比二十年前拥有更多的现金,有自己的芯片和庞大的人才库,有海量的设备和训练数据,可以说:

比起造车,AI 才是更适合苹果干的事;
干好 AI 所需的人才、数据、算力,也是他们的优势。

以苹果的财力,下这样的决心,恐怕要出现一次人才流动的大震荡。
lhwcM7qw4t_O0juSPnWO_CPnv9o9v3.png
5.3 MB
AI探索指南
老周最近非常关心AI,他本人的方向也一定程度代表了360这家公司的方向,所以360肯定是对AI下了重注的。昨天下午的 AI 免费课上 360 演示了自己的 AI 浏览器和搭配的 AI 搜索功能,其中 AI 浏览器这个非常强。 360浏览器 这玩意确实离谱,AI功能大杂烩,真正的All in one。 浏览器是最大的且最复杂的效率工具,是最适合跟 AI 结合的传统工具。 你在浏览网页和文件的时候需要的AI功能全部给你了,而且那个浏览器AI助理能力不错,比微软Edge那玩意强多了。 AI 现在解决的…
AI 写作:还是 360 这种公懂中国用户,机关公文和科研学习这两个分类直接秒杀其他产品,哈哈。此外媒体写作这里针对每个媒体都做了单独的优化,电商内容也是一样每个品类都是单独的。

浏览器也在昨天老周演讲的时候开始测试了,懒得装一堆付费AI插件的朋友可以试试。

下载地址:https://browser.360.cn/ai/#download

360搜索

搜索是浏览器一个非常重要的组成部分。

答案引擎是搜索类产品的新方向。相当一部分人搜索都在找答案,只有大模型能做到给答案。AI率先改造搜索有合理性。

由于360本身就做搜索有自己搜索的底层积累,360搜索对于国内一些独有的信息搜索还是有一手的,所以在优势层面结合AI也是个合理的选择。

整个界面和360以往的产品风格相差很大,非常简洁,同时会有一些引导,增强模式可以对搜索结果进行更深入的总结和发散,非常强大。

另外也支持搜索相关视频和图片,可以对生成的内容整理为大纲和思维导图方便用户借鉴相关内容,AI 搜索让搜索内更有逻辑更合理。

增强模式中生成的追问问题也挺合理和专业的,比如昨天刚发生的关于苹果放弃造车转向人工智能的分析,以及追问过程中苹果在人工智能领域的布局都总结的很好。

360搜索目前也是免费的,有国内信息搜索和整理需求的可以去看看。

360 AI搜索:https://sou.com

AI 经过过去一年的发展涌现了一些非常好的产品泛式,这些可能我们圈子里以及都很熟悉很常用了。

但是对于如何让 C 端用户用户用上这些东西,可能还是得靠 360 浏览器这种免费并且质量还行的产品,创业公司独立团队负责开拓和效果,传统大中厂负责普及,今年的 AI 应用层会非常精彩。
老周最近非常关心AI,他本人的方向也一定程度代表了360这家公司的方向,所以360肯定是对AI下了重注的。昨天下午的 AI 免费课上 360 演示了自己的 AI 浏览器和搭配的 AI 搜索功能,其中 AI 浏览器这个非常强。

360浏览器

这玩意确实离谱,AI功能大杂烩,真正的All in one。

浏览器是最大的且最复杂的效率工具,是最适合跟 AI 结合的传统工具。

你在浏览网页和文件的时候需要的AI功能全部给你了,而且那个浏览器AI助理能力不错,比微软Edge那玩意强多了。

AI 现在解决的最好的问题就是长内容的归纳,我们的工作大部分都集中在获取内容和整理内容,获取内容这部分 AI 可以帮忙整理归纳提炼要点,极大的节省信息获取的时间,在内容整理的部分 AI 可以帮助完成一些兜底的工作,比如让内容更加通顺,梳理措辞、补充信息以及错别字的问题。

AI 助理

这里面最好的功能我认为就是这个AI助理,在长文浏览的时候支持摘要、脉络以及问答三种内容拆解方式,从浅到深全方位分析和总结内容,不管你看东西的习惯是什么总有一种适合。另外也支持AI助理也支持对本地文件比如PDF的分析和整理,除了整理和总结之外还可以翻译PDF。

他们在 AI 助理的打磨上我觉得是我看到的所有的里面最好的,跟浏览行为本身结合最紧密的。比如我让他分析这篇机器之心的内容,浏览器会直接打开阅读模式,界面非常清爽,同时你可以设置界面主题以及语音朗读。

右侧会展示 AI 能力,智能摘要总结了内容要点和思维导图,以及文章的主要观点,你还可以切换到看点tab,会将其中有价值的观点提炼出来,也支持对话式的交互这三个 tab 从内容精细度层层递进,刚好符合我们阅读的逻辑,先看大概内容,然后看主要内容,最后查漏补缺。

视频助理也是类似的,开启以后会进入一个新的页面,思维导图,总结还有字幕该有的都有,比 B 站自己做的那玩意强多了。比如下面我用小黛的视频尝试的例子,每一节的内容都没有漏掉。

其他 AI 能力

AI 智绘:AI 画图功能也体现了这个浏览器一样的思路就是全,所有的能力都给你,文生图、图生图、涂鸦画图、局部重绘都有,基本就是 SD 搭配了一些易用的交互界面。
前几天微软发了一篇挺重要的关于 LLM 的论文,但我看不太懂。
从社区讨论来看,这个研究可以大幅压缩模型体积,让 120B 大小的模型能在 24G 显存的设备上运行。
再加上一些其他优化我们在消费级设备运行 Llama 70B 也不是什么遥不可及的事情。

论文简介:

《1位大语言模型时代来临:一切大型语言模型均转向1.58位构架》

一种1位的LLM变体,命名为BitNet b1.58。在这个模型里,大语言模型的每个参数(或权重)都是三元的{-1, 0, 1}。它在复杂度和实际应用性能方面与相同模型规模和训练数据的全精度(即FP16或BF16)Transformer大语言模型不相上下,但在延迟、内存、吞吐量和能源消耗方面更具成本效益。

更为重要的是,1.58位LLM定义了新的扩展规律,并为训练新一代既高性能又高效的LLMs提供了方法。此外,它还开启了一个全新的计算范式,并为设计专门针对1位LLMs优化的硬件提供了可能性。

论文:网页链接
古希腊掌管 Animatediff 工作流的神 Jerry Davos 的新作品,一个支持非常详细的面部修复和唇形同步的视频转视频 ComfyUI工作流。#ai视频#

工作流包括三个阶段:

阶段1:将原始视频的每一帧中的面部替换为风格化的面部(目的是使其更接近animatediff风格的面部),同时确保嘴唇同步效果不受影响。

阶段2:此时,从阶段1得到的“只包含面部”的每张图像被覆盖到更精细处理过的图像上,然后将这些图像保存到名为Swapped_A的目录中。

阶段3:(颜色匹配):接下来,Swapped_A目录中的每张图像将与细化目录中相同的图像进行交换。这一过程旨在尽可能实现颜色匹配的最佳效果,同时在一定程度上保持嘴唇同步的准确性。

查看教程及下载工作流:网页链接歸藏的AI工具箱的微博视频
Back to Top