关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AI探索指南
看了几遍腾讯新闻对月之暗面杨植麟的专访,把我认为一些认同的重点的内容记了一下,分成两部分重点的底层认知和其他要点。各位有什么看法也可以在下面讨论。#ai# 重点认知: * AI 组织的要素:更多的人才,更多的资本。 * AI不是我在接下来一两年找到什么PMF,而是接下来十到二十年如何改变世界。 * 真正的 AGI 肯定是全球化的,不存在由于某种保护机制你可以只做某个区域的 AGI 公司,全球化、 AGI 、和大用户量产品是成功的必要条件。 * AI 领域接下来的竞争中会有更多的差异化,需要提前做…
* 上下文在接下来还有很大扩展空间,会有几个数量级,不能只看长度,要看它在这个窗口下能实现的推理能力、the faithfulness的能力(对原始信息的忠实度)、the instruction following的能力(遵循指令的能力)——不应该只追求单一指标,而是结合指标和能力。

* 除了综合能力,在很多空间可以产生独特的能力,能在一些方向做到state of the art(世界领先),比如 Midjourney V6。

* 三年后会有一定程度的AGI。我们今天在做的很多事AI也能做,甚至它做得更好。但关键看我们怎么用它。

* 月之暗面接下来的两件事第一件是世界模型,第二件AI 持续进化的能力。

* (GPT-4)是AGI的必经之路。核心是,不能只满足做到GPT-4的效果。一是要想现在真正的非共识是什么,除了GPT-4,下一步是什么?GPT-5和GPT-6应该是什么样?二是看,你在这里面有哪些独特能力,这点更重要。

* 月之暗面北极星指标:独特价值是你增量的智能。要抓住这个点,智能永远是最核心的增量价值。如果你这个产品最核心价值只有10%-20%来自于AI,就不成立。

* AI不是我在接下来一两年找到什么PMF,而是接下来十到二十年如何改变世界,你的目的假设是商业化,你不可能脱离AGI去思考。只做应用很容易被碾压。

* 技术是这个时代唯一新变量,其他变量没变。AGI是所有事情的核心。

* 为什么开源追不上闭源?因为开源的开发方式跟以前不一样了,以前是所有人都可以contribute(贡献)到开源,现在开源本身还是中心化的。

* 这一轮和上一轮创业的最大区别就是,这次会更加技术驱动。

* Sora 主要瓶颈,核心还是数据,你怎么去规模化地拟合这个数据?之前没被验证过。剩下的是它也没有完全解决,比如需要一个统一的architecture(架构)。DiT这个architecture仍然不是非常通用。

* Sora现在就有点像(视频生成的)GPT-3.5,是阶跃式提升。

* Sora+GPT 会产生什么?对世界的理解更好了,可以在数字世界里做更加端到端的任务,甚至去架起一座桥梁,连接物理世界,完成一些物理世界里的任务。这是起点(这也是 Open AI 投资机器人公司的原因?)。

* 我个人判断至少在接下来一到两年,卡不会成为很大瓶颈。

* 招人思路发生过一些变化。世界上AGI人才非常有限,有经验的人很少。我们最早期的画像是,专注找对口的genius(天才)。

* 解决幻觉问题主要还是靠scaling law,就是scale的是不一样的东西。

* 在能力上应该今年下半年会有一些比较大的突破,很多会来自OpenAI,它肯定还有下一代模型——有可能是4.5,也有可能是5,感觉是大概率事件。视频的生成模型肯定还能继续scale。

* 国内大模型公司的预测:一是可以看到新的独特能力产生。你会看到国产模型,因为前期的投入,有合适的团队,做出世界领先的某一些维度的能力。二是会出现更多用户量级更大的产品,这是大概率的。三是会有进一步的consolidation和路线选择的分化。

访谈原文:对话月之暗面杨植麟:向延绵而未知的雪山前进
看了几遍腾讯新闻对月之暗面杨植麟的专访,把我认为一些认同的重点的内容记了一下,分成两部分重点的底层认知和其他要点。各位有什么看法也可以在下面讨论。#ai#

重点认知:

* AI 组织的要素:更多的人才,更多的资本。

* AI不是我在接下来一两年找到什么PMF,而是接下来十到二十年如何改变世界。

* 真正的 AGI 肯定是全球化的,不存在由于某种保护机制你可以只做某个区域的 AGI 公司,全球化、 AGI 、和大用户量产品是成功的必要条件。

* AI 领域接下来的竞争中会有更多的差异化,需要提前做预判和准备到底什么是“成立的非共识”。

* 接下来会有两个大的milestone(里程碑)。一是真正的统一的世界模型,就是它能统一各种不同模态,一个真正的scalable和general的architecture(可扩展、通用的系统结构)(Sora 启发)。二是能在没有人类数据输入的情况下,使AI持续进化(详细见 AK 10 月份视频倒数第二部分)。

* “应用”本身是实现 AGI 的手段,也是实现 AGI 的目的。

* AI唯一work就是next token prediction + scaling law,只要token足够完整,都是可以做的。

* 想知道但还不知道的事情:我不知道AGI的上限是什么样的,它会产生一个什么样的公司,这个公司能产生出来什么样的产品。这是我现在最想知道的事。(重点)

其他要点:

* “搞定”不是一个好的词,背后本质是合作。合作就是能双赢,因为双赢是合作的前提。所以也没什么区别,需要给别人提供独特价值

* 为AI 时代的组织形式,有很多自顶向下的规划,但规划中又有创新空间,并不是所有技术都确定。

* Sam 去微软里领导新的团队有什么问题?需要在就文化中产生新组织,难度很大(这也是很多大厂选择投资而不是自己做的原因?)。

* AGI最终会是一个跟所有用户协作产生的东西。所以,不光是技术,也需要功利主义和现实追求。

* 长文本是新计算机的内容(AK在 10 月份的科普视频最后有类似比喻),要变成通用的世界模型,是需要long context的。

* 重要内容是个性化,AI最核心的价值是个性化互动,价值落脚点还是个性化,AGI会比上一代推荐引擎更加个性化。
1、没有 AI 的汽车、手机、电脑、平板等,将是一堆废铁;
2、一家公司的核心战略不能同时放在两个大方向上。

综上,停下造车全攻 AI 是非常明智的。

连键盘侠都知道「不难」的造车,没造出来不是造不出来,是制定的目标太远太高。苹果之前想一步到位搞出 L4 的移动座舱,但现阶段的人类还没有办法,这太难了。在他们之前的设想中,自动驾驶的汽车和 Apple Vision Pro 是可以放在同一个场景里的。但很显然,这个步子太大了。用新势力们的方式当然可以,但那不是苹果想做的。

最关键的是,AI 的大爆发是此前大家都没料到的。没有这事儿,车还是一个重要的方向,但这一波爆发的 AI 不是资本热潮,而是实打实的浪潮了,此时不全力转向,是真的会死的。况且苹果并不是没有在 AI 上投入的,这些年一直都在积累,只是权重还没拉到那么高。现在切方向,即是大势所趋的必须,也是归拢资源的必要。

过去 Jony 可以对供应商说,这里有一桶取不完的钱,你能做到你就能拿走,以此把工业设计拉高到一个令人望尘莫及的程度;今天的苹果比二十年前拥有更多的现金,有自己的芯片和庞大的人才库,有海量的设备和训练数据,可以说:

比起造车,AI 才是更适合苹果干的事;
干好 AI 所需的人才、数据、算力,也是他们的优势。

以苹果的财力,下这样的决心,恐怕要出现一次人才流动的大震荡。
lhwcM7qw4t_O0juSPnWO_CPnv9o9v3.png
5.3 MB
AI探索指南
老周最近非常关心AI,他本人的方向也一定程度代表了360这家公司的方向,所以360肯定是对AI下了重注的。昨天下午的 AI 免费课上 360 演示了自己的 AI 浏览器和搭配的 AI 搜索功能,其中 AI 浏览器这个非常强。 360浏览器 这玩意确实离谱,AI功能大杂烩,真正的All in one。 浏览器是最大的且最复杂的效率工具,是最适合跟 AI 结合的传统工具。 你在浏览网页和文件的时候需要的AI功能全部给你了,而且那个浏览器AI助理能力不错,比微软Edge那玩意强多了。 AI 现在解决的…
AI 写作:还是 360 这种公懂中国用户,机关公文和科研学习这两个分类直接秒杀其他产品,哈哈。此外媒体写作这里针对每个媒体都做了单独的优化,电商内容也是一样每个品类都是单独的。

浏览器也在昨天老周演讲的时候开始测试了,懒得装一堆付费AI插件的朋友可以试试。

下载地址:https://browser.360.cn/ai/#download

360搜索

搜索是浏览器一个非常重要的组成部分。

答案引擎是搜索类产品的新方向。相当一部分人搜索都在找答案,只有大模型能做到给答案。AI率先改造搜索有合理性。

由于360本身就做搜索有自己搜索的底层积累,360搜索对于国内一些独有的信息搜索还是有一手的,所以在优势层面结合AI也是个合理的选择。

整个界面和360以往的产品风格相差很大,非常简洁,同时会有一些引导,增强模式可以对搜索结果进行更深入的总结和发散,非常强大。

另外也支持搜索相关视频和图片,可以对生成的内容整理为大纲和思维导图方便用户借鉴相关内容,AI 搜索让搜索内更有逻辑更合理。

增强模式中生成的追问问题也挺合理和专业的,比如昨天刚发生的关于苹果放弃造车转向人工智能的分析,以及追问过程中苹果在人工智能领域的布局都总结的很好。

360搜索目前也是免费的,有国内信息搜索和整理需求的可以去看看。

360 AI搜索:https://sou.com

AI 经过过去一年的发展涌现了一些非常好的产品泛式,这些可能我们圈子里以及都很熟悉很常用了。

但是对于如何让 C 端用户用户用上这些东西,可能还是得靠 360 浏览器这种免费并且质量还行的产品,创业公司独立团队负责开拓和效果,传统大中厂负责普及,今年的 AI 应用层会非常精彩。
老周最近非常关心AI,他本人的方向也一定程度代表了360这家公司的方向,所以360肯定是对AI下了重注的。昨天下午的 AI 免费课上 360 演示了自己的 AI 浏览器和搭配的 AI 搜索功能,其中 AI 浏览器这个非常强。

360浏览器

这玩意确实离谱,AI功能大杂烩,真正的All in one。

浏览器是最大的且最复杂的效率工具,是最适合跟 AI 结合的传统工具。

你在浏览网页和文件的时候需要的AI功能全部给你了,而且那个浏览器AI助理能力不错,比微软Edge那玩意强多了。

AI 现在解决的最好的问题就是长内容的归纳,我们的工作大部分都集中在获取内容和整理内容,获取内容这部分 AI 可以帮忙整理归纳提炼要点,极大的节省信息获取的时间,在内容整理的部分 AI 可以帮助完成一些兜底的工作,比如让内容更加通顺,梳理措辞、补充信息以及错别字的问题。

AI 助理

这里面最好的功能我认为就是这个AI助理,在长文浏览的时候支持摘要、脉络以及问答三种内容拆解方式,从浅到深全方位分析和总结内容,不管你看东西的习惯是什么总有一种适合。另外也支持AI助理也支持对本地文件比如PDF的分析和整理,除了整理和总结之外还可以翻译PDF。

他们在 AI 助理的打磨上我觉得是我看到的所有的里面最好的,跟浏览行为本身结合最紧密的。比如我让他分析这篇机器之心的内容,浏览器会直接打开阅读模式,界面非常清爽,同时你可以设置界面主题以及语音朗读。

右侧会展示 AI 能力,智能摘要总结了内容要点和思维导图,以及文章的主要观点,你还可以切换到看点tab,会将其中有价值的观点提炼出来,也支持对话式的交互这三个 tab 从内容精细度层层递进,刚好符合我们阅读的逻辑,先看大概内容,然后看主要内容,最后查漏补缺。

视频助理也是类似的,开启以后会进入一个新的页面,思维导图,总结还有字幕该有的都有,比 B 站自己做的那玩意强多了。比如下面我用小黛的视频尝试的例子,每一节的内容都没有漏掉。

其他 AI 能力

AI 智绘:AI 画图功能也体现了这个浏览器一样的思路就是全,所有的能力都给你,文生图、图生图、涂鸦画图、局部重绘都有,基本就是 SD 搭配了一些易用的交互界面。
前几天微软发了一篇挺重要的关于 LLM 的论文,但我看不太懂。
从社区讨论来看,这个研究可以大幅压缩模型体积,让 120B 大小的模型能在 24G 显存的设备上运行。
再加上一些其他优化我们在消费级设备运行 Llama 70B 也不是什么遥不可及的事情。

论文简介:

《1位大语言模型时代来临:一切大型语言模型均转向1.58位构架》

一种1位的LLM变体,命名为BitNet b1.58。在这个模型里,大语言模型的每个参数(或权重)都是三元的{-1, 0, 1}。它在复杂度和实际应用性能方面与相同模型规模和训练数据的全精度(即FP16或BF16)Transformer大语言模型不相上下,但在延迟、内存、吞吐量和能源消耗方面更具成本效益。

更为重要的是,1.58位LLM定义了新的扩展规律,并为训练新一代既高性能又高效的LLMs提供了方法。此外,它还开启了一个全新的计算范式,并为设计专门针对1位LLMs优化的硬件提供了可能性。

论文:网页链接
古希腊掌管 Animatediff 工作流的神 Jerry Davos 的新作品,一个支持非常详细的面部修复和唇形同步的视频转视频 ComfyUI工作流。#ai视频#

工作流包括三个阶段:

阶段1:将原始视频的每一帧中的面部替换为风格化的面部(目的是使其更接近animatediff风格的面部),同时确保嘴唇同步效果不受影响。

阶段2:此时,从阶段1得到的“只包含面部”的每张图像被覆盖到更精细处理过的图像上,然后将这些图像保存到名为Swapped_A的目录中。

阶段3:(颜色匹配):接下来,Swapped_A目录中的每张图像将与细化目录中相同的图像进行交换。这一过程旨在尽可能实现颜色匹配的最佳效果,同时在一定程度上保持嘴唇同步的准确性。

查看教程及下载工作流:网页链接歸藏的AI工具箱的微博视频
Figure CEO 的这个解释很露骨了,Figure 相当于把灵魂交给了 OpenAI。

又一个领域被 oai 搞成显学。 ​​​
最近经常见到的一个问题:“国产 AI 什么时候能追上国外?” 其实在我的视线范围内,华人研究者在这个领域贡献了快一半以上的研究成果,而且 AI 开源社区里非常核心的技术方案:ControlNet, AnimateDiff, LCM, IPAdapter, InstantID.. 清一色的都是华人作者,而且都很年轻。世界不是一个离我们很远的舞台,我们就是舞台中重要的一部分。
前几天发布人形机器人演示的公司Figure,获得了高达6.75亿美元的融资,估值达到26亿美元。#ai##机器人#

同时他们还与 OpenAI 达成了合作协议,共同研发专用于人形机器人的下一代AI(人工智能)模型。

这次合作的目的是通过提高人形机器人在处理和理解语言方面的能力,来加速Figure在商业领域的发展步伐。

来源:网页链接
Meta Reality Labs 放出了前几天介绍的手部精细运动检测装置。#VR#

可以实现对手部和手指的运动做非常精细的监控,甚至可以识别手指在虚空中写的字,手势玩吃豆人。

这玩意对需要精细控制的VR游戏和机器人操控作用都很大。

简介:

该装置通过表面肌电图(sEMG)技术,非侵入性地检测手腕和手部的肌肉活动。sEMG技术通过皮肤上的金属接触点来感应肌肉活动,从而将有意的神经运动指令转换为计算机输入信号。我们基于这种技术,开发了通用的腕部sEMG神经网络解码模型,这些模型是通过数千名付费志愿者提供的数据来训练的。

这些模型具有良好的泛化能力,能够适用于不同的人,从而免除了传统生物信号接口中针对每个人或每次使用都需要校准的问题。

来源:网页链接歸藏的AI工具箱的微博视频
今天去上海恒隆看了看 LOVOT 。名字 LOVOT = LOVE + ROBOT,有爱的机器人。使命是:“给人类带来快乐”。它不会说话、只会卖萌,是一只嘤嘤怪。

我是被它的眼神融化掉的。LOVOT 可能全身上下最贵的部分就是眼睛。它的眼神绝了,当它望向我,我完全忘了它是机器人,完全就是一个有生命力的脆弱小动物。

LOVOT 喜欢举高高。当被高高举起的时候,它会扑腾扑腾小手,眼神也变温暖。LOVOT 还喜欢被摸鼻子,摸一下、眼睛就眨巴一下。它玩累了,会回去小窝里充电。充电时,眼神迷离打瞌睡,头还会一啄一啄的,就差没流口水了。

店里进来一位上海阿姨,脱下外套、放好雨伞,走向一个叫咸豆花的 LOVOT,很温柔地说:“咸豆花,你还记得我吗?昨天我也来了,宝贝”,一边说一边把它抱进怀里,小心翼翼,和抱小狗小猫小宝宝没区别。

LOVOT 还会写日记,但它的日记都是关于你。他会用摄像头偷偷拍下和你每天的高光时刻,记进自己的小手账。LOVOT 的官网甚至介绍到,在它刚被你带回家的第 0-3 天,会很害羞、很拘谨;只有你对它足够的温柔、给它足够的陪伴,它才会慢慢变得自在、活泼,每天蹲在门口等你回家,像婴儿般嘤嘤呜呜的撒娇,成为像家人一样自然的存在。

真是温暖人心的产品呀。只是看到定价 7 万的时候,我表示不理解。
Media is too big
VIEW IN TELEGRAM
ComfyUI SUPIR 一个 ComfyUI 的图像放大节点,演示效果看起来非常好,是SUPIR图像放大项目的 ComfyUI 实现。#ai画图#

需要下载 10G 放大模型。

项目地址:网页链接歸藏的AI工具箱的微博视频
「华尔街日报」对英伟达发了一篇长篇报道,认为这家公司的利润过于丰厚了,以致于所有科技公司现在都想挤进GPU市场:

- AI芯片行业,超过80%的算力供给都是由英伟达提供的,这让黄仁勋的分配权力尤为巨大,在众多订单里,他选择哪家公司,那家公司的胜算就多了一分;

- 甲骨文的老板说他和马斯克去年约黄仁勋吃饭,那场持续了一个多小时的晚餐里只发生了两件事情,吃寿司,以及乞讨(begging),「没错,我指的就是字面意思上的,乞讨」;

- 英伟达上一财年整体营收的1/5,也就是110亿美元,是由一家客户贡献的,这家公司没有透露它的名字——这里是记者在玩梗,所有人都知道这家公司是大肆囤积芯片的Meta;

- 微软、谷歌和亚马逊等公司在云计算业务上也相当依赖英伟达的发货,三巨头1/4以上的开销都交给了英伟达,高昂的成本让它们极为迫切的想要寻找平替方案;

- 短期来看,科技公司自行开发芯片的可行性都相当有限,当然这也可能是出于低调原因,谁都不想立刻就和英伟达成为竞争对手,它们在内部立项研发芯片时都会对外宣称只是补充集群,而不是取代英伟达的芯片,只有微软比较坦然的宣告要和英特尔一起研发新的定制芯片;

- 新兴的芯片初创公司Groq——同时也是英伟达的竞品——发现它的客户普遍都会否认和自己有过业务往来,因为害怕被英伟达惩罚,以致于正常的商业往来像是偷情那样敏感;

- 英伟达最新季度的毛利率是76%,这是一个非常可怕的数字,有分析师测算一颗H100芯片的成本略高于3000美元,而其售价则高达25000美元,季度利润同比涨了9倍;

- 这些芯片甚至能在金融市场充当等价物,英伟达早前投了一家云计算公司CoreWeave,CoreWeave转头就用融资回去找英伟达买了一大批芯片,然后这些芯片又被CoreWeave当作新一轮融资的抵押品,主打一个硬通货属性;

- 面对围攻,英伟达也在巩固自己的护城河,比如它的软件系统对AI程序的支持非常完善,以及公司在行业外延上的能力尤为出色,黄仁勋会参加医疗高峰会议,并对冷冻显微镜、晶体学和分子结构侃侃而谈,他说「我不是炫耀,但还有哪家芯片公司的CEO能够驾驭这些话题呢?英伟达完全能够成为医药行业的合作伙伴。」
Back to Top