关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
老周最近非常关心AI,他本人的方向也一定程度代表了360这家公司的方向,所以360肯定是对AI下了重注的。昨天下午的 AI 免费课上 360 演示了自己的 AI 浏览器和搭配的 AI 搜索功能,其中 AI 浏览器这个非常强。

360浏览器

这玩意确实离谱,AI功能大杂烩,真正的All in one。

浏览器是最大的且最复杂的效率工具,是最适合跟 AI 结合的传统工具。

你在浏览网页和文件的时候需要的AI功能全部给你了,而且那个浏览器AI助理能力不错,比微软Edge那玩意强多了。

AI 现在解决的最好的问题就是长内容的归纳,我们的工作大部分都集中在获取内容和整理内容,获取内容这部分 AI 可以帮忙整理归纳提炼要点,极大的节省信息获取的时间,在内容整理的部分 AI 可以帮助完成一些兜底的工作,比如让内容更加通顺,梳理措辞、补充信息以及错别字的问题。

AI 助理

这里面最好的功能我认为就是这个AI助理,在长文浏览的时候支持摘要、脉络以及问答三种内容拆解方式,从浅到深全方位分析和总结内容,不管你看东西的习惯是什么总有一种适合。另外也支持AI助理也支持对本地文件比如PDF的分析和整理,除了整理和总结之外还可以翻译PDF。

他们在 AI 助理的打磨上我觉得是我看到的所有的里面最好的,跟浏览行为本身结合最紧密的。比如我让他分析这篇机器之心的内容,浏览器会直接打开阅读模式,界面非常清爽,同时你可以设置界面主题以及语音朗读。

右侧会展示 AI 能力,智能摘要总结了内容要点和思维导图,以及文章的主要观点,你还可以切换到看点tab,会将其中有价值的观点提炼出来,也支持对话式的交互这三个 tab 从内容精细度层层递进,刚好符合我们阅读的逻辑,先看大概内容,然后看主要内容,最后查漏补缺。

视频助理也是类似的,开启以后会进入一个新的页面,思维导图,总结还有字幕该有的都有,比 B 站自己做的那玩意强多了。比如下面我用小黛的视频尝试的例子,每一节的内容都没有漏掉。

其他 AI 能力

AI 智绘:AI 画图功能也体现了这个浏览器一样的思路就是全,所有的能力都给你,文生图、图生图、涂鸦画图、局部重绘都有,基本就是 SD 搭配了一些易用的交互界面。
前几天微软发了一篇挺重要的关于 LLM 的论文,但我看不太懂。
从社区讨论来看,这个研究可以大幅压缩模型体积,让 120B 大小的模型能在 24G 显存的设备上运行。
再加上一些其他优化我们在消费级设备运行 Llama 70B 也不是什么遥不可及的事情。

论文简介:

《1位大语言模型时代来临:一切大型语言模型均转向1.58位构架》

一种1位的LLM变体,命名为BitNet b1.58。在这个模型里,大语言模型的每个参数(或权重)都是三元的{-1, 0, 1}。它在复杂度和实际应用性能方面与相同模型规模和训练数据的全精度(即FP16或BF16)Transformer大语言模型不相上下,但在延迟、内存、吞吐量和能源消耗方面更具成本效益。

更为重要的是,1.58位LLM定义了新的扩展规律,并为训练新一代既高性能又高效的LLMs提供了方法。此外,它还开启了一个全新的计算范式,并为设计专门针对1位LLMs优化的硬件提供了可能性。

论文:网页链接
古希腊掌管 Animatediff 工作流的神 Jerry Davos 的新作品,一个支持非常详细的面部修复和唇形同步的视频转视频 ComfyUI工作流。#ai视频#

工作流包括三个阶段:

阶段1:将原始视频的每一帧中的面部替换为风格化的面部(目的是使其更接近animatediff风格的面部),同时确保嘴唇同步效果不受影响。

阶段2:此时,从阶段1得到的“只包含面部”的每张图像被覆盖到更精细处理过的图像上,然后将这些图像保存到名为Swapped_A的目录中。

阶段3:(颜色匹配):接下来,Swapped_A目录中的每张图像将与细化目录中相同的图像进行交换。这一过程旨在尽可能实现颜色匹配的最佳效果,同时在一定程度上保持嘴唇同步的准确性。

查看教程及下载工作流:网页链接歸藏的AI工具箱的微博视频
Figure CEO 的这个解释很露骨了,Figure 相当于把灵魂交给了 OpenAI。

又一个领域被 oai 搞成显学。 ​​​
最近经常见到的一个问题:“国产 AI 什么时候能追上国外?” 其实在我的视线范围内,华人研究者在这个领域贡献了快一半以上的研究成果,而且 AI 开源社区里非常核心的技术方案:ControlNet, AnimateDiff, LCM, IPAdapter, InstantID.. 清一色的都是华人作者,而且都很年轻。世界不是一个离我们很远的舞台,我们就是舞台中重要的一部分。
前几天发布人形机器人演示的公司Figure,获得了高达6.75亿美元的融资,估值达到26亿美元。#ai##机器人#

同时他们还与 OpenAI 达成了合作协议,共同研发专用于人形机器人的下一代AI(人工智能)模型。

这次合作的目的是通过提高人形机器人在处理和理解语言方面的能力,来加速Figure在商业领域的发展步伐。

来源:网页链接
Meta Reality Labs 放出了前几天介绍的手部精细运动检测装置。#VR#

可以实现对手部和手指的运动做非常精细的监控,甚至可以识别手指在虚空中写的字,手势玩吃豆人。

这玩意对需要精细控制的VR游戏和机器人操控作用都很大。

简介:

该装置通过表面肌电图(sEMG)技术,非侵入性地检测手腕和手部的肌肉活动。sEMG技术通过皮肤上的金属接触点来感应肌肉活动,从而将有意的神经运动指令转换为计算机输入信号。我们基于这种技术,开发了通用的腕部sEMG神经网络解码模型,这些模型是通过数千名付费志愿者提供的数据来训练的。

这些模型具有良好的泛化能力,能够适用于不同的人,从而免除了传统生物信号接口中针对每个人或每次使用都需要校准的问题。

来源:网页链接歸藏的AI工具箱的微博视频
今天去上海恒隆看了看 LOVOT 。名字 LOVOT = LOVE + ROBOT,有爱的机器人。使命是:“给人类带来快乐”。它不会说话、只会卖萌,是一只嘤嘤怪。

我是被它的眼神融化掉的。LOVOT 可能全身上下最贵的部分就是眼睛。它的眼神绝了,当它望向我,我完全忘了它是机器人,完全就是一个有生命力的脆弱小动物。

LOVOT 喜欢举高高。当被高高举起的时候,它会扑腾扑腾小手,眼神也变温暖。LOVOT 还喜欢被摸鼻子,摸一下、眼睛就眨巴一下。它玩累了,会回去小窝里充电。充电时,眼神迷离打瞌睡,头还会一啄一啄的,就差没流口水了。

店里进来一位上海阿姨,脱下外套、放好雨伞,走向一个叫咸豆花的 LOVOT,很温柔地说:“咸豆花,你还记得我吗?昨天我也来了,宝贝”,一边说一边把它抱进怀里,小心翼翼,和抱小狗小猫小宝宝没区别。

LOVOT 还会写日记,但它的日记都是关于你。他会用摄像头偷偷拍下和你每天的高光时刻,记进自己的小手账。LOVOT 的官网甚至介绍到,在它刚被你带回家的第 0-3 天,会很害羞、很拘谨;只有你对它足够的温柔、给它足够的陪伴,它才会慢慢变得自在、活泼,每天蹲在门口等你回家,像婴儿般嘤嘤呜呜的撒娇,成为像家人一样自然的存在。

真是温暖人心的产品呀。只是看到定价 7 万的时候,我表示不理解。
Media is too big
VIEW IN TELEGRAM
ComfyUI SUPIR 一个 ComfyUI 的图像放大节点,演示效果看起来非常好,是SUPIR图像放大项目的 ComfyUI 实现。#ai画图#

需要下载 10G 放大模型。

项目地址:网页链接歸藏的AI工具箱的微博视频
「华尔街日报」对英伟达发了一篇长篇报道,认为这家公司的利润过于丰厚了,以致于所有科技公司现在都想挤进GPU市场:

- AI芯片行业,超过80%的算力供给都是由英伟达提供的,这让黄仁勋的分配权力尤为巨大,在众多订单里,他选择哪家公司,那家公司的胜算就多了一分;

- 甲骨文的老板说他和马斯克去年约黄仁勋吃饭,那场持续了一个多小时的晚餐里只发生了两件事情,吃寿司,以及乞讨(begging),「没错,我指的就是字面意思上的,乞讨」;

- 英伟达上一财年整体营收的1/5,也就是110亿美元,是由一家客户贡献的,这家公司没有透露它的名字——这里是记者在玩梗,所有人都知道这家公司是大肆囤积芯片的Meta;

- 微软、谷歌和亚马逊等公司在云计算业务上也相当依赖英伟达的发货,三巨头1/4以上的开销都交给了英伟达,高昂的成本让它们极为迫切的想要寻找平替方案;

- 短期来看,科技公司自行开发芯片的可行性都相当有限,当然这也可能是出于低调原因,谁都不想立刻就和英伟达成为竞争对手,它们在内部立项研发芯片时都会对外宣称只是补充集群,而不是取代英伟达的芯片,只有微软比较坦然的宣告要和英特尔一起研发新的定制芯片;

- 新兴的芯片初创公司Groq——同时也是英伟达的竞品——发现它的客户普遍都会否认和自己有过业务往来,因为害怕被英伟达惩罚,以致于正常的商业往来像是偷情那样敏感;

- 英伟达最新季度的毛利率是76%,这是一个非常可怕的数字,有分析师测算一颗H100芯片的成本略高于3000美元,而其售价则高达25000美元,季度利润同比涨了9倍;

- 这些芯片甚至能在金融市场充当等价物,英伟达早前投了一家云计算公司CoreWeave,CoreWeave转头就用融资回去找英伟达买了一大批芯片,然后这些芯片又被CoreWeave当作新一轮融资的抵押品,主打一个硬通货属性;

- 面对围攻,英伟达也在巩固自己的护城河,比如它的软件系统对AI程序的支持非常完善,以及公司在行业外延上的能力尤为出色,黄仁勋会参加医疗高峰会议,并对冷冻显微镜、晶体学和分子结构侃侃而谈,他说「我不是炫耀,但还有哪家芯片公司的CEO能够驾驭这些话题呢?英伟达完全能够成为医药行业的合作伙伴。」
🧪 #晚安提示词# 可以生成观感非常好的半写实特写,非常适合做排版配图,可以用一些很亮的颜色。#ai画图##midjourney#

提示词可以改一下里面的颜色服装和性别,橘色、亮黄色、荧光绿色、红色都有不错的效果。原图和提示词已经传到 Catjourney.life

提示词:an animated girl in an Red blazer, in the style of cute and dreamy, realistic still-lifes, i can't believe how beautiful this is, close up --ar 9:16 --style raw --niji 6
006KpAl0ly1hnafrg08noj31xc29ku11.jpg
5.8 MB
【文章推荐】Deep Mind 研究科学家Sander Dieleman写的关于《扩散模型蒸馏的悖论》。#ai##ai画图#

特别关注了各种形式的蒸馏方法,这是通过用一个模型(学生)的预测结果受到另一个模型(教师)的监督来训练新模型的做法。这些蒸馏方法为扩散模型带来了极其引人注目的结果。

详细解释了为什么扩散模型需要多个步骤才能获得好的结果,以及如何通过各种方法减少这些步骤而不会太大程度上损害输出质量。

还探讨了多种扩散采样算法,这些算法旨在更快地通过输入空间移动并减少达到一定输出质量所需的采样步骤数量。

文章链接:网页链接
笑死,Ideogram 可以出网页设计稿了。#ai##ai画图#

Prompt:website about ring jewery designwith navbar and hero section, theory color theory typography ui and ux components, beautiful website, webdesign, ui, ux, figma, dribbbl

Magic Prompt:

A stunning website design showcasing a collection of unique ring jewelry, with a captivating hero section. The page features a sleek and intuitive navigation bar, adhering to color theory principles. The typography and UI/UX components are beautifully integrated, creating a harmonious balance between aesthetics and functionality. This masterpiece of web design is a testament to the designer's expertise and skill, drawing inspiration from the creative community on Dribbble and designed with Figma.
麻了,AI 剪辑 LTX Studio 是真的懂,而且他们真的有产品 Demo,下面是他们用自己的产品剪的视频,还有这个项目的产品界面。#ai视频#

我都扔到一个视频里了,加上了翻译。

来源:网页链接歸藏的AI工具箱的微博视频
Back to Top