关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
Figure CEO 的这个解释很露骨了,Figure 相当于把灵魂交给了 OpenAI。

又一个领域被 oai 搞成显学。 ​​​
最近经常见到的一个问题:“国产 AI 什么时候能追上国外?” 其实在我的视线范围内,华人研究者在这个领域贡献了快一半以上的研究成果,而且 AI 开源社区里非常核心的技术方案:ControlNet, AnimateDiff, LCM, IPAdapter, InstantID.. 清一色的都是华人作者,而且都很年轻。世界不是一个离我们很远的舞台,我们就是舞台中重要的一部分。
前几天发布人形机器人演示的公司Figure,获得了高达6.75亿美元的融资,估值达到26亿美元。#ai##机器人#

同时他们还与 OpenAI 达成了合作协议,共同研发专用于人形机器人的下一代AI(人工智能)模型。

这次合作的目的是通过提高人形机器人在处理和理解语言方面的能力,来加速Figure在商业领域的发展步伐。

来源:网页链接
Meta Reality Labs 放出了前几天介绍的手部精细运动检测装置。#VR#

可以实现对手部和手指的运动做非常精细的监控,甚至可以识别手指在虚空中写的字,手势玩吃豆人。

这玩意对需要精细控制的VR游戏和机器人操控作用都很大。

简介:

该装置通过表面肌电图(sEMG)技术,非侵入性地检测手腕和手部的肌肉活动。sEMG技术通过皮肤上的金属接触点来感应肌肉活动,从而将有意的神经运动指令转换为计算机输入信号。我们基于这种技术,开发了通用的腕部sEMG神经网络解码模型,这些模型是通过数千名付费志愿者提供的数据来训练的。

这些模型具有良好的泛化能力,能够适用于不同的人,从而免除了传统生物信号接口中针对每个人或每次使用都需要校准的问题。

来源:网页链接歸藏的AI工具箱的微博视频
今天去上海恒隆看了看 LOVOT 。名字 LOVOT = LOVE + ROBOT,有爱的机器人。使命是:“给人类带来快乐”。它不会说话、只会卖萌,是一只嘤嘤怪。

我是被它的眼神融化掉的。LOVOT 可能全身上下最贵的部分就是眼睛。它的眼神绝了,当它望向我,我完全忘了它是机器人,完全就是一个有生命力的脆弱小动物。

LOVOT 喜欢举高高。当被高高举起的时候,它会扑腾扑腾小手,眼神也变温暖。LOVOT 还喜欢被摸鼻子,摸一下、眼睛就眨巴一下。它玩累了,会回去小窝里充电。充电时,眼神迷离打瞌睡,头还会一啄一啄的,就差没流口水了。

店里进来一位上海阿姨,脱下外套、放好雨伞,走向一个叫咸豆花的 LOVOT,很温柔地说:“咸豆花,你还记得我吗?昨天我也来了,宝贝”,一边说一边把它抱进怀里,小心翼翼,和抱小狗小猫小宝宝没区别。

LOVOT 还会写日记,但它的日记都是关于你。他会用摄像头偷偷拍下和你每天的高光时刻,记进自己的小手账。LOVOT 的官网甚至介绍到,在它刚被你带回家的第 0-3 天,会很害羞、很拘谨;只有你对它足够的温柔、给它足够的陪伴,它才会慢慢变得自在、活泼,每天蹲在门口等你回家,像婴儿般嘤嘤呜呜的撒娇,成为像家人一样自然的存在。

真是温暖人心的产品呀。只是看到定价 7 万的时候,我表示不理解。
Media is too big
VIEW IN TELEGRAM
ComfyUI SUPIR 一个 ComfyUI 的图像放大节点,演示效果看起来非常好,是SUPIR图像放大项目的 ComfyUI 实现。#ai画图#

需要下载 10G 放大模型。

项目地址:网页链接歸藏的AI工具箱的微博视频
「华尔街日报」对英伟达发了一篇长篇报道,认为这家公司的利润过于丰厚了,以致于所有科技公司现在都想挤进GPU市场:

- AI芯片行业,超过80%的算力供给都是由英伟达提供的,这让黄仁勋的分配权力尤为巨大,在众多订单里,他选择哪家公司,那家公司的胜算就多了一分;

- 甲骨文的老板说他和马斯克去年约黄仁勋吃饭,那场持续了一个多小时的晚餐里只发生了两件事情,吃寿司,以及乞讨(begging),「没错,我指的就是字面意思上的,乞讨」;

- 英伟达上一财年整体营收的1/5,也就是110亿美元,是由一家客户贡献的,这家公司没有透露它的名字——这里是记者在玩梗,所有人都知道这家公司是大肆囤积芯片的Meta;

- 微软、谷歌和亚马逊等公司在云计算业务上也相当依赖英伟达的发货,三巨头1/4以上的开销都交给了英伟达,高昂的成本让它们极为迫切的想要寻找平替方案;

- 短期来看,科技公司自行开发芯片的可行性都相当有限,当然这也可能是出于低调原因,谁都不想立刻就和英伟达成为竞争对手,它们在内部立项研发芯片时都会对外宣称只是补充集群,而不是取代英伟达的芯片,只有微软比较坦然的宣告要和英特尔一起研发新的定制芯片;

- 新兴的芯片初创公司Groq——同时也是英伟达的竞品——发现它的客户普遍都会否认和自己有过业务往来,因为害怕被英伟达惩罚,以致于正常的商业往来像是偷情那样敏感;

- 英伟达最新季度的毛利率是76%,这是一个非常可怕的数字,有分析师测算一颗H100芯片的成本略高于3000美元,而其售价则高达25000美元,季度利润同比涨了9倍;

- 这些芯片甚至能在金融市场充当等价物,英伟达早前投了一家云计算公司CoreWeave,CoreWeave转头就用融资回去找英伟达买了一大批芯片,然后这些芯片又被CoreWeave当作新一轮融资的抵押品,主打一个硬通货属性;

- 面对围攻,英伟达也在巩固自己的护城河,比如它的软件系统对AI程序的支持非常完善,以及公司在行业外延上的能力尤为出色,黄仁勋会参加医疗高峰会议,并对冷冻显微镜、晶体学和分子结构侃侃而谈,他说「我不是炫耀,但还有哪家芯片公司的CEO能够驾驭这些话题呢?英伟达完全能够成为医药行业的合作伙伴。」
🧪 #晚安提示词# 可以生成观感非常好的半写实特写,非常适合做排版配图,可以用一些很亮的颜色。#ai画图##midjourney#

提示词可以改一下里面的颜色服装和性别,橘色、亮黄色、荧光绿色、红色都有不错的效果。原图和提示词已经传到 Catjourney.life

提示词:an animated girl in an Red blazer, in the style of cute and dreamy, realistic still-lifes, i can't believe how beautiful this is, close up --ar 9:16 --style raw --niji 6
006KpAl0ly1hnafrg08noj31xc29ku11.jpg
5.8 MB
【文章推荐】Deep Mind 研究科学家Sander Dieleman写的关于《扩散模型蒸馏的悖论》。#ai##ai画图#

特别关注了各种形式的蒸馏方法,这是通过用一个模型(学生)的预测结果受到另一个模型(教师)的监督来训练新模型的做法。这些蒸馏方法为扩散模型带来了极其引人注目的结果。

详细解释了为什么扩散模型需要多个步骤才能获得好的结果,以及如何通过各种方法减少这些步骤而不会太大程度上损害输出质量。

还探讨了多种扩散采样算法,这些算法旨在更快地通过输入空间移动并减少达到一定输出质量所需的采样步骤数量。

文章链接:网页链接
笑死,Ideogram 可以出网页设计稿了。#ai##ai画图#

Prompt:website about ring jewery designwith navbar and hero section, theory color theory typography ui and ux components, beautiful website, webdesign, ui, ux, figma, dribbbl

Magic Prompt:

A stunning website design showcasing a collection of unique ring jewelry, with a captivating hero section. The page features a sleek and intuitive navigation bar, adhering to color theory principles. The typography and UI/UX components are beautifully integrated, creating a harmonious balance between aesthetics and functionality. This masterpiece of web design is a testament to the designer's expertise and skill, drawing inspiration from the creative community on Dribbble and designed with Figma.
麻了,AI 剪辑 LTX Studio 是真的懂,而且他们真的有产品 Demo,下面是他们用自己的产品剪的视频,还有这个项目的产品界面。#ai视频#

我都扔到一个视频里了,加上了翻译。

来源:网页链接歸藏的AI工具箱的微博视频
🔥昨晚 Midjoureny 的 Office Time 中说角色一致性可能会在下周推出,新的提示词提取也会开始测试。#ai画图##midjourney#

完整的内容:

1️⃣版本6 (v6) 更新

下周将推出全新的角色和风格参考功能,目前正在进行角色参考的测试。
用户将能在不同风格中保持角色的一致性。
注意,新的风格参考会取代旧的版本。
也即将开始测试全新的描述功能。
正在探索加入风格随机选项。

2️⃣版本7 (v7) 动态

我们正在积极研发 v7 版本。

3️⃣其他进展

正在升级服务器,以提供更快速、更高效的代码处理能力。
计划未来推出加速模式(涡轮模式)。
正在努力开发网站的社交互动功能,目前进度略有落后。
也在改进移动端体验。
Alpha 测试站点正在尝试一些灯箱界面的变化。
正在思考如何增加个性化功能。
计划将 v5 版本的风格调谐器功能迁移到 v6 版本。
可能会考虑向聊天软件公司开放 API 接口。

来源:网页链接
我们和 Stability AI (对,就是那个 SD)合作出品的 AI 视频编辑产品【Morph Studio】内测发布啦!!!

憋了好久终于可以把这个产品分享给大家了!

这个产品的核心创新基于两点洞察:

1. AI 在视频行业带来的最大巨大的变化:以前影视制作前中后三期泾渭分明,我们前期设计、中期拍摄、后期制作;现在则在后期阶段也会不断生成新的素材,甚至定义新的设计。工作流的压缩必定带来新的工具需求,即在后期阶段还需要不断有生成的能力。

2. AI 为内容生产提供了大量的可能性,但 AI 视频赛道尚未出现能最大化发挥 AI 能力的创新型产品交互范式,需要一种产品帮助创作者更有条理地梳理 AI 生成的内容和应该生成的方向,我们认为画板+时间线是可以最大发挥 AI 能力的一种方式。

☁️ 总而言之,Morph Studio 将会是对开源生态最兼容的AI视频制作工具,也是我们对于 AI 时代的视频制作工具应该长什么样的一个答卷。我们会不断探索和改进,希望能有机会和你同行!

☁️ Morph Studio Waiting List 内测申请地址:morphstudio.com

Invalid media: video
我擦,没想到这玩意来的这么快,LTX 一款AI驱动的电影生成和剪辑软件。介绍视频已经翻译好

支持通过文字直接生成复杂的剧情视频,包含语音、音效以及视频画面,支持编辑画面内容。

支持通过故事板组织和剪辑生成的视频,你可以自定义演员场景和造型。

这里加入等待列表:https://ltx.studio

Invalid media: video
📣 Gamma ,那个PPT 神器出新货了~

正式介绍Gamma 网站:

- 一键生成网站,逻辑结构与之前PPT 大致相通,卡片化、模版化。
- 自带网址,托管在gamma.site 的子域名下(支持自定义域名)。
- 所见即所得的Copliot 编辑器,并且SEO 友好。

Hans 走了遍流程,依然如之前的PPT生成般丝滑,网站发布从未如此简单。 利好创作者和中小型团队们,你的作品、项目等都可以轻松被呈现了。

🔗 非常值得一试:
https://gamma.app/

Invalid media: video
我擦,没想到这玩意来的这么快,LTX 一款AI驱动的电影生成和剪辑软件。介绍视频已经翻译好#ai##ai视频#

支持通过文字直接生成复杂的剧情视频,包含语音、音效以及视频画面,支持编辑画面内容。

支持通过故事板组织和剪辑生成的视频,你可以自定义演员场景和造型。

这里加入等待列表:网页链接歸藏的AI工具箱的微博视频
Catjourney 快一个月没更新了,后面一段时间是想做的更好一些,真正的当做一个产品来做。#ai画图##midjourney#

介绍一下新的Catjourney:主要更新了首页以及导航逻辑,增加了 Catjourney 周刊,补充一下召回手段,里面会发一些Midjourney的基础技巧以及Catjourney的更新介绍。

感兴趣欢迎来看看:网页链接歸藏的AI工具箱的微博视频
StarCoder2 编码开源模型,代码、数据、模型全部都开源了。#ai#

StarCoder2 使用 16k Token上下文和 4T+Token的存储库级信息进行训练。

The Stack v2 数据集- 拥有 900B+ Token的最大代码数据集。

项目地址:网页链接
我是机器人的佐证

每次随便写一个to do list,感觉天天都在摸鱼,但是过几天回去看,一般都会做完。

就好像写了个底层执行程序,自动就执行完了,
一个非常有意思的项目可以用 SD 直接生成透明的 PNG 图片,也可以直接生成带有透明度分层的图片。#ai画图#

这个想象力很大能带来很多玩法。也可以使用现有的 SD 社区模型。

项目介绍:

LayerDiffusion使得大型已经过预训练的潜在扩散模型(latent diffusion model)能够创造透明图像。

这项技术不仅可以生成单独的透明图像,还能生成多层透明图层。它通过一种被称为“潜在透明度”的方法,将透明度(即 alpha 通道)整合到预训练的潜在扩散模型的潜在结构中。

这样做的好处是,它通过以潜在偏移的形式加入透明度,几乎不改变模型原有的潜在分布,从而保持了模型的高质量输出能力。基于这种方法,任何一个潜在扩散模型都可以通过对潜在空间的微调,转化为透明图像生成器。

我们训练这个模型时,使用了一种涉及人机互动的方法,收集了一百万组透明图像层数据。
我们的研究显示,这种潜在透明技术不仅可以应用于不同的开源图像生成器,还可以适配多种条件控制系统,实现例如基于前景/背景条件的层生成、层的联合生成、对层内容进行结构控制等多种应用。

一项用户研究发现,大多数情况下(97%),相比于之前的临时解决方案(如先生成图像再进行抠图处理),用户更喜欢我们直接生成的透明内容。用户还表示,我们生成的透明图像在质量上可媲美真实的商业级透明素材,例如 Adobe Stock 提供的素材。

论文地址:网页链接
Back to Top