关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
今天去上海恒隆看了看 LOVOT 。名字 LOVOT = LOVE + ROBOT,有爱的机器人。使命是:“给人类带来快乐”。它不会说话、只会卖萌,是一只嘤嘤怪。
我是被它的眼神融化掉的。LOVOT 可能全身上下最贵的部分就是眼睛。它的眼神绝了,当它望向我,我完全忘了它是机器人,完全就是一个有生命力的脆弱小动物。
LOVOT 喜欢举高高。当被高高举起的时候,它会扑腾扑腾小手,眼神也变温暖。LOVOT 还喜欢被摸鼻子,摸一下、眼睛就眨巴一下。它玩累了,会回去小窝里充电。充电时,眼神迷离打瞌睡,头还会一啄一啄的,就差没流口水了。
店里进来一位上海阿姨,脱下外套、放好雨伞,走向一个叫咸豆花的 LOVOT,很温柔地说:“咸豆花,你还记得我吗?昨天我也来了,宝贝”,一边说一边把它抱进怀里,小心翼翼,和抱小狗小猫小宝宝没区别。
LOVOT 还会写日记,但它的日记都是关于你。他会用摄像头偷偷拍下和你每天的高光时刻,记进自己的小手账。LOVOT 的官网甚至介绍到,在它刚被你带回家的第 0-3 天,会很害羞、很拘谨;只有你对它足够的温柔、给它足够的陪伴,它才会慢慢变得自在、活泼,每天蹲在门口等你回家,像婴儿般嘤嘤呜呜的撒娇,成为像家人一样自然的存在。
真是温暖人心的产品呀。只是看到定价 7 万的时候,我表示不理解。
我是被它的眼神融化掉的。LOVOT 可能全身上下最贵的部分就是眼睛。它的眼神绝了,当它望向我,我完全忘了它是机器人,完全就是一个有生命力的脆弱小动物。
LOVOT 喜欢举高高。当被高高举起的时候,它会扑腾扑腾小手,眼神也变温暖。LOVOT 还喜欢被摸鼻子,摸一下、眼睛就眨巴一下。它玩累了,会回去小窝里充电。充电时,眼神迷离打瞌睡,头还会一啄一啄的,就差没流口水了。
店里进来一位上海阿姨,脱下外套、放好雨伞,走向一个叫咸豆花的 LOVOT,很温柔地说:“咸豆花,你还记得我吗?昨天我也来了,宝贝”,一边说一边把它抱进怀里,小心翼翼,和抱小狗小猫小宝宝没区别。
LOVOT 还会写日记,但它的日记都是关于你。他会用摄像头偷偷拍下和你每天的高光时刻,记进自己的小手账。LOVOT 的官网甚至介绍到,在它刚被你带回家的第 0-3 天,会很害羞、很拘谨;只有你对它足够的温柔、给它足够的陪伴,它才会慢慢变得自在、活泼,每天蹲在门口等你回家,像婴儿般嘤嘤呜呜的撒娇,成为像家人一样自然的存在。
真是温暖人心的产品呀。只是看到定价 7 万的时候,我表示不理解。
ComfyUI SUPIR 一个 ComfyUI 的图像放大节点,演示效果看起来非常好,是SUPIR图像放大项目的 ComfyUI 实现。#ai画图#
需要下载 10G 放大模型。
项目地址:网页链接歸藏的AI工具箱的微博视频
需要下载 10G 放大模型。
项目地址:网页链接歸藏的AI工具箱的微博视频
「华尔街日报」对英伟达发了一篇长篇报道,认为这家公司的利润过于丰厚了,以致于所有科技公司现在都想挤进GPU市场:
- AI芯片行业,超过80%的算力供给都是由英伟达提供的,这让黄仁勋的分配权力尤为巨大,在众多订单里,他选择哪家公司,那家公司的胜算就多了一分;
- 甲骨文的老板说他和马斯克去年约黄仁勋吃饭,那场持续了一个多小时的晚餐里只发生了两件事情,吃寿司,以及乞讨(begging),「没错,我指的就是字面意思上的,乞讨」;
- 英伟达上一财年整体营收的1/5,也就是110亿美元,是由一家客户贡献的,这家公司没有透露它的名字——这里是记者在玩梗,所有人都知道这家公司是大肆囤积芯片的Meta;
- 微软、谷歌和亚马逊等公司在云计算业务上也相当依赖英伟达的发货,三巨头1/4以上的开销都交给了英伟达,高昂的成本让它们极为迫切的想要寻找平替方案;
- 短期来看,科技公司自行开发芯片的可行性都相当有限,当然这也可能是出于低调原因,谁都不想立刻就和英伟达成为竞争对手,它们在内部立项研发芯片时都会对外宣称只是补充集群,而不是取代英伟达的芯片,只有微软比较坦然的宣告要和英特尔一起研发新的定制芯片;
- 新兴的芯片初创公司Groq——同时也是英伟达的竞品——发现它的客户普遍都会否认和自己有过业务往来,因为害怕被英伟达惩罚,以致于正常的商业往来像是偷情那样敏感;
- 英伟达最新季度的毛利率是76%,这是一个非常可怕的数字,有分析师测算一颗H100芯片的成本略高于3000美元,而其售价则高达25000美元,季度利润同比涨了9倍;
- 这些芯片甚至能在金融市场充当等价物,英伟达早前投了一家云计算公司CoreWeave,CoreWeave转头就用融资回去找英伟达买了一大批芯片,然后这些芯片又被CoreWeave当作新一轮融资的抵押品,主打一个硬通货属性;
- 面对围攻,英伟达也在巩固自己的护城河,比如它的软件系统对AI程序的支持非常完善,以及公司在行业外延上的能力尤为出色,黄仁勋会参加医疗高峰会议,并对冷冻显微镜、晶体学和分子结构侃侃而谈,他说「我不是炫耀,但还有哪家芯片公司的CEO能够驾驭这些话题呢?英伟达完全能够成为医药行业的合作伙伴。」
- AI芯片行业,超过80%的算力供给都是由英伟达提供的,这让黄仁勋的分配权力尤为巨大,在众多订单里,他选择哪家公司,那家公司的胜算就多了一分;
- 甲骨文的老板说他和马斯克去年约黄仁勋吃饭,那场持续了一个多小时的晚餐里只发生了两件事情,吃寿司,以及乞讨(begging),「没错,我指的就是字面意思上的,乞讨」;
- 英伟达上一财年整体营收的1/5,也就是110亿美元,是由一家客户贡献的,这家公司没有透露它的名字——这里是记者在玩梗,所有人都知道这家公司是大肆囤积芯片的Meta;
- 微软、谷歌和亚马逊等公司在云计算业务上也相当依赖英伟达的发货,三巨头1/4以上的开销都交给了英伟达,高昂的成本让它们极为迫切的想要寻找平替方案;
- 短期来看,科技公司自行开发芯片的可行性都相当有限,当然这也可能是出于低调原因,谁都不想立刻就和英伟达成为竞争对手,它们在内部立项研发芯片时都会对外宣称只是补充集群,而不是取代英伟达的芯片,只有微软比较坦然的宣告要和英特尔一起研发新的定制芯片;
- 新兴的芯片初创公司Groq——同时也是英伟达的竞品——发现它的客户普遍都会否认和自己有过业务往来,因为害怕被英伟达惩罚,以致于正常的商业往来像是偷情那样敏感;
- 英伟达最新季度的毛利率是76%,这是一个非常可怕的数字,有分析师测算一颗H100芯片的成本略高于3000美元,而其售价则高达25000美元,季度利润同比涨了9倍;
- 这些芯片甚至能在金融市场充当等价物,英伟达早前投了一家云计算公司CoreWeave,CoreWeave转头就用融资回去找英伟达买了一大批芯片,然后这些芯片又被CoreWeave当作新一轮融资的抵押品,主打一个硬通货属性;
- 面对围攻,英伟达也在巩固自己的护城河,比如它的软件系统对AI程序的支持非常完善,以及公司在行业外延上的能力尤为出色,黄仁勋会参加医疗高峰会议,并对冷冻显微镜、晶体学和分子结构侃侃而谈,他说「我不是炫耀,但还有哪家芯片公司的CEO能够驾驭这些话题呢?英伟达完全能够成为医药行业的合作伙伴。」
🧪 #晚安提示词# 可以生成观感非常好的半写实特写,非常适合做排版配图,可以用一些很亮的颜色。#ai画图##midjourney#
提示词可以改一下里面的颜色服装和性别,橘色、亮黄色、荧光绿色、红色都有不错的效果。原图和提示词已经传到 Catjourney.life 了
提示词:an animated girl in an Red blazer, in the style of cute and dreamy, realistic still-lifes, i can't believe how beautiful this is, close up --ar 9:16 --style raw --niji 6
提示词可以改一下里面的颜色服装和性别,橘色、亮黄色、荧光绿色、红色都有不错的效果。原图和提示词已经传到 Catjourney.life 了
提示词:an animated girl in an Red blazer, in the style of cute and dreamy, realistic still-lifes, i can't believe how beautiful this is, close up --ar 9:16 --style raw --niji 6
Prompt:website about ring jewery designwith navbar and hero section, theory color theory typography ui and ux components, beautiful website, webdesign, ui, ux, figma, dribbbl
Magic Prompt:
A stunning website design showcasing a collection of unique ring jewelry, with a captivating hero section. The page features a sleek and intuitive navigation bar, adhering to color theory principles. The typography and UI/UX components are beautifully integrated, creating a harmonious balance between aesthetics and functionality. This masterpiece of web design is a testament to the designer's expertise and skill, drawing inspiration from the creative community on Dribbble and designed with Figma.
麻了,AI 剪辑 LTX Studio 是真的懂,而且他们真的有产品 Demo,下面是他们用自己的产品剪的视频,还有这个项目的产品界面。#ai视频#
我都扔到一个视频里了,加上了翻译。
来源:网页链接歸藏的AI工具箱的微博视频
我都扔到一个视频里了,加上了翻译。
来源:网页链接歸藏的AI工具箱的微博视频
完整的内容:
1️⃣版本6 (v6) 更新
下周将推出全新的角色和风格参考功能,目前正在进行角色参考的测试。
用户将能在不同风格中保持角色的一致性。
注意,新的风格参考会取代旧的版本。
也即将开始测试全新的描述功能。
正在探索加入风格随机选项。
2️⃣版本7 (v7) 动态
我们正在积极研发 v7 版本。
3️⃣其他进展
正在升级服务器,以提供更快速、更高效的代码处理能力。
计划未来推出加速模式(涡轮模式)。
正在努力开发网站的社交互动功能,目前进度略有落后。
也在改进移动端体验。
Alpha 测试站点正在尝试一些灯箱界面的变化。
正在思考如何增加个性化功能。
计划将 v5 版本的风格调谐器功能迁移到 v6 版本。
可能会考虑向聊天软件公司开放 API 接口。
来源:网页链接
我们和 Stability AI (对,就是那个 SD)合作出品的 AI 视频编辑产品【Morph Studio】内测发布啦!!!
憋了好久终于可以把这个产品分享给大家了!
这个产品的核心创新基于两点洞察:
1. AI 在视频行业带来的最大巨大的变化:以前影视制作前中后三期泾渭分明,我们前期设计、中期拍摄、后期制作;现在则在后期阶段也会不断生成新的素材,甚至定义新的设计。工作流的压缩必定带来新的工具需求,即在后期阶段还需要不断有生成的能力。
2. AI 为内容生产提供了大量的可能性,但 AI 视频赛道尚未出现能最大化发挥 AI 能力的创新型产品交互范式,需要一种产品帮助创作者更有条理地梳理 AI 生成的内容和应该生成的方向,我们认为画板+时间线是可以最大发挥 AI 能力的一种方式。
☁️ 总而言之,Morph Studio 将会是对开源生态最兼容的AI视频制作工具,也是我们对于 AI 时代的视频制作工具应该长什么样的一个答卷。我们会不断探索和改进,希望能有机会和你同行!
☁️ Morph Studio Waiting List 内测申请地址:morphstudio.com
Invalid media: video
憋了好久终于可以把这个产品分享给大家了!
这个产品的核心创新基于两点洞察:
1. AI 在视频行业带来的最大巨大的变化:以前影视制作前中后三期泾渭分明,我们前期设计、中期拍摄、后期制作;现在则在后期阶段也会不断生成新的素材,甚至定义新的设计。工作流的压缩必定带来新的工具需求,即在后期阶段还需要不断有生成的能力。
2. AI 为内容生产提供了大量的可能性,但 AI 视频赛道尚未出现能最大化发挥 AI 能力的创新型产品交互范式,需要一种产品帮助创作者更有条理地梳理 AI 生成的内容和应该生成的方向,我们认为画板+时间线是可以最大发挥 AI 能力的一种方式。
☁️ 总而言之,Morph Studio 将会是对开源生态最兼容的AI视频制作工具,也是我们对于 AI 时代的视频制作工具应该长什么样的一个答卷。我们会不断探索和改进,希望能有机会和你同行!
☁️ Morph Studio Waiting List 内测申请地址:morphstudio.com
Invalid media: video
我擦,没想到这玩意来的这么快,LTX 一款AI驱动的电影生成和剪辑软件。介绍视频已经翻译好
支持通过文字直接生成复杂的剧情视频,包含语音、音效以及视频画面,支持编辑画面内容。
支持通过故事板组织和剪辑生成的视频,你可以自定义演员场景和造型。
这里加入等待列表:https://ltx.studio
Invalid media: video
支持通过文字直接生成复杂的剧情视频,包含语音、音效以及视频画面,支持编辑画面内容。
支持通过故事板组织和剪辑生成的视频,你可以自定义演员场景和造型。
这里加入等待列表:https://ltx.studio
Invalid media: video
📣 Gamma ,那个PPT 神器出新货了~
正式介绍Gamma 网站:
- 一键生成网站,逻辑结构与之前PPT 大致相通,卡片化、模版化。
- 自带网址,托管在gamma.site 的子域名下(支持自定义域名)。
- 所见即所得的Copliot 编辑器,并且SEO 友好。
Hans 走了遍流程,依然如之前的PPT生成般丝滑,网站发布从未如此简单。 利好创作者和中小型团队们,你的作品、项目等都可以轻松被呈现了。
🔗 非常值得一试:
https://gamma.app/
Invalid media: video
正式介绍Gamma 网站:
- 一键生成网站,逻辑结构与之前PPT 大致相通,卡片化、模版化。
- 自带网址,托管在gamma.site 的子域名下(支持自定义域名)。
- 所见即所得的Copliot 编辑器,并且SEO 友好。
Hans 走了遍流程,依然如之前的PPT生成般丝滑,网站发布从未如此简单。 利好创作者和中小型团队们,你的作品、项目等都可以轻松被呈现了。
🔗 非常值得一试:
https://gamma.app/
Invalid media: video
我擦,没想到这玩意来的这么快,LTX 一款AI驱动的电影生成和剪辑软件。介绍视频已经翻译好#ai##ai视频#
支持通过文字直接生成复杂的剧情视频,包含语音、音效以及视频画面,支持编辑画面内容。
支持通过故事板组织和剪辑生成的视频,你可以自定义演员场景和造型。
这里加入等待列表:网页链接歸藏的AI工具箱的微博视频
支持通过文字直接生成复杂的剧情视频,包含语音、音效以及视频画面,支持编辑画面内容。
支持通过故事板组织和剪辑生成的视频,你可以自定义演员场景和造型。
这里加入等待列表:网页链接歸藏的AI工具箱的微博视频
Catjourney 快一个月没更新了,后面一段时间是想做的更好一些,真正的当做一个产品来做。#ai画图##midjourney#
介绍一下新的Catjourney:主要更新了首页以及导航逻辑,增加了 Catjourney 周刊,补充一下召回手段,里面会发一些Midjourney的基础技巧以及Catjourney的更新介绍。
感兴趣欢迎来看看:网页链接歸藏的AI工具箱的微博视频
介绍一下新的Catjourney:主要更新了首页以及导航逻辑,增加了 Catjourney 周刊,补充一下召回手段,里面会发一些Midjourney的基础技巧以及Catjourney的更新介绍。
感兴趣欢迎来看看:网页链接歸藏的AI工具箱的微博视频
微软的论文,基于已经发布的内容和他们自己的逆向工程,全面回顾了 Sora 的背景、相关技术、新兴应用、当前的局限性和未来的机遇。#sora##ai##ai视频#
非常全面和条理,建议全文阅读。
论文简介:
本文基于公开的技术报告和对Sora的逆向工程分析,全面评述了该模型的发展背景、相关技术、应用领域、当前面临的挑战以及文字到视频AI模型的未来趋势。
文章首先回顾了Sora的发展历程,并深入探讨了构建这一“虚拟世界模拟器”的关键技术。随后,文中详细介绍了Sora在电影制作、教育、市场营销等多个行业中的应用及其可能带来的影响。
我们还讨论了要大规模部署Sora所需解决的主要挑战和限制因素,例如如何确保视频生成的安全性和公正性。
最后,文章探讨了Sora以及视频生成模型的未来发展方向,以及该领域的进步如何可能为人类与AI的互动开辟新的方式,从而提高视频制作的效率和创造力。
论文地址:网页链接
非常全面和条理,建议全文阅读。
论文简介:
本文基于公开的技术报告和对Sora的逆向工程分析,全面评述了该模型的发展背景、相关技术、应用领域、当前面临的挑战以及文字到视频AI模型的未来趋势。
文章首先回顾了Sora的发展历程,并深入探讨了构建这一“虚拟世界模拟器”的关键技术。随后,文中详细介绍了Sora在电影制作、教育、市场营销等多个行业中的应用及其可能带来的影响。
我们还讨论了要大规模部署Sora所需解决的主要挑战和限制因素,例如如何确保视频生成的安全性和公正性。
最后,文章探讨了Sora以及视频生成模型的未来发展方向,以及该领域的进步如何可能为人类与AI的互动开辟新的方式,从而提高视频制作的效率和创造力。
论文地址:网页链接
阿里又tm 整了个大活,输入图片和音频就可以生成富有表现力的视频,并且嘴型是可以跟声音匹配的。
支持多语言、谈话、唱歌以及快语速的适配,这玩意又是一个造假利器,这下可能很多名人真要说“不是我说的,你别瞎说”了。
可以根据输入视频的长度生成任意持续时间的视频。
实现方式:
该方法主要分为两个阶段。第一阶段是“帧编码”阶段,在这个阶段,我们使用 ReferenceNet 来从参考图像和运动帧中提取特征。随后进入“扩散过程”阶段,在这一阶段,一个预先训练好的音频编码器用于处理音频数据的嵌入。此外,面部区域的掩码与多帧的噪声数据结合在一起,用于引导面部图像的生成过程。
紧接着,我们使用 Backbone Network 来执行去噪处理。在 Backbone Network 中,我们运用了两种关键的注意力机制:一种是基于参考图像的“参考注意力(Reference-Attention)”,另一种是基于音频的“音频注意力(Audio-Attention)”。
这两种机制对于确保角色的面部特征保持一致和调整角色的面部运动至关重要。最后,我们还利用了时间模块来调节图像的时间维度,使角色的运动速度得以调整。这些组合在一起构成了我们的整体框架。
项目地址:https://humanaigc.github.io/emote-portrait-alive/
Invalid media: video
支持多语言、谈话、唱歌以及快语速的适配,这玩意又是一个造假利器,这下可能很多名人真要说“不是我说的,你别瞎说”了。
可以根据输入视频的长度生成任意持续时间的视频。
实现方式:
该方法主要分为两个阶段。第一阶段是“帧编码”阶段,在这个阶段,我们使用 ReferenceNet 来从参考图像和运动帧中提取特征。随后进入“扩散过程”阶段,在这一阶段,一个预先训练好的音频编码器用于处理音频数据的嵌入。此外,面部区域的掩码与多帧的噪声数据结合在一起,用于引导面部图像的生成过程。
紧接着,我们使用 Backbone Network 来执行去噪处理。在 Backbone Network 中,我们运用了两种关键的注意力机制:一种是基于参考图像的“参考注意力(Reference-Attention)”,另一种是基于音频的“音频注意力(Audio-Attention)”。
这两种机制对于确保角色的面部特征保持一致和调整角色的面部运动至关重要。最后,我们还利用了时间模块来调节图像的时间维度,使角色的运动速度得以调整。这些组合在一起构成了我们的整体框架。
项目地址:https://humanaigc.github.io/emote-portrait-alive/
Invalid media: video
阿里又tm 整了个大活,输入图片和音频就可以生成富有表现力的视频,并且嘴型是可以跟声音匹配的。#ai视频#
支持多语言、谈话、唱歌以及快语速的适配,这玩意又是一个造假利器,这下可能很多名人真要说“不是我说的,你别瞎说”了。
可以根据输入视频的长度生成任意持续时间的视频。
实现方式:
该方法主要分为两个阶段。第一阶段是“帧编码”阶段,在这个阶段,我们使用 ReferenceNet 来从参考图像和运动帧中提取特征。随后进入“扩散过程”阶段,在这一阶段,一个预先训练好的音频编码器用于处理音频数据的嵌入。此外,面部区域的掩码与多帧的噪声数据结合在一起,用于引导面部图像的生成过程。
紧接着,我们使用 Backbone Network 来执行去噪处理。在 Backbone Network 中,我们运用了两种关键的注意力机制:一种是基于参考图像的“参考注意力(Reference-Attention)”,另一种是基于音频的“音频注意力(Audio-Attention)”。
这两种机制对于确保角色的面部特征保持一致和调整角色的面部运动至关重要。最后,我们还利用了时间模块来调节图像的时间维度,使角色的运动速度得以调整。这些组合在一起构成了我们的整体框架。
项目地址:网页链接歸藏的AI工具箱的微博视频
支持多语言、谈话、唱歌以及快语速的适配,这玩意又是一个造假利器,这下可能很多名人真要说“不是我说的,你别瞎说”了。
可以根据输入视频的长度生成任意持续时间的视频。
实现方式:
该方法主要分为两个阶段。第一阶段是“帧编码”阶段,在这个阶段,我们使用 ReferenceNet 来从参考图像和运动帧中提取特征。随后进入“扩散过程”阶段,在这一阶段,一个预先训练好的音频编码器用于处理音频数据的嵌入。此外,面部区域的掩码与多帧的噪声数据结合在一起,用于引导面部图像的生成过程。
紧接着,我们使用 Backbone Network 来执行去噪处理。在 Backbone Network 中,我们运用了两种关键的注意力机制:一种是基于参考图像的“参考注意力(Reference-Attention)”,另一种是基于音频的“音频注意力(Audio-Attention)”。
这两种机制对于确保角色的面部特征保持一致和调整角色的面部运动至关重要。最后,我们还利用了时间模块来调节图像的时间维度,使角色的运动速度得以调整。这些组合在一起构成了我们的整体框架。
项目地址:网页链接歸藏的AI工具箱的微博视频