关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
我们和 Stability AI (对,就是那个 SD)合作出品的 AI 视频编辑产品【Morph Studio】内测发布啦!!!

憋了好久终于可以把这个产品分享给大家了!

这个产品的核心创新基于两点洞察:

1. AI 在视频行业带来的最大巨大的变化:以前影视制作前中后三期泾渭分明,我们前期设计、中期拍摄、后期制作;现在则在后期阶段也会不断生成新的素材,甚至定义新的设计。工作流的压缩必定带来新的工具需求,即在后期阶段还需要不断有生成的能力。

2. AI 为内容生产提供了大量的可能性,但 AI 视频赛道尚未出现能最大化发挥 AI 能力的创新型产品交互范式,需要一种产品帮助创作者更有条理地梳理 AI 生成的内容和应该生成的方向,我们认为画板+时间线是可以最大发挥 AI 能力的一种方式。

☁️ 总而言之,Morph Studio 将会是对开源生态最兼容的AI视频制作工具,也是我们对于 AI 时代的视频制作工具应该长什么样的一个答卷。我们会不断探索和改进,希望能有机会和你同行!

☁️ Morph Studio Waiting List 内测申请地址:morphstudio.com

Invalid media: video
我擦,没想到这玩意来的这么快,LTX 一款AI驱动的电影生成和剪辑软件。介绍视频已经翻译好

支持通过文字直接生成复杂的剧情视频,包含语音、音效以及视频画面,支持编辑画面内容。

支持通过故事板组织和剪辑生成的视频,你可以自定义演员场景和造型。

这里加入等待列表:https://ltx.studio

Invalid media: video
📣 Gamma ,那个PPT 神器出新货了~

正式介绍Gamma 网站:

- 一键生成网站,逻辑结构与之前PPT 大致相通,卡片化、模版化。
- 自带网址,托管在gamma.site 的子域名下(支持自定义域名)。
- 所见即所得的Copliot 编辑器,并且SEO 友好。

Hans 走了遍流程,依然如之前的PPT生成般丝滑,网站发布从未如此简单。 利好创作者和中小型团队们,你的作品、项目等都可以轻松被呈现了。

🔗 非常值得一试:
https://gamma.app/

Invalid media: video
我擦,没想到这玩意来的这么快,LTX 一款AI驱动的电影生成和剪辑软件。介绍视频已经翻译好#ai##ai视频#

支持通过文字直接生成复杂的剧情视频,包含语音、音效以及视频画面,支持编辑画面内容。

支持通过故事板组织和剪辑生成的视频,你可以自定义演员场景和造型。

这里加入等待列表:网页链接歸藏的AI工具箱的微博视频
Catjourney 快一个月没更新了,后面一段时间是想做的更好一些,真正的当做一个产品来做。#ai画图##midjourney#

介绍一下新的Catjourney:主要更新了首页以及导航逻辑,增加了 Catjourney 周刊,补充一下召回手段,里面会发一些Midjourney的基础技巧以及Catjourney的更新介绍。

感兴趣欢迎来看看:网页链接歸藏的AI工具箱的微博视频
StarCoder2 编码开源模型,代码、数据、模型全部都开源了。#ai#

StarCoder2 使用 16k Token上下文和 4T+Token的存储库级信息进行训练。

The Stack v2 数据集- 拥有 900B+ Token的最大代码数据集。

项目地址:网页链接
我是机器人的佐证

每次随便写一个to do list,感觉天天都在摸鱼,但是过几天回去看,一般都会做完。

就好像写了个底层执行程序,自动就执行完了,
一个非常有意思的项目可以用 SD 直接生成透明的 PNG 图片,也可以直接生成带有透明度分层的图片。#ai画图#

这个想象力很大能带来很多玩法。也可以使用现有的 SD 社区模型。

项目介绍:

LayerDiffusion使得大型已经过预训练的潜在扩散模型(latent diffusion model)能够创造透明图像。

这项技术不仅可以生成单独的透明图像,还能生成多层透明图层。它通过一种被称为“潜在透明度”的方法,将透明度(即 alpha 通道)整合到预训练的潜在扩散模型的潜在结构中。

这样做的好处是,它通过以潜在偏移的形式加入透明度,几乎不改变模型原有的潜在分布,从而保持了模型的高质量输出能力。基于这种方法,任何一个潜在扩散模型都可以通过对潜在空间的微调,转化为透明图像生成器。

我们训练这个模型时,使用了一种涉及人机互动的方法,收集了一百万组透明图像层数据。
我们的研究显示,这种潜在透明技术不仅可以应用于不同的开源图像生成器,还可以适配多种条件控制系统,实现例如基于前景/背景条件的层生成、层的联合生成、对层内容进行结构控制等多种应用。

一项用户研究发现,大多数情况下(97%),相比于之前的临时解决方案(如先生成图像再进行抠图处理),用户更喜欢我们直接生成的透明内容。用户还表示,我们生成的透明图像在质量上可媲美真实的商业级透明素材,例如 Adobe Stock 提供的素材。

论文地址:网页链接
微软的论文,基于已经发布的内容和他们自己的逆向工程,全面回顾了 Sora 的背景、相关技术、新兴应用、当前的局限性和未来的机遇。#sora##ai##ai视频#

非常全面和条理,建议全文阅读。

论文简介:
本文基于公开的技术报告和对Sora的逆向工程分析,全面评述了该模型的发展背景、相关技术、应用领域、当前面临的挑战以及文字到视频AI模型的未来趋势。

文章首先回顾了Sora的发展历程,并深入探讨了构建这一“虚拟世界模拟器”的关键技术。随后,文中详细介绍了Sora在电影制作、教育、市场营销等多个行业中的应用及其可能带来的影响。

我们还讨论了要大规模部署Sora所需解决的主要挑战和限制因素,例如如何确保视频生成的安全性和公正性。

最后,文章探讨了Sora以及视频生成模型的未来发展方向,以及该领域的进步如何可能为人类与AI的互动开辟新的方式,从而提高视频制作的效率和创造力。

论文地址:网页链接
006KpAl0ly1hn95r02hnwj31w90mfe0f.jpg
751.4 KB
阿里又tm 整了个大活,输入图片和音频就可以生成富有表现力的视频,并且嘴型是可以跟声音匹配的。

支持多语言、谈话、唱歌以及快语速的适配,这玩意又是一个造假利器,这下可能很多名人真要说“不是我说的,你别瞎说”了。

可以根据输入视频的长度生成任意持续时间的视频。

实现方式:

该方法主要分为两个阶段。第一阶段是“帧编码”阶段,在这个阶段,我们使用 ReferenceNet 来从参考图像和运动帧中提取特征。随后进入“扩散过程”阶段,在这一阶段,一个预先训练好的音频编码器用于处理音频数据的嵌入。此外,面部区域的掩码与多帧的噪声数据结合在一起,用于引导面部图像的生成过程。

紧接着,我们使用 Backbone Network 来执行去噪处理。在 Backbone Network 中,我们运用了两种关键的注意力机制:一种是基于参考图像的“参考注意力(Reference-Attention)”,另一种是基于音频的“音频注意力(Audio-Attention)”。

这两种机制对于确保角色的面部特征保持一致和调整角色的面部运动至关重要。最后,我们还利用了时间模块来调节图像的时间维度,使角色的运动速度得以调整。这些组合在一起构成了我们的整体框架。

项目地址:https://humanaigc.github.io/emote-portrait-alive/

Invalid media: video
阿里又tm 整了个大活,输入图片和音频就可以生成富有表现力的视频,并且嘴型是可以跟声音匹配的。#ai视频#

支持多语言、谈话、唱歌以及快语速的适配,这玩意又是一个造假利器,这下可能很多名人真要说“不是我说的,你别瞎说”了。

可以根据输入视频的长度生成任意持续时间的视频。

实现方式:

该方法主要分为两个阶段。第一阶段是“帧编码”阶段,在这个阶段,我们使用 ReferenceNet 来从参考图像和运动帧中提取特征。随后进入“扩散过程”阶段,在这一阶段,一个预先训练好的音频编码器用于处理音频数据的嵌入。此外,面部区域的掩码与多帧的噪声数据结合在一起,用于引导面部图像的生成过程。

紧接着,我们使用 Backbone Network 来执行去噪处理。在 Backbone Network 中,我们运用了两种关键的注意力机制:一种是基于参考图像的“参考注意力(Reference-Attention)”,另一种是基于音频的“音频注意力(Audio-Attention)”。

这两种机制对于确保角色的面部特征保持一致和调整角色的面部运动至关重要。最后,我们还利用了时间模块来调节图像的时间维度,使角色的运动速度得以调整。这些组合在一起构成了我们的整体框架。

项目地址:网页链接歸藏的AI工具箱的微博视频
一个可以批量给黑白漫画上色的工具 toona,尝试了一下效果非常不错。

各位看不下去黑白漫画的可以冲了,重绘速度也很快,目前还是免费的。

地址:网页链接歸藏的AI工具箱的微博视频
Github 官方正式推出了GitHub Copilot Enterprise,它可以在链接代码库以后帮助初级用户快速熟悉代码库,帮助高级用户快速定位问题,定价 36 美元一个月。#ai#

GitHub Copilot Enterprise通过将组织的知识和代码库定制化,使开发者能够更快地理解独特的代码库、快速访问组织知识和最佳实践,并更快地审查拉取请求。

还集成了直接进入GitHub 的聊天功能,使开发者能够用自然语言提问并获得关于代码库的答案,从而加速迭代并改进代码。

GitHub Copilot Enterprise还通过生成拉取请求摘要和分析拉取请求差异来加速审查过程。

通过将Bing搜索直接集成到Copilot聊天中(目前处于测试阶段),GitHub Copilot现在可以帮助开发者几乎即时地获得最新的软件开发相关信息,如CSS或JavaScript框架的更新。

详细信息: 网页链接
用飞书的企业多,字节流出去的人才也不少,用飞书文档写东西分享倒是开始流行起来了,有了大量对外开放的学霸笔记,去年大火的ChatGPT、今年表现炸裂的Sora都有超强分析。

今天看到的这个AI的科普文档叫《通往 AGI 之路》,创建之后的10个月时间里有接近500万的阅读量,链接:https://waytoagi.feishu.cn/wiki/QPe5w5g7UisbEkkow8XcDmOpn8e

这只是一个学习文档啊…

你说一个免费的文档知识库能做成这样,更新是即时的,最关键的是一个文档还可以由几个大牛一起书写,譬如向阳乔木,宝玉xp,互联网的那点事,barret李靖等等知名互联网行业观察者,在共同缔造一个AGI知识库。这么一对比,那些搞付费割韭菜的开课的,就显得emmm

而且写得好的文档,有点像SCI论文(科学引文索引收录的论文,代表一种影响因子分数),是很容易获得行业前辈与同仁认可的,造成了写作者前仆后继的分享...

谁能想到,一个办公软件能成科普社区。
Back to Top