关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
微软的论文,基于已经发布的内容和他们自己的逆向工程,全面回顾了 Sora 的背景、相关技术、新兴应用、当前的局限性和未来的机遇。#sora##ai##ai视频#

非常全面和条理,建议全文阅读。

论文简介:
本文基于公开的技术报告和对Sora的逆向工程分析,全面评述了该模型的发展背景、相关技术、应用领域、当前面临的挑战以及文字到视频AI模型的未来趋势。

文章首先回顾了Sora的发展历程,并深入探讨了构建这一“虚拟世界模拟器”的关键技术。随后,文中详细介绍了Sora在电影制作、教育、市场营销等多个行业中的应用及其可能带来的影响。

我们还讨论了要大规模部署Sora所需解决的主要挑战和限制因素,例如如何确保视频生成的安全性和公正性。

最后,文章探讨了Sora以及视频生成模型的未来发展方向,以及该领域的进步如何可能为人类与AI的互动开辟新的方式,从而提高视频制作的效率和创造力。

论文地址:网页链接
006KpAl0ly1hn95r02hnwj31w90mfe0f.jpg
751.4 KB
阿里又tm 整了个大活,输入图片和音频就可以生成富有表现力的视频,并且嘴型是可以跟声音匹配的。

支持多语言、谈话、唱歌以及快语速的适配,这玩意又是一个造假利器,这下可能很多名人真要说“不是我说的,你别瞎说”了。

可以根据输入视频的长度生成任意持续时间的视频。

实现方式:

该方法主要分为两个阶段。第一阶段是“帧编码”阶段,在这个阶段,我们使用 ReferenceNet 来从参考图像和运动帧中提取特征。随后进入“扩散过程”阶段,在这一阶段,一个预先训练好的音频编码器用于处理音频数据的嵌入。此外,面部区域的掩码与多帧的噪声数据结合在一起,用于引导面部图像的生成过程。

紧接着,我们使用 Backbone Network 来执行去噪处理。在 Backbone Network 中,我们运用了两种关键的注意力机制:一种是基于参考图像的“参考注意力(Reference-Attention)”,另一种是基于音频的“音频注意力(Audio-Attention)”。

这两种机制对于确保角色的面部特征保持一致和调整角色的面部运动至关重要。最后,我们还利用了时间模块来调节图像的时间维度,使角色的运动速度得以调整。这些组合在一起构成了我们的整体框架。

项目地址:https://humanaigc.github.io/emote-portrait-alive/

Invalid media: video
阿里又tm 整了个大活,输入图片和音频就可以生成富有表现力的视频,并且嘴型是可以跟声音匹配的。#ai视频#

支持多语言、谈话、唱歌以及快语速的适配,这玩意又是一个造假利器,这下可能很多名人真要说“不是我说的,你别瞎说”了。

可以根据输入视频的长度生成任意持续时间的视频。

实现方式:

该方法主要分为两个阶段。第一阶段是“帧编码”阶段,在这个阶段,我们使用 ReferenceNet 来从参考图像和运动帧中提取特征。随后进入“扩散过程”阶段,在这一阶段,一个预先训练好的音频编码器用于处理音频数据的嵌入。此外,面部区域的掩码与多帧的噪声数据结合在一起,用于引导面部图像的生成过程。

紧接着,我们使用 Backbone Network 来执行去噪处理。在 Backbone Network 中,我们运用了两种关键的注意力机制:一种是基于参考图像的“参考注意力(Reference-Attention)”,另一种是基于音频的“音频注意力(Audio-Attention)”。

这两种机制对于确保角色的面部特征保持一致和调整角色的面部运动至关重要。最后,我们还利用了时间模块来调节图像的时间维度,使角色的运动速度得以调整。这些组合在一起构成了我们的整体框架。

项目地址:网页链接歸藏的AI工具箱的微博视频
一个可以批量给黑白漫画上色的工具 toona,尝试了一下效果非常不错。

各位看不下去黑白漫画的可以冲了,重绘速度也很快,目前还是免费的。

地址:网页链接歸藏的AI工具箱的微博视频
Github 官方正式推出了GitHub Copilot Enterprise,它可以在链接代码库以后帮助初级用户快速熟悉代码库,帮助高级用户快速定位问题,定价 36 美元一个月。#ai#

GitHub Copilot Enterprise通过将组织的知识和代码库定制化,使开发者能够更快地理解独特的代码库、快速访问组织知识和最佳实践,并更快地审查拉取请求。

还集成了直接进入GitHub 的聊天功能,使开发者能够用自然语言提问并获得关于代码库的答案,从而加速迭代并改进代码。

GitHub Copilot Enterprise还通过生成拉取请求摘要和分析拉取请求差异来加速审查过程。

通过将Bing搜索直接集成到Copilot聊天中(目前处于测试阶段),GitHub Copilot现在可以帮助开发者几乎即时地获得最新的软件开发相关信息,如CSS或JavaScript框架的更新。

详细信息: 网页链接
用飞书的企业多,字节流出去的人才也不少,用飞书文档写东西分享倒是开始流行起来了,有了大量对外开放的学霸笔记,去年大火的ChatGPT、今年表现炸裂的Sora都有超强分析。

今天看到的这个AI的科普文档叫《通往 AGI 之路》,创建之后的10个月时间里有接近500万的阅读量,链接:https://waytoagi.feishu.cn/wiki/QPe5w5g7UisbEkkow8XcDmOpn8e

这只是一个学习文档啊…

你说一个免费的文档知识库能做成这样,更新是即时的,最关键的是一个文档还可以由几个大牛一起书写,譬如向阳乔木,宝玉xp,互联网的那点事,barret李靖等等知名互联网行业观察者,在共同缔造一个AGI知识库。这么一对比,那些搞付费割韭菜的开课的,就显得emmm

而且写得好的文档,有点像SCI论文(科学引文索引收录的论文,代表一种影响因子分数),是很容易获得行业前辈与同仁认可的,造成了写作者前仆后继的分享...

谁能想到,一个办公软件能成科普社区。
被英伟达、OpenAI、微软、木头姐和贝佐斯等人投资后,炙手可热的人形机器人公司Figure发布视频,公布产品最新进展!
视频中的Figure01已经能够在工厂内完成搬运、放置箱子等操作。
Media is too big
VIEW IN TELEGRAM
分享一个使用kimi的万能公式,无需记住任何提示词,只需要问kimi一个问题:
【一个(xxx职业)需要具备哪些知识?】
Kimi就可以给出知识框架,然后你根据知识框架每一个小点去问,就能让kimi帮你思考啦~
得出的信息比单个提示词要多很多

如下这个例子,kimi给出来12个能力,每个能力分10步的话,我能得到的信息是120条!
#AI工作流 #AI的神奇用法

示例:(括号可改成你的问题)
一个CEO应该具备哪些知识?
如果你是一个CEO,你使用(战略规划与管理来决策,)需要分为哪几步?
你是一个CEO,请以上面(10)步来帮我做决策:我需要(建立一个帮助金融投资者交流并且通过社群和知识付费赚钱的社群,)每一步都以表格的形式展现你的思考过程
好,接下来每一个步骤详细分析,第一步:(愿景和使命定义)
很棒,按照这个架构,第二步:(环境分析)
第三步:(战略制定)
第四步:(战略选择)
第五步:(战略实施)
第六步:(监控和评估)
第七步:(调整和优化)
第八步:(沟通和文化建设)
第九步:(风险管理)
第十步:(持续改进)
Back to Top