关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
News Minimalist 是一个让 AI 精选新闻的服务。
它使用 AI (ChatGPT-4) 每天阅读前 1000 条新闻,并根据事件的严重性、规模、潜力和来源可信度,按重要性从 0 到 10 对它们进行排名。
你可以选择一个适合自己的阈值,并订阅这个阈值内的 newsletter 。
听起来很合理对不对?… https://twitter.com/i/web/status/1655714234385457152
RT Paul Graham
A huge policy mistake in one graph.
AI 短视频制造机 ,自动把长视频截取成短视频,自动加综艺字体,自动加Emoji,感觉以后国内的综艺剪辑完全可以 AI 化 https://www.opus.pro/
虽然已经恢复了,但还是对一边要发展科技一边封杀科技的行为表示非常的疑惑…

零零發: 从昨晚开始到现在,
国内互联网监管是想对GPT类的各项开发和研究进行彻底的封锁吗?想不通这个逻辑何在。
huggingface完全没有任何意识形态的问题,也不是一个讨论社区或者SNS社区,纯粹是个开发服务工具而已啊。

http://huggingface.co
RT 歸藏
手把手教你训练你自己的AI歌手,最重要的一步来了。如何训练歌手的模型。这一步主要由两部分组成数据处理和模型训练。
这个林俊杰是我自己训练的4800步的模型,对比一下上一篇教程里的孙燕姿模型有两万多步,数据的质量也很重要。
感谢各位的支持,下面是具体步骤🧶
昨晚和一位 OpenAi Candidate 的聊天,聊了 nerf, AI 3D, AI 动画, AI 服装模特… 是我近期信息量最大的对话了。给我最大震撼的是,我们发现 AI 动画这个事学术界感兴趣的方向和工业界需要的竟然完全不一样。

对于工业界来说,img2img 比 txt2img 重要,因为业内的工作流程一直是从草稿细化到成品;而 txt2img 由于可控性太低,相对于 img2img 来说真的太低效了。

制作电影/动画也是同理,讲故事的是视觉,分镜脚本是比剧本更重要的存在,一些 case 我们是直接跳过剧本直接写分镜脚本的(比如广告)。基础的工作流是:分镜脚本 -> 预演 -> 成片。

放到 AI 时代的视角来看,从电影分镜到成片,本质是一种 style transfer. 不是给视频套一个滤镜的那种 style transfer,是真的改变画面内容 structure 的 style transfer. 而这就是 Gen-1 在干的事情。

所以我们期待类似 Gen-1 的产品比期待 Gen-2 (txt2video) 要多很多,能预想到 txt2video 出来了以后融入实际工作流肯定会各种因为可控性太低而被各种诟病,但更完善更好的 Gen-1 可以很快地进入实际的工作生成中。

对于学术界来说,Gen-2 在技术含量上比 Gen-1 要有趣得多,带 structure 改变的 style transfer 是已经解决了很长一段时间的问题,Gen-1 的技术是没有秘密的。学术界的重心基本都铺在了 txt2video 上。

我:@#¥%…&* I dont really give a damn to txt2video _(:ι」∠)_
听了一天AI孙燕姿,有点上头。
喜欢这首 【【AI 孙燕姿】《一场游戏一场梦》cover 王杰-哔哩哔哩】 https://b23.tv/nu2W4Qp
mj-ps-sd-ps-sd 再风扇的呼呼声中过了一天😤
朋友圈看到的
感慨一下
AI探索指南
答应大家的AI歌手教程来了,手把手教你训练你自己的AI歌手,主要分为使用模型和训练模型两部分,这里是第一部分如何使用模型生成音乐的部分,主要介绍了音源的处理,模型的使用和后期音轨的合成。 看在藏师傅生病肝教程的份上希望各位多多支持,下面是具体步骤,图片顺序跟文字顺序对应🧶 详细教程和文件下载可以看这里:https://mp.weixin.qq.com/s/bXD1u6ysYkTEamt-PYI1RA 要使用模型进行推理的话你首先需要一段已经演唱好的声音垫进去,所以我们需要先对你垫进去的声音进行处理。 …
接下来是两个比较重要的选项怕【聚类f0】会让输出效果更好,但是如果你的文件是歌声的话不要勾选这个选项,不然会疯狂跑调。【F0均值滤波】主要解决哑音问题,如果你输出的内容有比较明显的哑音的话可以勾选尝试一下。

设置好之后我们点击【音频转换】按钮之后经过一段时间的运算,就可以生成对应的音乐了。
【output audio】的位置就是生成的音频了可以试听,如果觉得OK的话可以,点击右边三个点弹出的下载按钮下载。

我们现在生成的是一段只有人声的干声,这时候我们刚才剥离出来的伴奏就有用了,把两段音频合成就行,我用的剪映,直接把两段音轨拖进去导出就行,也可以加张图片变成视频。
答应大家的AI歌手教程来了,手把手教你训练你自己的AI歌手,主要分为使用模型和训练模型两部分,这里是第一部分如何使用模型生成音乐的部分,主要介绍了音源的处理,模型的使用和后期音轨的合成。
看在藏师傅生病肝教程的份上希望各位多多支持,下面是具体步骤,图片顺序跟文字顺序对应🧶

详细教程和文件下载可以看这里:https://mp.weixin.qq.com/s/bXD1u6ysYkTEamt-PYI1RA

要使用模型进行推理的话你首先需要一段已经演唱好的声音垫进去,所以我们需要先对你垫进去的声音进行处理。

首先要安装UVR_v5.5.0,完成后我们需要给UVR增加一个模型解压UVR5模型文件将里面的两个文件夹粘贴到安装目录下的Ultimate Vocal Removermodels就行。

在处理之前你需要把你声音的格式转换成WAV格式,因为So-VITS-SVC 4.0只认WAV格式的音频文件,现在处理了后面会省事点。可以用这个工具处理:https://www.aconvert.com/cn/audio/mp4-to-wav/

处理完音频文件后我们就要开始利用UVR去掉背景音了,一共需要过两次,每次的设置都是不同的,下面两张图分别是两次的参数。

接下来我们就要运行整合包的Web UI来推理声音了,如果你用的其他人的模型的话你需要先把模型文件放进整合包对应的文件夹下面:
首先是模型文件夹下面后缀为pth和pt的两个文件放到整合包的logs44k文件夹下。
之后是模型文件里那个叫config.json的json文件,放到整合包的configs文件夹下面。

接下来我们就可以运行整合包的Web UI了,打开整合包根目录下的【启动webui.bat】这个文件他会自动运行并打开Web UI的网页,经常玩Stable Diffusion的朋友肯定对这个操作不陌生。
下面就是Web UI的界面我们使用模型的时候主要用的是推理这个功能。

之后就是选择我们的模型,如果你刚才已经把模型放到合适的位置的话你现在应该能在下图的两个位置选择到你的模型和配置文件,如果有报错会在输出信息的位置显示。

选择完模型之后我们需要点击加载模型,等待一段时间Loading之后模型会加载完成。Output Message这里会输出加载的结果。之后就是上传我们处理好的需要垫的音频文件了,把文件拖动到红框位置就行。
Back to Top