关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
而且还是开源的,提供了Colab笔记运行并且填写API就可以,或者也可以直接使用他的产品生成。
项目地址:https://github.com/mshumer/ai-journalist
尝试了一下 Suno,会有直观的冲击。
这个《低语的竹子》从头到尾都是 AI 的作品。ChatGPT 完成脚本(prompt),Suno 创作词曲,Midjourney 创作背景图,DeepL 翻译中文歌词。当然,想法还是需要自己提供一些「冷启动」。
这是 AI 在继续让创作门槛降低。未来的创作者的工具会极大丰富,而需要花费时间掌握的多数「技术能力」会迅速贬值。
一人杂志(公众号/播客)、一人电视台(直播间)刚刚成真,一人乐队、一人电影、一人游戏已在眼前。
这个《低语的竹子》从头到尾都是 AI 的作品。ChatGPT 完成脚本(prompt),Suno 创作词曲,Midjourney 创作背景图,DeepL 翻译中文歌词。当然,想法还是需要自己提供一些「冷启动」。
这是 AI 在继续让创作门槛降低。未来的创作者的工具会极大丰富,而需要花费时间掌握的多数「技术能力」会迅速贬值。
一人杂志(公众号/播客)、一人电视台(直播间)刚刚成真,一人乐队、一人电影、一人游戏已在眼前。
SUNO V3 有点像 Midjourney 的 V3,GPT 的 3.0 版本,给音乐产业带来了很多变化的可能:
1)UGC 音乐平台:音乐是创作者头部效应最明显的产业之一,在 pre-AI 时代,普通人拍的视频可能是具备被消费价值的,因为拍摄的对象可能很有意思,但是普通人创作的音乐或者翻唱的歌是完全达不到及格线的。所以之前做音乐 UGC 平台的公司基本都没有起来,音乐版权拥有者赚钱很容易,天下苦三大久已。
但现在 SUNO 为代表的AI作曲工具,有点像摄影的发展从一开始要用胶片拍摄和冲洗,变成了数码相机,再变成了手机摄像头。当大量的人突然可以按照自己的想法和歌词生成达到及格线的音乐时,这里面就可能会诞生新的音乐家和大作。
于此同时,SUNO 也是 AIGC 应用里面难得的可以形成「内容生产者 + 消费者闭环」的平台。妙鸭和 Midjourney 的问题都在于AI产生的内容在本平台上的再消费价值不大。一个人用 MJ 生成的图片一般来说只对这个生产者本人有价值,但用 SUNO 生成的音乐不一定。我发现我很自然地就在 SUNO 上开始听推荐的音乐了,有的还真的有点意思:
例子:https://app.suno.ai/song/5c16c93d-0c60-4be1-a65f-c0fafe001a1b 这个应该是用了自定义歌词,但听起来真挺可以的。
2)个性化音乐:70 分的音乐单独听可能价值不大,因为我总可以去听95 分的佳作,实际上只有音乐存在「单曲循环」的场景,我们会不断的听最好的歌。但 70 分的音乐配合合适的场景可能是有用的,尤其是可以随时生成个性化歌词音乐的时候。
例子:https://www.bilibili.com/video/BV1Xu4y1n7Jd 用 AI 产生自定义音乐点评电影。
3)背景音乐生成器:有一些场景是 70 分音乐也 OK的场景,并且感觉器乐会更容易,因为音乐底层和数学其实是很像的?想起小时候有个假乐队叫班得瑞,就是台湾一个乐队公司把很多风格类似的器乐包装在一起出专辑,而 SUNO 现在生成的钢琴曲质量已经不错了,感觉凑合可以作为很多咖啡厅的背景声。
例子:https://app.suno.ai/song/a0f12ca5-0833-49ce-97f1-cd6094510f2c
4)音乐人的Copilot:就跟我们不能现在要求 Chatgpt 直接写出一部小说一样,对 SUNO 的要求也不应该是直接生成一首完整的歌,而是作为再创作的起点。SUNO 可以首先作为音乐创作者的 Copilot。这个地方看起来难点是如何生成专业创作者需要的工程文件(和 3D 生成遇到的问题类似),分轨的原始音乐素材也是现在最难获得的训练数据。
1)UGC 音乐平台:音乐是创作者头部效应最明显的产业之一,在 pre-AI 时代,普通人拍的视频可能是具备被消费价值的,因为拍摄的对象可能很有意思,但是普通人创作的音乐或者翻唱的歌是完全达不到及格线的。所以之前做音乐 UGC 平台的公司基本都没有起来,音乐版权拥有者赚钱很容易,天下苦三大久已。
但现在 SUNO 为代表的AI作曲工具,有点像摄影的发展从一开始要用胶片拍摄和冲洗,变成了数码相机,再变成了手机摄像头。当大量的人突然可以按照自己的想法和歌词生成达到及格线的音乐时,这里面就可能会诞生新的音乐家和大作。
于此同时,SUNO 也是 AIGC 应用里面难得的可以形成「内容生产者 + 消费者闭环」的平台。妙鸭和 Midjourney 的问题都在于AI产生的内容在本平台上的再消费价值不大。一个人用 MJ 生成的图片一般来说只对这个生产者本人有价值,但用 SUNO 生成的音乐不一定。我发现我很自然地就在 SUNO 上开始听推荐的音乐了,有的还真的有点意思:
例子:https://app.suno.ai/song/5c16c93d-0c60-4be1-a65f-c0fafe001a1b 这个应该是用了自定义歌词,但听起来真挺可以的。
2)个性化音乐:70 分的音乐单独听可能价值不大,因为我总可以去听95 分的佳作,实际上只有音乐存在「单曲循环」的场景,我们会不断的听最好的歌。但 70 分的音乐配合合适的场景可能是有用的,尤其是可以随时生成个性化歌词音乐的时候。
例子:https://www.bilibili.com/video/BV1Xu4y1n7Jd 用 AI 产生自定义音乐点评电影。
3)背景音乐生成器:有一些场景是 70 分音乐也 OK的场景,并且感觉器乐会更容易,因为音乐底层和数学其实是很像的?想起小时候有个假乐队叫班得瑞,就是台湾一个乐队公司把很多风格类似的器乐包装在一起出专辑,而 SUNO 现在生成的钢琴曲质量已经不错了,感觉凑合可以作为很多咖啡厅的背景声。
例子:https://app.suno.ai/song/a0f12ca5-0833-49ce-97f1-cd6094510f2c
4)音乐人的Copilot:就跟我们不能现在要求 Chatgpt 直接写出一部小说一样,对 SUNO 的要求也不应该是直接生成一首完整的歌,而是作为再创作的起点。SUNO 可以首先作为音乐创作者的 Copilot。这个地方看起来难点是如何生成专业创作者需要的工程文件(和 3D 生成遇到的问题类似),分轨的原始音乐素材也是现在最难获得的训练数据。
为什么文心一言被豆包超过了?
最近字节豆包的下载量、日活、留存已超文心一言。
但百度的同学一提到这就说豆包的模型不如文心。
当然我是认可模型层面豆包是不如文心的,
那为什么从数据层面上看文心的数据不如豆包呢。
人际沟通有个法则叫麦拉宾55-38-7法则。
人际沟通中他人对你的第一印象主要来源于三个方面:
55%来源于外表、打扮;
38%来源于说话的语气、情绪、口吻;
7%才是说话的内容。
对应到chatbot产品上,则是:
外表=产品交互设计、易用性;
语气=TTS的自然度、情绪、对话文字的口吻;
内容=大模型生成的文字。
不可否认,文心一言的模型确实要比豆包强,
但这也仅仅只占了用户体验7%,
而占用户体验大头的交互设计、TTS、口语化程度却远不如豆包。
因此,百度的同学是不是该反思自己的数据为什么不如别人?
而不是天天把模型当成遮羞布安慰自己没有完全输。
最近字节豆包的下载量、日活、留存已超文心一言。
但百度的同学一提到这就说豆包的模型不如文心。
当然我是认可模型层面豆包是不如文心的,
那为什么从数据层面上看文心的数据不如豆包呢。
人际沟通有个法则叫麦拉宾55-38-7法则。
人际沟通中他人对你的第一印象主要来源于三个方面:
55%来源于外表、打扮;
38%来源于说话的语气、情绪、口吻;
7%才是说话的内容。
对应到chatbot产品上,则是:
外表=产品交互设计、易用性;
语气=TTS的自然度、情绪、对话文字的口吻;
内容=大模型生成的文字。
不可否认,文心一言的模型确实要比豆包强,
但这也仅仅只占了用户体验7%,
而占用户体验大头的交互设计、TTS、口语化程度却远不如豆包。
因此,百度的同学是不是该反思自己的数据为什么不如别人?
而不是天天把模型当成遮羞布安慰自己没有完全输。
人形公司一旦发布新产品,总要播放一段VCR,视频里的机器人颤颤巍巍、如履薄冰,还没走几步,就轮到一个通常戴眼镜穿牛仔裤的理工男登场,上来就是对机器人一顿拳打脚踢。
机器人心胸宽广,无论怎么踹,都顽强站稳,继续走他的路,继续颤颤巍巍、如履薄冰。
这些机器人公司的每一次路演,都放佛是对机器人的公开处刑,令人很是同情。
机器人心胸宽广,无论怎么踹,都顽强站稳,继续走他的路,继续颤颤巍巍、如履薄冰。
这些机器人公司的每一次路演,都放佛是对机器人的公开处刑,令人很是同情。