关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
接上条。发现 Suno 可以用中文,玩到半夜,不亦乐乎。这次的作品可能更有直观的冲击力:《高速运转,进入中国》。
claude-journalist 这个工具不错,你只要输入一个主题他就能使用Claude 3 从网上搜索相关信息自动生成一篇对应主题的文章。

而且还是开源的,提供了Colab笔记运行并且填写API就可以,或者也可以直接使用他的产品生成。

项目地址:https://github.com/mshumer/ai-journalist
End or Beginning | Suno

把北岛的诗丢进SUNO生成的音乐,女声响起时有一点感动。谁说AI就不能有灵魂呢?又或者,什么是灵魂?
尝试了一下 Suno,会有直观的冲击。

这个《低语的竹子》从头到尾都是 AI 的作品。ChatGPT 完成脚本(prompt),Suno 创作词曲,Midjourney 创作背景图,DeepL 翻译中文歌词。当然,想法还是需要自己提供一些「冷启动」。

这是 AI 在继续让创作门槛降低。未来的创作者的工具会极大丰富,而需要花费时间掌握的多数「技术能力」会迅速贬值。

一人杂志(公众号/播客)、一人电视台(直播间)刚刚成真,一人乐队、一人电影、一人游戏已在眼前。
真正的MJ中文版悠船:https://www.youchuanai.com/
应该是这个周末因为一些微信公众号文章推荐进来了一波用户;
服务器暂时没顶住……
SUNO V3 有点像 Midjourney 的 V3,GPT 的 3.0 版本,给音乐产业带来了很多变化的可能:

1)UGC 音乐平台:音乐是创作者头部效应最明显的产业之一,在 pre-AI 时代,普通人拍的视频可能是具备被消费价值的,因为拍摄的对象可能很有意思,但是普通人创作的音乐或者翻唱的歌是完全达不到及格线的。所以之前做音乐 UGC 平台的公司基本都没有起来,音乐版权拥有者赚钱很容易,天下苦三大久已。

但现在 SUNO 为代表的AI作曲工具,有点像摄影的发展从一开始要用胶片拍摄和冲洗,变成了数码相机,再变成了手机摄像头。当大量的人突然可以按照自己的想法和歌词生成达到及格线的音乐时,这里面就可能会诞生新的音乐家和大作。

于此同时,SUNO 也是 AIGC 应用里面难得的可以形成「内容生产者 + 消费者闭环」的平台。妙鸭和 Midjourney 的问题都在于AI产生的内容在本平台上的再消费价值不大。一个人用 MJ 生成的图片一般来说只对这个生产者本人有价值,但用 SUNO 生成的音乐不一定。我发现我很自然地就在 SUNO 上开始听推荐的音乐了,有的还真的有点意思:

例子:https://app.suno.ai/song/5c16c93d-0c60-4be1-a65f-c0fafe001a1b 这个应该是用了自定义歌词,但听起来真挺可以的。

2)个性化音乐:70 分的音乐单独听可能价值不大,因为我总可以去听95 分的佳作,实际上只有音乐存在「单曲循环」的场景,我们会不断的听最好的歌。但 70 分的音乐配合合适的场景可能是有用的,尤其是可以随时生成个性化歌词音乐的时候。

例子:https://www.bilibili.com/video/BV1Xu4y1n7Jd 用 AI 产生自定义音乐点评电影。

3)背景音乐生成器:有一些场景是 70 分音乐也 OK的场景,并且感觉器乐会更容易,因为音乐底层和数学其实是很像的?想起小时候有个假乐队叫班得瑞,就是台湾一个乐队公司把很多风格类似的器乐包装在一起出专辑,而 SUNO 现在生成的钢琴曲质量已经不错了,感觉凑合可以作为很多咖啡厅的背景声。

例子:https://app.suno.ai/song/a0f12ca5-0833-49ce-97f1-cd6094510f2c

4)音乐人的Copilot:就跟我们不能现在要求 Chatgpt 直接写出一部小说一样,对 SUNO 的要求也不应该是直接生成一首完整的歌,而是作为再创作的起点。SUNO 可以首先作为音乐创作者的 Copilot。这个地方看起来难点是如何生成专业创作者需要的工程文件(和 3D 生成遇到的问题类似),分轨的原始音乐素材也是现在最难获得的训练数据。
2005年,来自MIT 的Tristan发表了他的博士毕业论文《Creating music by listening》,并且基于这篇论文的一些技术实现,和他的同学Brian whitman创立了Echo Nest,并最终被Spotify收购,

接下来的的故事大家都知道了。拥有音频和用户行为双重理解的Spotify,推动流媒体彻底改变了音乐行业。

19年后的今天,同样来自于Cambridge的Suno团队,用几乎相同的概念却完全不同的技术手段,实现了对音乐创作新的突破。

很难说这件事会最终给这个行业带来什么样的影响,但有一点可以确定的是,对于如今流媒体增长出现停滞的音乐行业来说,拥抱这个变化,比起恐惧它来说更有意义。
为什么文心一言被豆包超过了?

最近字节豆包的下载量、日活、留存已超文心一言。
但百度的同学一提到这就说豆包的模型不如文心。
当然我是认可模型层面豆包是不如文心的,
那为什么从数据层面上看文心的数据不如豆包呢。

人际沟通有个法则叫麦拉宾55-38-7法则。

人际沟通中他人对你的第一印象主要来源于三个方面:
55%来源于外表、打扮;
38%来源于说话的语气、情绪、口吻;
7%才是说话的内容。

对应到chatbot产品上,则是:
外表=产品交互设计、易用性;
语气=TTS的自然度、情绪、对话文字的口吻;
内容=大模型生成的文字。

不可否认,文心一言的模型确实要比豆包强,
但这也仅仅只占了用户体验7%,
而占用户体验大头的交互设计、TTS、口语化程度却远不如豆包。

因此,百度的同学是不是该反思自己的数据为什么不如别人?
而不是天天把模型当成遮羞布安慰自己没有完全输。
如果你发现了很不错的播客内容,但是苦于没有时间听完。

推荐大家用以下工具提效:

播客内容转写工具:阿里的@通义听悟

播客内容总结工具:kimi.ai@Kimi智能助手

通义听悟注册就可以送 20 小时使用时间,之后每日登录送 10 小时,绑定阿里云再送 50 小时,如果你是大学生直接送 200 小时,还支持导出文档。

kimi.ai目前还是免费的大善人,不多说了,冲吧!
注意看!我搞定人物换背景的光影问题了!
人形公司一旦发布新产品,总要播放一段VCR,视频里的机器人颤颤巍巍、如履薄冰,还没走几步,就轮到一个通常戴眼镜穿牛仔裤的理工男登场,上来就是对机器人一顿拳打脚踢。

机器人心胸宽广,无论怎么踹,都顽强站稳,继续走他的路,继续颤颤巍巍、如履薄冰。

这些机器人公司的每一次路演,都放佛是对机器人的公开处刑,令人很是同情。
Back to Top