关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
鉴于 OpenAI 封号这么严重,后面直接去买第三方的 API ,然后用自己搭建的客户端可能是更好的方式。
第三方的 key 即用即抛,用废即抛,而数据和聊天记录都还存在自己的客户端里,换一个新的 key 又能使用。
第三方的 key 即用即抛,用废即抛,而数据和聊天记录都还存在自己的客户端里,换一个新的 key 又能使用。
我们是如何在几个月的时间里构建 Devv,增长到 50 万用户,并每个月收入 3 万美金的
之前的一篇 Post 被 Reddit removed 了,新发表了一篇,欢迎大家 upvote & comment(最好使用英文)。
👇
https://www.reddit.com/r/SideProject/comments/1bp4d43/how_we_built_an_ai_search_engine_for_devs_got/
冷知识,你可以通过 Spotify API 拿到一支曲子的各项特征数据
它们包括:
1. acousticness
音轨是原声的置信度,范围 0.0~1.0,1.0 代表这段音频很有可能是原声。
2. danceability
音轨适合跳舞的程度,综合音乐的速度、旋律稳定性、节奏强度和整体的规律性得出,范围 0.0~1.0,1.0 代表非常适合跳舞。
3. energy
反应出音乐强烈、活跃的程度,通常而言,能量高的音轨速度快、响亮且嘈杂,比如死亡金属乐就有很高的能量,而巴赫的曲子能量则很低。
4. instrumentalness
预测一个音轨是否不含人声,「哦」和「啊」一类的会被视作乐器声,而 Rap 或口述词则会被视为显著的「人声」,这个指标越接近 1.0,乐段越可能不含人声。
5. key
音轨的键,范围 -1~11,0 代表 C,-1 代表没检测到键。
6. liveness
检测录制内容中是否存在观众,值越高,代表越有可能是现场演出的音轨,0.8 以上表示比较有可能是现场演出。
7. loudness
音轨整体的响度(dB),取自整条音轨的平均值,可用于不同音轨间的响度对比。
8. mode
音轨的调式,1 代表大调(major),0 代表小调(minor)。
9. speechiness
检测音轨中是否有口述的字词,数字越接近 1.0,音轨越可能是演讲类的录制内容(如脱口秀、有声书)。
10. tempo
一个音轨整体的预估速度,以每分钟的拍数计(beats per miniute,BPM)。
11. time_signature
预估的拍号,指每段有多少拍,范围 3~7,3 代表 3/4 拍。
12. valence
音乐的效价,描述了音乐传递情绪的积极程度,范围 0.0~1.0,数字越大代表音乐越积极(高兴、喜悦、开心),越小代表音乐越消极(悲伤、低落、生气)。
https://developer.spotify.com/documentation/web-api/reference/get-audio-features
昨天想着说不定可以用在 AI 生成音乐上,用来更精准的引导音乐生成的方向,不过 Suno 上似乎没有太大变化,可能定性描述比定量数据更有用,也可能我实验的样本还比较少分辨不出。
它们包括:
1. acousticness
音轨是原声的置信度,范围 0.0~1.0,1.0 代表这段音频很有可能是原声。
2. danceability
音轨适合跳舞的程度,综合音乐的速度、旋律稳定性、节奏强度和整体的规律性得出,范围 0.0~1.0,1.0 代表非常适合跳舞。
3. energy
反应出音乐强烈、活跃的程度,通常而言,能量高的音轨速度快、响亮且嘈杂,比如死亡金属乐就有很高的能量,而巴赫的曲子能量则很低。
4. instrumentalness
预测一个音轨是否不含人声,「哦」和「啊」一类的会被视作乐器声,而 Rap 或口述词则会被视为显著的「人声」,这个指标越接近 1.0,乐段越可能不含人声。
5. key
音轨的键,范围 -1~11,0 代表 C,-1 代表没检测到键。
6. liveness
检测录制内容中是否存在观众,值越高,代表越有可能是现场演出的音轨,0.8 以上表示比较有可能是现场演出。
7. loudness
音轨整体的响度(dB),取自整条音轨的平均值,可用于不同音轨间的响度对比。
8. mode
音轨的调式,1 代表大调(major),0 代表小调(minor)。
9. speechiness
检测音轨中是否有口述的字词,数字越接近 1.0,音轨越可能是演讲类的录制内容(如脱口秀、有声书)。
10. tempo
一个音轨整体的预估速度,以每分钟的拍数计(beats per miniute,BPM)。
11. time_signature
预估的拍号,指每段有多少拍,范围 3~7,3 代表 3/4 拍。
12. valence
音乐的效价,描述了音乐传递情绪的积极程度,范围 0.0~1.0,数字越大代表音乐越积极(高兴、喜悦、开心),越小代表音乐越消极(悲伤、低落、生气)。
https://developer.spotify.com/documentation/web-api/reference/get-audio-features
昨天想着说不定可以用在 AI 生成音乐上,用来更精准的引导音乐生成的方向,不过 Suno 上似乎没有太大变化,可能定性描述比定量数据更有用,也可能我实验的样本还比较少分辨不出。
连其中最小的 Haiku 也很不错。
确实是好模型,现在天天用。
API 还能免费申请,它不比 GPT4 香嘛?
请到官网申请
https://www.anthropic.com/
和AI重度协作1500个小时,这是我的10条最佳实践经验 by余一.Dev
1.每一个需求,都是开启了一个新的项目组。
2.自己是这个项目组的leader,AI们是项目组组员。把AI定位为新入职的同事、供应商或者外部专家。
3.作为 leader,需要在前面20%和后面20%更加专注,更多全局、目标和创新视角。
4.前面20%指的是:理解、翻译、拆解和规划、反馈和风控、组队
a 理解:理解boss和项目的目标和真实需求
b 翻译:翻译成组员能听懂能执行的任务和追求的结果
c 拆解和规划:拆解项目任务,规划工作流环节 d 反馈和风控:工作流是否有检查反馈卡点和最小影响的回滚机制
d 组队:需要哪些能力的成员作为每个环节的负责人
5.后面的20%是:判断、拍板和妥协
a 要判断现在进入什么状态和水平了,可能遇到了什么问题。
b 要决策找解决方案,找外援,换组员或者妥协,是需要拍板的。
6.要找到并且深度了解自己的骨干组员。同时为自己搭建一个供应商库,可以根据需求调用。
7.对于供应商的选择的评价,除了自己使用外,信任的第三方使用供应商后心得也一样宝贵,多收集多结交多分享。分享包括分享你觉得对方可能需要并且有价值的供应商,实现双赢和杠杆。
8.谨慎地换主供应商,减少工具焦虑。但是可以多一些备用,赛马且更多可能性,卷起来并互相启发。
9.从个人知识管理到团队知识管理:自己和 ai 是项目组团队,所以必须做好团队知识管理。
10.all in one,一个人从0做到100是容易痛苦和迷失的路程。但是 AI让每个人都可以拥有团队,one in all,我们可以摸着鱼,轻松地开启从0到1,自如地前行。
1.每一个需求,都是开启了一个新的项目组。
2.自己是这个项目组的leader,AI们是项目组组员。把AI定位为新入职的同事、供应商或者外部专家。
3.作为 leader,需要在前面20%和后面20%更加专注,更多全局、目标和创新视角。
4.前面20%指的是:理解、翻译、拆解和规划、反馈和风控、组队
a 理解:理解boss和项目的目标和真实需求
b 翻译:翻译成组员能听懂能执行的任务和追求的结果
c 拆解和规划:拆解项目任务,规划工作流环节 d 反馈和风控:工作流是否有检查反馈卡点和最小影响的回滚机制
d 组队:需要哪些能力的成员作为每个环节的负责人
5.后面的20%是:判断、拍板和妥协
a 要判断现在进入什么状态和水平了,可能遇到了什么问题。
b 要决策找解决方案,找外援,换组员或者妥协,是需要拍板的。
6.要找到并且深度了解自己的骨干组员。同时为自己搭建一个供应商库,可以根据需求调用。
7.对于供应商的选择的评价,除了自己使用外,信任的第三方使用供应商后心得也一样宝贵,多收集多结交多分享。分享包括分享你觉得对方可能需要并且有价值的供应商,实现双赢和杠杆。
8.谨慎地换主供应商,减少工具焦虑。但是可以多一些备用,赛马且更多可能性,卷起来并互相启发。
9.从个人知识管理到团队知识管理:自己和 ai 是项目组团队,所以必须做好团队知识管理。
10.all in one,一个人从0做到100是容易痛苦和迷失的路程。但是 AI让每个人都可以拥有团队,one in all,我们可以摸着鱼,轻松地开启从0到1,自如地前行。
而且还是开源的,提供了Colab笔记运行并且填写API就可以,或者也可以直接使用他的产品生成。
项目地址:https://github.com/mshumer/ai-journalist
尝试了一下 Suno,会有直观的冲击。
这个《低语的竹子》从头到尾都是 AI 的作品。ChatGPT 完成脚本(prompt),Suno 创作词曲,Midjourney 创作背景图,DeepL 翻译中文歌词。当然,想法还是需要自己提供一些「冷启动」。
这是 AI 在继续让创作门槛降低。未来的创作者的工具会极大丰富,而需要花费时间掌握的多数「技术能力」会迅速贬值。
一人杂志(公众号/播客)、一人电视台(直播间)刚刚成真,一人乐队、一人电影、一人游戏已在眼前。
这个《低语的竹子》从头到尾都是 AI 的作品。ChatGPT 完成脚本(prompt),Suno 创作词曲,Midjourney 创作背景图,DeepL 翻译中文歌词。当然,想法还是需要自己提供一些「冷启动」。
这是 AI 在继续让创作门槛降低。未来的创作者的工具会极大丰富,而需要花费时间掌握的多数「技术能力」会迅速贬值。
一人杂志(公众号/播客)、一人电视台(直播间)刚刚成真,一人乐队、一人电影、一人游戏已在眼前。
SUNO V3 有点像 Midjourney 的 V3,GPT 的 3.0 版本,给音乐产业带来了很多变化的可能:
1)UGC 音乐平台:音乐是创作者头部效应最明显的产业之一,在 pre-AI 时代,普通人拍的视频可能是具备被消费价值的,因为拍摄的对象可能很有意思,但是普通人创作的音乐或者翻唱的歌是完全达不到及格线的。所以之前做音乐 UGC 平台的公司基本都没有起来,音乐版权拥有者赚钱很容易,天下苦三大久已。
但现在 SUNO 为代表的AI作曲工具,有点像摄影的发展从一开始要用胶片拍摄和冲洗,变成了数码相机,再变成了手机摄像头。当大量的人突然可以按照自己的想法和歌词生成达到及格线的音乐时,这里面就可能会诞生新的音乐家和大作。
于此同时,SUNO 也是 AIGC 应用里面难得的可以形成「内容生产者 + 消费者闭环」的平台。妙鸭和 Midjourney 的问题都在于AI产生的内容在本平台上的再消费价值不大。一个人用 MJ 生成的图片一般来说只对这个生产者本人有价值,但用 SUNO 生成的音乐不一定。我发现我很自然地就在 SUNO 上开始听推荐的音乐了,有的还真的有点意思:
例子:https://app.suno.ai/song/5c16c93d-0c60-4be1-a65f-c0fafe001a1b 这个应该是用了自定义歌词,但听起来真挺可以的。
2)个性化音乐:70 分的音乐单独听可能价值不大,因为我总可以去听95 分的佳作,实际上只有音乐存在「单曲循环」的场景,我们会不断的听最好的歌。但 70 分的音乐配合合适的场景可能是有用的,尤其是可以随时生成个性化歌词音乐的时候。
例子:https://www.bilibili.com/video/BV1Xu4y1n7Jd 用 AI 产生自定义音乐点评电影。
3)背景音乐生成器:有一些场景是 70 分音乐也 OK的场景,并且感觉器乐会更容易,因为音乐底层和数学其实是很像的?想起小时候有个假乐队叫班得瑞,就是台湾一个乐队公司把很多风格类似的器乐包装在一起出专辑,而 SUNO 现在生成的钢琴曲质量已经不错了,感觉凑合可以作为很多咖啡厅的背景声。
例子:https://app.suno.ai/song/a0f12ca5-0833-49ce-97f1-cd6094510f2c
4)音乐人的Copilot:就跟我们不能现在要求 Chatgpt 直接写出一部小说一样,对 SUNO 的要求也不应该是直接生成一首完整的歌,而是作为再创作的起点。SUNO 可以首先作为音乐创作者的 Copilot。这个地方看起来难点是如何生成专业创作者需要的工程文件(和 3D 生成遇到的问题类似),分轨的原始音乐素材也是现在最难获得的训练数据。
1)UGC 音乐平台:音乐是创作者头部效应最明显的产业之一,在 pre-AI 时代,普通人拍的视频可能是具备被消费价值的,因为拍摄的对象可能很有意思,但是普通人创作的音乐或者翻唱的歌是完全达不到及格线的。所以之前做音乐 UGC 平台的公司基本都没有起来,音乐版权拥有者赚钱很容易,天下苦三大久已。
但现在 SUNO 为代表的AI作曲工具,有点像摄影的发展从一开始要用胶片拍摄和冲洗,变成了数码相机,再变成了手机摄像头。当大量的人突然可以按照自己的想法和歌词生成达到及格线的音乐时,这里面就可能会诞生新的音乐家和大作。
于此同时,SUNO 也是 AIGC 应用里面难得的可以形成「内容生产者 + 消费者闭环」的平台。妙鸭和 Midjourney 的问题都在于AI产生的内容在本平台上的再消费价值不大。一个人用 MJ 生成的图片一般来说只对这个生产者本人有价值,但用 SUNO 生成的音乐不一定。我发现我很自然地就在 SUNO 上开始听推荐的音乐了,有的还真的有点意思:
例子:https://app.suno.ai/song/5c16c93d-0c60-4be1-a65f-c0fafe001a1b 这个应该是用了自定义歌词,但听起来真挺可以的。
2)个性化音乐:70 分的音乐单独听可能价值不大,因为我总可以去听95 分的佳作,实际上只有音乐存在「单曲循环」的场景,我们会不断的听最好的歌。但 70 分的音乐配合合适的场景可能是有用的,尤其是可以随时生成个性化歌词音乐的时候。
例子:https://www.bilibili.com/video/BV1Xu4y1n7Jd 用 AI 产生自定义音乐点评电影。
3)背景音乐生成器:有一些场景是 70 分音乐也 OK的场景,并且感觉器乐会更容易,因为音乐底层和数学其实是很像的?想起小时候有个假乐队叫班得瑞,就是台湾一个乐队公司把很多风格类似的器乐包装在一起出专辑,而 SUNO 现在生成的钢琴曲质量已经不错了,感觉凑合可以作为很多咖啡厅的背景声。
例子:https://app.suno.ai/song/a0f12ca5-0833-49ce-97f1-cd6094510f2c
4)音乐人的Copilot:就跟我们不能现在要求 Chatgpt 直接写出一部小说一样,对 SUNO 的要求也不应该是直接生成一首完整的歌,而是作为再创作的起点。SUNO 可以首先作为音乐创作者的 Copilot。这个地方看起来难点是如何生成专业创作者需要的工程文件(和 3D 生成遇到的问题类似),分轨的原始音乐素材也是现在最难获得的训练数据。