关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
在酒店见到的服务机器人,可以自由上下楼配送物品,对顾客和工作人员双方都有安全保障,还很可爱!
发现一个宝藏网友,开源了很多项目,对实操next.js等web应用很有用‼️

GPT导航站
自带了向量搜索,用到了next.js、fastapi等技术
demo:https://gpts.works
🔗 https://github.com/all-in-aigc/gpts-works

AI红包封面
用到了netx.js、stripe、tailwindcss等技术
demo:https://aicover.design
🔗 https://github.com/all-in-aigc/aicover

AI壁纸生成
用到了netx.js、stripe、tailwindcss等技术
demo:https://aiwallpaper.shop
🔗 https://github.com/all-in-aigc/aiwallpaper

sora视频生成
用到了netx.js、tailwindcss等技术,API还没开放,只是个demo
demo:https://sora.fm
🔗 https://github.com/all-in-aigc/sorafm
鉴于 OpenAI 封号这么严重,后面直接去买第三方的 API ,然后用自己搭建的客户端可能是更好的方式。
第三方的 key 即用即抛,用废即抛,而数据和聊天记录都还存在自己的客户端里,换一个新的 key 又能使用。
分享一下 devv.ai 背后的故事:

我们是如何在几个月的时间里构建 Devv,增长到 50 万用户,并每个月收入 3 万美金的

之前的一篇 Post 被 Reddit removed 了,新发表了一篇,欢迎大家 upvote & comment(最好使用英文)。

👇
https://www.reddit.com/r/SideProject/comments/1bp4d43/how_we_built_an_ai_search_engine_for_devs_got/
MoneyPrinterTurbo:一键自动生成1分钟长的短视频

你只需要输入一个主题或几个关键词就能自动生成短视频。

比如,你只需要告诉它你想制作一个关于“如何制作咖啡”的视频

它能自动为你准备好一切所需内容——从文案到视频片段,甚至还包括字幕和背景音乐。最后自动组合成一个完整的视频。

而且是开源的!

主要功能

1、全自动生成视频元素:基于输入的视频主题或关键词,自动生成视频文案、素材、字幕和背景音乐。

2、支持多种视频尺寸:包括竖屏(9:16, 1080x1920)和横屏(16:9, 1920x1080)格式。

3、批量视频生成:一次性生成多个视频,用户可以从中选择最满意的一个。

4、视频片段时长设置:允许用户调节素材切换频率,控制视频节奏。

5、多语言支持:支持生成中文和英文视频文案。

6、多种语音合成:提供不同的语音合成选项,增加视频的多样性和吸引力。

7、字幕生成与自定义:用户可以自定义字体、位置、颜色和大小,还支持字幕描边设置。

8、背景音乐选择:可以随机选择或指定音乐文件,并设置背景音乐音量。

9、高清无版权素材来源:确保视频素材质量的同时,避免版权问题。

10、支持多种模型接入:包括OpenAI、moonshot、Azure、gpt4free、one-api等。

GitHub: https://github.com/harry0703/MoneyPrinterTurbo
Media is too big
VIEW IN TELEGRAM
Media is too big
VIEW IN TELEGRAM
刚刚,家里的智能家居系统和扫地机器人聊上了,互相问好。
这就是21世纪?和我小时候想的不大一样啊。
冷知识,你可以通过 Spotify API 拿到一支曲子的各项特征数据

它们包括:

1. acousticness
音轨是原声的置信度,范围 0.0~1.0,1.0 代表这段音频很有可能是原声。

2. danceability
音轨适合跳舞的程度,综合音乐的速度、旋律稳定性、节奏强度和整体的规律性得出,范围 0.0~1.0,1.0 代表非常适合跳舞。

3. energy
反应出音乐强烈、活跃的程度,通常而言,能量高的音轨速度快、响亮且嘈杂,比如死亡金属乐就有很高的能量,而巴赫的曲子能量则很低。

4. instrumentalness
预测一个音轨是否不含人声,「哦」和「啊」一类的会被视作乐器声,而 Rap 或口述词则会被视为显著的「人声」,这个指标越接近 1.0,乐段越可能不含人声。

5. key
音轨的键,范围 -1~11,0 代表 C,-1 代表没检测到键。

6. liveness
检测录制内容中是否存在观众,值越高,代表越有可能是现场演出的音轨,0.8 以上表示比较有可能是现场演出。

7. loudness
音轨整体的响度(dB),取自整条音轨的平均值,可用于不同音轨间的响度对比。

8. mode
音轨的调式,1 代表大调(major),0 代表小调(minor)。

9. speechiness
检测音轨中是否有口述的字词,数字越接近 1.0,音轨越可能是演讲类的录制内容(如脱口秀、有声书)。

10. tempo
一个音轨整体的预估速度,以每分钟的拍数计(beats per miniute,BPM)。

11. time_signature
预估的拍号,指每段有多少拍,范围 3~7,3 代表 3/4 拍。

12. valence
音乐的效价,描述了音乐传递情绪的积极程度,范围 0.0~1.0,数字越大代表音乐越积极(高兴、喜悦、开心),越小代表音乐越消极(悲伤、低落、生气)。

https://developer.spotify.com/documentation/web-api/reference/get-audio-features

昨天想着说不定可以用在 AI 生成音乐上,用来更精准的引导音乐生成的方向,不过 Suno 上似乎没有太大变化,可能定性描述比定量数据更有用,也可能我实验的样本还比较少分辨不出。
昨晚这个 AI 生成的视频突然火了,确实非常真实,唇形同步做的非常好,基本没有瑕疵,其他的元素不知道是不是模板。

视频使用原作者 beckylitv 的 AI 广告产品 Arcads 生成的。
Claude3 称王,Elo 超越 GPT4 最新版。
连其中最小的 Haiku 也很不错。
确实是好模型,现在天天用。
API 还能免费申请,它不比 GPT4 香嘛?
请到官网申请
https://www.anthropic.com/
和AI重度协作1500个小时,这是我的10条最佳实践经验 by余一.Dev
1.每一个需求,都是开启了一个新的项目组。
2.自己是这个项目组的leader,AI们是项目组组员。把AI定位为新入职的同事、供应商或者外部专家。
3.作为 leader,需要在前面20%和后面20%更加专注,更多全局、目标和创新视角。
4.前面20%指的是:理解、翻译、拆解和规划、反馈和风控、组队
a 理解:理解boss和项目的目标和真实需求
b 翻译:翻译成组员能听懂能执行的任务和追求的结果
c 拆解和规划:拆解项目任务,规划工作流环节 d 反馈和风控:工作流是否有检查反馈卡点和最小影响的回滚机制
d 组队:需要哪些能力的成员作为每个环节的负责人
5.后面的20%是:判断、拍板和妥协
a 要判断现在进入什么状态和水平了,可能遇到了什么问题。
b 要决策找解决方案,找外援,换组员或者妥协,是需要拍板的。
6.要找到并且深度了解自己的骨干组员。同时为自己搭建一个供应商库,可以根据需求调用。
7.对于供应商的选择的评价,除了自己使用外,信任的第三方使用供应商后心得也一样宝贵,多收集多结交多分享。分享包括分享你觉得对方可能需要并且有价值的供应商,实现双赢和杠杆。
8.谨慎地换主供应商,减少工具焦虑。但是可以多一些备用,赛马且更多可能性,卷起来并互相启发。
9.从个人知识管理到团队知识管理:自己和 ai 是项目组团队,所以必须做好团队知识管理。
10.all in one,一个人从0做到100是容易痛苦和迷失的路程。但是 AI让每个人都可以拥有团队,one in all,我们可以摸着鱼,轻松地开启从0到1,自如地前行。
FsV7rJrKeRRBJ5wL39sFD7qtcDQsv3.jpg
865.8 KB
目前为止最喜欢的一个 SUNO 的创作,这个心经唱得真的好舒服。适合冥想一会。
开源我昨天写了一天的 RAG-Search API 项目👇

https://github.com/thinkany-ai/rag-search

使用谷歌搜索引擎 + zilliz向量数据库实现联网数据的召回(retrieval)和重排(reranking),获取搜索链接的详情内容,通过向量相似度匹配过滤内容。

在 LLM 的普遍 long context 时代到来之前,RAG 检索优化有非常重要的意义。这个项目旨在提供一个高效/精准的 RAG Search API,帮助做 AI Search Engine / ChatBot 的朋友,实现更好的Search / Chat 效果。

目前第一个版本实现的还不够好,每一个步骤都有很大的优化空间,希望有更多的朋友参与共建。

也欢迎体验我上周写的 AI Search Engine(需要科学上网)👇

https://thinkany.ai
接上条。发现 Suno 可以用中文,玩到半夜,不亦乐乎。这次的作品可能更有直观的冲击力:《高速运转,进入中国》。
claude-journalist 这个工具不错,你只要输入一个主题他就能使用Claude 3 从网上搜索相关信息自动生成一篇对应主题的文章。

而且还是开源的,提供了Colab笔记运行并且填写API就可以,或者也可以直接使用他的产品生成。

项目地址:https://github.com/mshumer/ai-journalist
End or Beginning | Suno

把北岛的诗丢进SUNO生成的音乐,女声响起时有一点感动。谁说AI就不能有灵魂呢?又或者,什么是灵魂?
尝试了一下 Suno,会有直观的冲击。

这个《低语的竹子》从头到尾都是 AI 的作品。ChatGPT 完成脚本(prompt),Suno 创作词曲,Midjourney 创作背景图,DeepL 翻译中文歌词。当然,想法还是需要自己提供一些「冷启动」。

这是 AI 在继续让创作门槛降低。未来的创作者的工具会极大丰富,而需要花费时间掌握的多数「技术能力」会迅速贬值。

一人杂志(公众号/播客)、一人电视台(直播间)刚刚成真,一人乐队、一人电影、一人游戏已在眼前。
Back to Top