关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
分享几个用的较多的AI工具

1. Kimi Chat

1⃣️ 能处理超长文本的内容,上传一个文档可以自动解析并总结。
上下文理解能力很强,多轮对话也能不跑题。
可以按我的要求进行输出,比如:提炼核心要点,让它根据我上传的文档内容进行回答等。

2⃣️ 能联网搜索,用来做浏览器。自动整理总结搜索的内容。
2. 通义听悟

1⃣️ 我是专门用来生成播客文字稿。经常听到好内容的播客时间都比较长。不想再听第二遍,就生成文字稿进行学习。

2⃣️ 文字稿又可以发给AI进行整理归纳,并要求用有效的方法帮助我掌握这些知识。
3. 妙鸭相机

1⃣️ 用来生成形象照、头像
2⃣️ 可能因为我上传的图片都是原图,所以生成的照片都挺像我的,我觉得还挺好用
4. 豆包

1⃣️ 用豆包都是在做英语口语练习
2⃣️ 制作一个口语训练智能体,可以用自己的声音和照片,自己跟自己对话,感觉很奇妙
3⃣️ 也可以让喜欢的人录制一段音频,就可以用喜欢的人的声音进行对话,完美
5. 秘塔写作

1⃣️ 在写完一篇文稿后,直接丢过来让它检查校对。可以很快指出哪里有错别字,哪里语法有问题,还能提供改写
2⃣️ 比语文老师还有耐心
6. deepl 翻译

1⃣️ 都是机翻,deepl会更地道,一些不常用的本土词汇也能翻译出来
7. 智谱清言

1⃣️ 对话模式离chatgpt更近一点,完美平替
2⃣️ 可以根据不同领域自定义生成智能体。可以上传文档,根据文档内容进行对话问答
8. Suno 音乐生成

1⃣️ 根据描述可以自动生成音乐
2⃣️ 各种风格的音乐都可以生成
3⃣️ 可以自己输入歌词让它作曲和演唱
4⃣️ 也可以让它自动生成歌词

AI工具细分领域做的越好,也会更受我们喜欢吧
大而全的,都做的一般

以上这些都是我日常反复使用的工具,如果觉得还不错,记得给我一些鼓励哦~
VisionPro + AI 视频!
AI探索指南
傻瓜式大语言模型微调训练教程_哔哩哔哩_bilibili 发现一个讲的很细的大语言模型微调教程,详细介绍了整个流程,包括数据准备、参数设置、资源监控等关键步骤。 基本没有技术能力也可以完成微调。想要了解 LLM 原理的可以按这个实践一下。 时间轴: 0:00 概念概览 3:02 自定义数据的准备 8:17 微调操作演示(T4 版本) 16:52 微调操作演示(A100 版本) 19:13 在 Hugging Face 上的保存与使用方法 文字版整理: ✲ 如何使用自己的数据对大语言模型进行微调(fine…
在Colab笔记本中,需要根据实际情况调整一些参数。例如,可以根据数据集的token数量来设置max_sequence_length参数,借助rope scaling技术,模型能够支持任意长度的上下文。此外,还可以选择使用Instruct系列模型作为base model,直接在其基础上进行指令微调。为了节省资源,可以启用4-bit量化。同时,参考Q-Lora论文的建议,调整R值和alpha值,以在资源占用和模型质量之间取得平衡。

✲ 训练过程中的资源使用监控:

在模型训练过程中,用户可以通过Colab的资源监控选项卡实时观察GPU、内存和硬盘的使用情况。如果发现资源不足,可以考虑从T4升级到A100。通过监控资源占用,用户能够及时调整配置,确保微调任务稳定高效地进行。

✲ 模型训练的loss变化和最佳checkpoint的选择:

通过记录不同训练步数下的loss值,可以判断模型的收敛情况。理想的做法是选择loss下降曲线趋于平缓的点作为最佳checkpoint,这样既能充分训练模型,又能避免过拟合。为了事后方便筛选,可以设置每隔一定步数保存一次checkpoint。

✲ 模型微调完成后的保存与使用:

微调完成后,可以选择只保存adapter layers以加快保存速度。但更推荐的做法是保存完整模型,并使用float16精度,这样可以得到一个更通用和标准的模型格式,方便后续的部署和使用。

✲ 在Hugging Face上公开或私有发布微调后的模型:

用户可以选择在Hugging Face的模型库中公开或私有地发布自己微调后的模型。发布之前,需要在Hugging Face账号中创建一个访问令牌,并在发布时提供相应的用户名和令牌信息。通过在Hugging Face上发布模型,用户可以方便地与他人分享自己的微调成果。

✲ 使用微调后的模型进行推理(inference):

在使用微调后的模型进行推理时,首先需要加载保存的模型。接着,使用tokenizer对输入的文本进行处理,并将其传入模型。进行推理时,max_length参数需要与训练时保持一致,以确保生成的结果不会被截断。完成以上步骤后,就可以利用微调后的模型进行各种实际应用了。

来源:https://youtu.be/rANv5BVcR5k?si=7pJoD7X6JpRWo_Ex:
傻瓜式大语言模型微调训练教程_哔哩哔哩_bilibili

发现一个讲的很细的大语言模型微调教程,详细介绍了整个流程,包括数据准备、参数设置、资源监控等关键步骤。

基本没有技术能力也可以完成微调。想要了解 LLM 原理的可以按这个实践一下。

时间轴:

0:00 概念概览
3:02 自定义数据的准备
8:17 微调操作演示(T4 版本)
16:52 微调操作演示(A100 版本)
19:13 在 Hugging Face 上的保存与使用方法

文字版整理:

✲ 如何使用自己的数据对大语言模型进行微调(fine-tuning):

对大语言模型进行微调并不一定非常困难和昂贵。通过使用自己的数据集对预训练模型进行微调,可以让模型更好地适应特定的任务需求。微调过程能够在保留原模型语言理解能力的基础上,进一步提升其在特定领域或任务上的表现。

✲ 使用Hugging Face模型库和Unslaw工具进行模型微调:

Hugging Face提供了丰富的预训练语言模型资源,用户可以根据任务需求选择合适的模型作为基础进行微调。而Unslaw工具则提供了一套简单高效的微调流程,其优点包括出色的内存使用效率以及对扩展上下文窗口的支持。通过Unslaw,用户能够以较低的资源开销完成模型微调。

✲ 在Google Colab上使用免费/付费GPU资源进行微调:

Google Colab提供了免费和付费的GPU资源,用户可以根据任务的复杂程度选择使用T4或A100。对于大多数微调任务而言,免费的T4资源已经足够。但如果数据集较大或模型较为复杂,升级到A100可以获得更充裕的算力支持。Colab为用户提供了一个易于上手的模型微调环境。

✲ 准备自定义的微调数据集:

准备微调数据的过程并不复杂。用户可以直接使用纯文本文件作为数据来源,而无需进行额外的预处理。为了获得理想的微调效果,建议至少准备100-200个样本。在示例中,为了快速演示,仅使用了几个样本。通过一个简单的Python脚本,可以方便地将原始文本数据转换为微调所需的JSON格式。

✲ 修改Colab笔记本中的参数设置:
歸桑,故乡的撒库拉开了。

哈哈,故意找了丑照,秀一下一直在搞的效果。
做了个AI短动画:Devices

AI绘画特别适合奇思妙想的多重变换!
仿佛在平面色彩中穿梭!
利用好这个特点可以做出很有趣的画面🌱
(果味十足🤣

让AI可控绘制以前工作流的内容
很困难还很难出彩 一直在想AI原生的内容
到底具备什么要素
实践了一些工作流发现AI特别擅长
在潜意识中发散艺术细胞
不让它可控生成效果好得多!

新的AI内容应该放大逻辑正确、想象力的美学

点赞转发分享制作过程
*灵感来源于open interpreter宣传片
对 IPAdapter 逐渐有了灵魂级理解
在酒店见到的服务机器人,可以自由上下楼配送物品,对顾客和工作人员双方都有安全保障,还很可爱!
发现一个宝藏网友,开源了很多项目,对实操next.js等web应用很有用‼️

GPT导航站
自带了向量搜索,用到了next.js、fastapi等技术
demo:https://gpts.works
🔗 https://github.com/all-in-aigc/gpts-works

AI红包封面
用到了netx.js、stripe、tailwindcss等技术
demo:https://aicover.design
🔗 https://github.com/all-in-aigc/aicover

AI壁纸生成
用到了netx.js、stripe、tailwindcss等技术
demo:https://aiwallpaper.shop
🔗 https://github.com/all-in-aigc/aiwallpaper

sora视频生成
用到了netx.js、tailwindcss等技术,API还没开放,只是个demo
demo:https://sora.fm
🔗 https://github.com/all-in-aigc/sorafm
鉴于 OpenAI 封号这么严重,后面直接去买第三方的 API ,然后用自己搭建的客户端可能是更好的方式。
第三方的 key 即用即抛,用废即抛,而数据和聊天记录都还存在自己的客户端里,换一个新的 key 又能使用。
分享一下 devv.ai 背后的故事:

我们是如何在几个月的时间里构建 Devv,增长到 50 万用户,并每个月收入 3 万美金的

之前的一篇 Post 被 Reddit removed 了,新发表了一篇,欢迎大家 upvote & comment(最好使用英文)。

👇
https://www.reddit.com/r/SideProject/comments/1bp4d43/how_we_built_an_ai_search_engine_for_devs_got/
MoneyPrinterTurbo:一键自动生成1分钟长的短视频

你只需要输入一个主题或几个关键词就能自动生成短视频。

比如,你只需要告诉它你想制作一个关于“如何制作咖啡”的视频

它能自动为你准备好一切所需内容——从文案到视频片段,甚至还包括字幕和背景音乐。最后自动组合成一个完整的视频。

而且是开源的!

主要功能

1、全自动生成视频元素:基于输入的视频主题或关键词,自动生成视频文案、素材、字幕和背景音乐。

2、支持多种视频尺寸:包括竖屏(9:16, 1080x1920)和横屏(16:9, 1920x1080)格式。

3、批量视频生成:一次性生成多个视频,用户可以从中选择最满意的一个。

4、视频片段时长设置:允许用户调节素材切换频率,控制视频节奏。

5、多语言支持:支持生成中文和英文视频文案。

6、多种语音合成:提供不同的语音合成选项,增加视频的多样性和吸引力。

7、字幕生成与自定义:用户可以自定义字体、位置、颜色和大小,还支持字幕描边设置。

8、背景音乐选择:可以随机选择或指定音乐文件,并设置背景音乐音量。

9、高清无版权素材来源:确保视频素材质量的同时,避免版权问题。

10、支持多种模型接入:包括OpenAI、moonshot、Azure、gpt4free、one-api等。

GitHub: https://github.com/harry0703/MoneyPrinterTurbo
Media is too big
VIEW IN TELEGRAM
Media is too big
VIEW IN TELEGRAM
刚刚,家里的智能家居系统和扫地机器人聊上了,互相问好。
这就是21世纪?和我小时候想的不大一样啊。
冷知识,你可以通过 Spotify API 拿到一支曲子的各项特征数据

它们包括:

1. acousticness
音轨是原声的置信度,范围 0.0~1.0,1.0 代表这段音频很有可能是原声。

2. danceability
音轨适合跳舞的程度,综合音乐的速度、旋律稳定性、节奏强度和整体的规律性得出,范围 0.0~1.0,1.0 代表非常适合跳舞。

3. energy
反应出音乐强烈、活跃的程度,通常而言,能量高的音轨速度快、响亮且嘈杂,比如死亡金属乐就有很高的能量,而巴赫的曲子能量则很低。

4. instrumentalness
预测一个音轨是否不含人声,「哦」和「啊」一类的会被视作乐器声,而 Rap 或口述词则会被视为显著的「人声」,这个指标越接近 1.0,乐段越可能不含人声。

5. key
音轨的键,范围 -1~11,0 代表 C,-1 代表没检测到键。

6. liveness
检测录制内容中是否存在观众,值越高,代表越有可能是现场演出的音轨,0.8 以上表示比较有可能是现场演出。

7. loudness
音轨整体的响度(dB),取自整条音轨的平均值,可用于不同音轨间的响度对比。

8. mode
音轨的调式,1 代表大调(major),0 代表小调(minor)。

9. speechiness
检测音轨中是否有口述的字词,数字越接近 1.0,音轨越可能是演讲类的录制内容(如脱口秀、有声书)。

10. tempo
一个音轨整体的预估速度,以每分钟的拍数计(beats per miniute,BPM)。

11. time_signature
预估的拍号,指每段有多少拍,范围 3~7,3 代表 3/4 拍。

12. valence
音乐的效价,描述了音乐传递情绪的积极程度,范围 0.0~1.0,数字越大代表音乐越积极(高兴、喜悦、开心),越小代表音乐越消极(悲伤、低落、生气)。

https://developer.spotify.com/documentation/web-api/reference/get-audio-features

昨天想着说不定可以用在 AI 生成音乐上,用来更精准的引导音乐生成的方向,不过 Suno 上似乎没有太大变化,可能定性描述比定量数据更有用,也可能我实验的样本还比较少分辨不出。
昨晚这个 AI 生成的视频突然火了,确实非常真实,唇形同步做的非常好,基本没有瑕疵,其他的元素不知道是不是模板。

视频使用原作者 beckylitv 的 AI 广告产品 Arcads 生成的。
Back to Top