关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
傻瓜式大语言模型微调训练教程_哔哩哔哩_bilibili

发现一个讲的很细的大语言模型微调教程,详细介绍了整个流程,包括数据准备、参数设置、资源监控等关键步骤。

基本没有技术能力也可以完成微调。想要了解 LLM 原理的可以按这个实践一下。

时间轴:

0:00 概念概览
3:02 自定义数据的准备
8:17 微调操作演示(T4 版本)
16:52 微调操作演示(A100 版本)
19:13 在 Hugging Face 上的保存与使用方法

文字版整理:

✲ 如何使用自己的数据对大语言模型进行微调(fine-tuning):

对大语言模型进行微调并不一定非常困难和昂贵。通过使用自己的数据集对预训练模型进行微调,可以让模型更好地适应特定的任务需求。微调过程能够在保留原模型语言理解能力的基础上,进一步提升其在特定领域或任务上的表现。

✲ 使用Hugging Face模型库和Unslaw工具进行模型微调:

Hugging Face提供了丰富的预训练语言模型资源,用户可以根据任务需求选择合适的模型作为基础进行微调。而Unslaw工具则提供了一套简单高效的微调流程,其优点包括出色的内存使用效率以及对扩展上下文窗口的支持。通过Unslaw,用户能够以较低的资源开销完成模型微调。

✲ 在Google Colab上使用免费/付费GPU资源进行微调:

Google Colab提供了免费和付费的GPU资源,用户可以根据任务的复杂程度选择使用T4或A100。对于大多数微调任务而言,免费的T4资源已经足够。但如果数据集较大或模型较为复杂,升级到A100可以获得更充裕的算力支持。Colab为用户提供了一个易于上手的模型微调环境。

✲ 准备自定义的微调数据集:

准备微调数据的过程并不复杂。用户可以直接使用纯文本文件作为数据来源,而无需进行额外的预处理。为了获得理想的微调效果,建议至少准备100-200个样本。在示例中,为了快速演示,仅使用了几个样本。通过一个简单的Python脚本,可以方便地将原始文本数据转换为微调所需的JSON格式。

✲ 修改Colab笔记本中的参数设置:
歸桑,故乡的撒库拉开了。

哈哈,故意找了丑照,秀一下一直在搞的效果。
做了个AI短动画:Devices

AI绘画特别适合奇思妙想的多重变换!
仿佛在平面色彩中穿梭!
利用好这个特点可以做出很有趣的画面🌱
(果味十足🤣

让AI可控绘制以前工作流的内容
很困难还很难出彩 一直在想AI原生的内容
到底具备什么要素
实践了一些工作流发现AI特别擅长
在潜意识中发散艺术细胞
不让它可控生成效果好得多!

新的AI内容应该放大逻辑正确、想象力的美学

点赞转发分享制作过程
*灵感来源于open interpreter宣传片
对 IPAdapter 逐渐有了灵魂级理解
在酒店见到的服务机器人,可以自由上下楼配送物品,对顾客和工作人员双方都有安全保障,还很可爱!
发现一个宝藏网友,开源了很多项目,对实操next.js等web应用很有用‼️

GPT导航站
自带了向量搜索,用到了next.js、fastapi等技术
demo:https://gpts.works
🔗 https://github.com/all-in-aigc/gpts-works

AI红包封面
用到了netx.js、stripe、tailwindcss等技术
demo:https://aicover.design
🔗 https://github.com/all-in-aigc/aicover

AI壁纸生成
用到了netx.js、stripe、tailwindcss等技术
demo:https://aiwallpaper.shop
🔗 https://github.com/all-in-aigc/aiwallpaper

sora视频生成
用到了netx.js、tailwindcss等技术,API还没开放,只是个demo
demo:https://sora.fm
🔗 https://github.com/all-in-aigc/sorafm
鉴于 OpenAI 封号这么严重,后面直接去买第三方的 API ,然后用自己搭建的客户端可能是更好的方式。
第三方的 key 即用即抛,用废即抛,而数据和聊天记录都还存在自己的客户端里,换一个新的 key 又能使用。
分享一下 devv.ai 背后的故事:

我们是如何在几个月的时间里构建 Devv,增长到 50 万用户,并每个月收入 3 万美金的

之前的一篇 Post 被 Reddit removed 了,新发表了一篇,欢迎大家 upvote & comment(最好使用英文)。

👇
https://www.reddit.com/r/SideProject/comments/1bp4d43/how_we_built_an_ai_search_engine_for_devs_got/
MoneyPrinterTurbo:一键自动生成1分钟长的短视频

你只需要输入一个主题或几个关键词就能自动生成短视频。

比如,你只需要告诉它你想制作一个关于“如何制作咖啡”的视频

它能自动为你准备好一切所需内容——从文案到视频片段,甚至还包括字幕和背景音乐。最后自动组合成一个完整的视频。

而且是开源的!

主要功能

1、全自动生成视频元素:基于输入的视频主题或关键词,自动生成视频文案、素材、字幕和背景音乐。

2、支持多种视频尺寸:包括竖屏(9:16, 1080x1920)和横屏(16:9, 1920x1080)格式。

3、批量视频生成:一次性生成多个视频,用户可以从中选择最满意的一个。

4、视频片段时长设置:允许用户调节素材切换频率,控制视频节奏。

5、多语言支持:支持生成中文和英文视频文案。

6、多种语音合成:提供不同的语音合成选项,增加视频的多样性和吸引力。

7、字幕生成与自定义:用户可以自定义字体、位置、颜色和大小,还支持字幕描边设置。

8、背景音乐选择:可以随机选择或指定音乐文件,并设置背景音乐音量。

9、高清无版权素材来源:确保视频素材质量的同时,避免版权问题。

10、支持多种模型接入:包括OpenAI、moonshot、Azure、gpt4free、one-api等。

GitHub: https://github.com/harry0703/MoneyPrinterTurbo
Media is too big
VIEW IN TELEGRAM
Media is too big
VIEW IN TELEGRAM
刚刚,家里的智能家居系统和扫地机器人聊上了,互相问好。
这就是21世纪?和我小时候想的不大一样啊。
冷知识,你可以通过 Spotify API 拿到一支曲子的各项特征数据

它们包括:

1. acousticness
音轨是原声的置信度,范围 0.0~1.0,1.0 代表这段音频很有可能是原声。

2. danceability
音轨适合跳舞的程度,综合音乐的速度、旋律稳定性、节奏强度和整体的规律性得出,范围 0.0~1.0,1.0 代表非常适合跳舞。

3. energy
反应出音乐强烈、活跃的程度,通常而言,能量高的音轨速度快、响亮且嘈杂,比如死亡金属乐就有很高的能量,而巴赫的曲子能量则很低。

4. instrumentalness
预测一个音轨是否不含人声,「哦」和「啊」一类的会被视作乐器声,而 Rap 或口述词则会被视为显著的「人声」,这个指标越接近 1.0,乐段越可能不含人声。

5. key
音轨的键,范围 -1~11,0 代表 C,-1 代表没检测到键。

6. liveness
检测录制内容中是否存在观众,值越高,代表越有可能是现场演出的音轨,0.8 以上表示比较有可能是现场演出。

7. loudness
音轨整体的响度(dB),取自整条音轨的平均值,可用于不同音轨间的响度对比。

8. mode
音轨的调式,1 代表大调(major),0 代表小调(minor)。

9. speechiness
检测音轨中是否有口述的字词,数字越接近 1.0,音轨越可能是演讲类的录制内容(如脱口秀、有声书)。

10. tempo
一个音轨整体的预估速度,以每分钟的拍数计(beats per miniute,BPM)。

11. time_signature
预估的拍号,指每段有多少拍,范围 3~7,3 代表 3/4 拍。

12. valence
音乐的效价,描述了音乐传递情绪的积极程度,范围 0.0~1.0,数字越大代表音乐越积极(高兴、喜悦、开心),越小代表音乐越消极(悲伤、低落、生气)。

https://developer.spotify.com/documentation/web-api/reference/get-audio-features

昨天想着说不定可以用在 AI 生成音乐上,用来更精准的引导音乐生成的方向,不过 Suno 上似乎没有太大变化,可能定性描述比定量数据更有用,也可能我实验的样本还比较少分辨不出。
昨晚这个 AI 生成的视频突然火了,确实非常真实,唇形同步做的非常好,基本没有瑕疵,其他的元素不知道是不是模板。

视频使用原作者 beckylitv 的 AI 广告产品 Arcads 生成的。
Claude3 称王,Elo 超越 GPT4 最新版。
连其中最小的 Haiku 也很不错。
确实是好模型,现在天天用。
API 还能免费申请,它不比 GPT4 香嘛?
请到官网申请
https://www.anthropic.com/
和AI重度协作1500个小时,这是我的10条最佳实践经验 by余一.Dev
1.每一个需求,都是开启了一个新的项目组。
2.自己是这个项目组的leader,AI们是项目组组员。把AI定位为新入职的同事、供应商或者外部专家。
3.作为 leader,需要在前面20%和后面20%更加专注,更多全局、目标和创新视角。
4.前面20%指的是:理解、翻译、拆解和规划、反馈和风控、组队
a 理解:理解boss和项目的目标和真实需求
b 翻译:翻译成组员能听懂能执行的任务和追求的结果
c 拆解和规划:拆解项目任务,规划工作流环节 d 反馈和风控:工作流是否有检查反馈卡点和最小影响的回滚机制
d 组队:需要哪些能力的成员作为每个环节的负责人
5.后面的20%是:判断、拍板和妥协
a 要判断现在进入什么状态和水平了,可能遇到了什么问题。
b 要决策找解决方案,找外援,换组员或者妥协,是需要拍板的。
6.要找到并且深度了解自己的骨干组员。同时为自己搭建一个供应商库,可以根据需求调用。
7.对于供应商的选择的评价,除了自己使用外,信任的第三方使用供应商后心得也一样宝贵,多收集多结交多分享。分享包括分享你觉得对方可能需要并且有价值的供应商,实现双赢和杠杆。
8.谨慎地换主供应商,减少工具焦虑。但是可以多一些备用,赛马且更多可能性,卷起来并互相启发。
9.从个人知识管理到团队知识管理:自己和 ai 是项目组团队,所以必须做好团队知识管理。
10.all in one,一个人从0做到100是容易痛苦和迷失的路程。但是 AI让每个人都可以拥有团队,one in all,我们可以摸着鱼,轻松地开启从0到1,自如地前行。
FsV7rJrKeRRBJ5wL39sFD7qtcDQsv3.jpg
865.8 KB
目前为止最喜欢的一个 SUNO 的创作,这个心经唱得真的好舒服。适合冥想一会。
开源我昨天写了一天的 RAG-Search API 项目👇

https://github.com/thinkany-ai/rag-search

使用谷歌搜索引擎 + zilliz向量数据库实现联网数据的召回(retrieval)和重排(reranking),获取搜索链接的详情内容,通过向量相似度匹配过滤内容。

在 LLM 的普遍 long context 时代到来之前,RAG 检索优化有非常重要的意义。这个项目旨在提供一个高效/精准的 RAG Search API,帮助做 AI Search Engine / ChatBot 的朋友,实现更好的Search / Chat 效果。

目前第一个版本实现的还不够好,每一个步骤都有很大的优化空间,希望有更多的朋友参与共建。

也欢迎体验我上周写的 AI Search Engine(需要科学上网)👇

https://thinkany.ai
Back to Top