关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
一篇写的非常好的文章,详细介绍了如何对大语言模型的质量进行评估。

流程包括单元测试、人工评估、模型评估和 A/B 测试,强调快速迭代和数据管理的重要性。

一个好的测试流程是模型进步的必要条件,如果没办法准确测试模型质量,就没办法帮助模型进步。

👇下面是大致的内容整理,后面有全文翻译:

✲ 大语言模型产品的评估系统

评估系统对大语言模型(LLM)产品的成功至关重要。许多 LLM 产品之所以失败,根本原因在于未能创建健壮的评估系统。评估、调试和改进是 LLM 产品成功的关键,而良好的评估系统可以创造一个良性循环,加速产品的迭代和改进。案例研究中的 Lucy 就是一个典型的例子,它初期通过提示工程取得了进展,但后来遇到了性能瓶颈,需要建立系统的评估方法来突破瓶颈。

✲ 评估的类型

LLM 产品的评估主要分为三个层次:单元测试、人工评估和模型评估、A/B 测试。单元测试是通过编写一些断言语句,在开发过程中快速获得反馈。人工评估和模型评估是通过人工检查和训练评估模型来评估整个系统。A/B 测试则用于确保 AI 产品能够驱动期望的用户行为或结果。除了评估整个系统,还需要对子组件如 RAG 进行单独评估。

✲ 单元测试的步骤

单元测试是 LLM 产品评估的基础,通常包括三个步骤:编写特定范围的测试、创建测试用例和定期执行测试并追踪结果。编写测试时要针对 LLM 的不同功能和场景,检验相应的断言。可以利用 LLM 自动生成测试用例,触发不同的场景。测试应当定期执行,利用 CI 基础设施可以很方便地实现自动化测试和结果跟踪。测试通过率并不一定要达到100%,而是要在错误容忍度和产品目标之间取得平衡。

✲ 人工评估和模型评估

人工评估和模型评估是更高层次的测试手段。首先要记录 LLM 系统的跟踪数据,包括用户的输入和系统的响应,为后续分析提供数据基础。在查看数据时,定制化的查看工具和良好的可视化非常重要。将人工评估结果与评估模型的预测对齐,可以极大提高评估的效率。随着评估模型性能的提升,可以渐进式地用自动评估来替代人工评估。

✲ 微调和数据合成与管理
分享几个用的较多的AI工具

1. Kimi Chat

1⃣️ 能处理超长文本的内容,上传一个文档可以自动解析并总结。
上下文理解能力很强,多轮对话也能不跑题。
可以按我的要求进行输出,比如:提炼核心要点,让它根据我上传的文档内容进行回答等。

2⃣️ 能联网搜索,用来做浏览器。自动整理总结搜索的内容。
2. 通义听悟

1⃣️ 我是专门用来生成播客文字稿。经常听到好内容的播客时间都比较长。不想再听第二遍,就生成文字稿进行学习。

2⃣️ 文字稿又可以发给AI进行整理归纳,并要求用有效的方法帮助我掌握这些知识。
3. 妙鸭相机

1⃣️ 用来生成形象照、头像
2⃣️ 可能因为我上传的图片都是原图,所以生成的照片都挺像我的,我觉得还挺好用
4. 豆包

1⃣️ 用豆包都是在做英语口语练习
2⃣️ 制作一个口语训练智能体,可以用自己的声音和照片,自己跟自己对话,感觉很奇妙
3⃣️ 也可以让喜欢的人录制一段音频,就可以用喜欢的人的声音进行对话,完美
5. 秘塔写作

1⃣️ 在写完一篇文稿后,直接丢过来让它检查校对。可以很快指出哪里有错别字,哪里语法有问题,还能提供改写
2⃣️ 比语文老师还有耐心
6. deepl 翻译

1⃣️ 都是机翻,deepl会更地道,一些不常用的本土词汇也能翻译出来
7. 智谱清言

1⃣️ 对话模式离chatgpt更近一点,完美平替
2⃣️ 可以根据不同领域自定义生成智能体。可以上传文档,根据文档内容进行对话问答
8. Suno 音乐生成

1⃣️ 根据描述可以自动生成音乐
2⃣️ 各种风格的音乐都可以生成
3⃣️ 可以自己输入歌词让它作曲和演唱
4⃣️ 也可以让它自动生成歌词

AI工具细分领域做的越好,也会更受我们喜欢吧
大而全的,都做的一般

以上这些都是我日常反复使用的工具,如果觉得还不错,记得给我一些鼓励哦~
VisionPro + AI 视频!
AI探索指南
傻瓜式大语言模型微调训练教程_哔哩哔哩_bilibili 发现一个讲的很细的大语言模型微调教程,详细介绍了整个流程,包括数据准备、参数设置、资源监控等关键步骤。 基本没有技术能力也可以完成微调。想要了解 LLM 原理的可以按这个实践一下。 时间轴: 0:00 概念概览 3:02 自定义数据的准备 8:17 微调操作演示(T4 版本) 16:52 微调操作演示(A100 版本) 19:13 在 Hugging Face 上的保存与使用方法 文字版整理: ✲ 如何使用自己的数据对大语言模型进行微调(fine…
在Colab笔记本中,需要根据实际情况调整一些参数。例如,可以根据数据集的token数量来设置max_sequence_length参数,借助rope scaling技术,模型能够支持任意长度的上下文。此外,还可以选择使用Instruct系列模型作为base model,直接在其基础上进行指令微调。为了节省资源,可以启用4-bit量化。同时,参考Q-Lora论文的建议,调整R值和alpha值,以在资源占用和模型质量之间取得平衡。

✲ 训练过程中的资源使用监控:

在模型训练过程中,用户可以通过Colab的资源监控选项卡实时观察GPU、内存和硬盘的使用情况。如果发现资源不足,可以考虑从T4升级到A100。通过监控资源占用,用户能够及时调整配置,确保微调任务稳定高效地进行。

✲ 模型训练的loss变化和最佳checkpoint的选择:

通过记录不同训练步数下的loss值,可以判断模型的收敛情况。理想的做法是选择loss下降曲线趋于平缓的点作为最佳checkpoint,这样既能充分训练模型,又能避免过拟合。为了事后方便筛选,可以设置每隔一定步数保存一次checkpoint。

✲ 模型微调完成后的保存与使用:

微调完成后,可以选择只保存adapter layers以加快保存速度。但更推荐的做法是保存完整模型,并使用float16精度,这样可以得到一个更通用和标准的模型格式,方便后续的部署和使用。

✲ 在Hugging Face上公开或私有发布微调后的模型:

用户可以选择在Hugging Face的模型库中公开或私有地发布自己微调后的模型。发布之前,需要在Hugging Face账号中创建一个访问令牌,并在发布时提供相应的用户名和令牌信息。通过在Hugging Face上发布模型,用户可以方便地与他人分享自己的微调成果。

✲ 使用微调后的模型进行推理(inference):

在使用微调后的模型进行推理时,首先需要加载保存的模型。接着,使用tokenizer对输入的文本进行处理,并将其传入模型。进行推理时,max_length参数需要与训练时保持一致,以确保生成的结果不会被截断。完成以上步骤后,就可以利用微调后的模型进行各种实际应用了。

来源:https://youtu.be/rANv5BVcR5k?si=7pJoD7X6JpRWo_Ex:
傻瓜式大语言模型微调训练教程_哔哩哔哩_bilibili

发现一个讲的很细的大语言模型微调教程,详细介绍了整个流程,包括数据准备、参数设置、资源监控等关键步骤。

基本没有技术能力也可以完成微调。想要了解 LLM 原理的可以按这个实践一下。

时间轴:

0:00 概念概览
3:02 自定义数据的准备
8:17 微调操作演示(T4 版本)
16:52 微调操作演示(A100 版本)
19:13 在 Hugging Face 上的保存与使用方法

文字版整理:

✲ 如何使用自己的数据对大语言模型进行微调(fine-tuning):

对大语言模型进行微调并不一定非常困难和昂贵。通过使用自己的数据集对预训练模型进行微调,可以让模型更好地适应特定的任务需求。微调过程能够在保留原模型语言理解能力的基础上,进一步提升其在特定领域或任务上的表现。

✲ 使用Hugging Face模型库和Unslaw工具进行模型微调:

Hugging Face提供了丰富的预训练语言模型资源,用户可以根据任务需求选择合适的模型作为基础进行微调。而Unslaw工具则提供了一套简单高效的微调流程,其优点包括出色的内存使用效率以及对扩展上下文窗口的支持。通过Unslaw,用户能够以较低的资源开销完成模型微调。

✲ 在Google Colab上使用免费/付费GPU资源进行微调:

Google Colab提供了免费和付费的GPU资源,用户可以根据任务的复杂程度选择使用T4或A100。对于大多数微调任务而言,免费的T4资源已经足够。但如果数据集较大或模型较为复杂,升级到A100可以获得更充裕的算力支持。Colab为用户提供了一个易于上手的模型微调环境。

✲ 准备自定义的微调数据集:

准备微调数据的过程并不复杂。用户可以直接使用纯文本文件作为数据来源,而无需进行额外的预处理。为了获得理想的微调效果,建议至少准备100-200个样本。在示例中,为了快速演示,仅使用了几个样本。通过一个简单的Python脚本,可以方便地将原始文本数据转换为微调所需的JSON格式。

✲ 修改Colab笔记本中的参数设置:
歸桑,故乡的撒库拉开了。

哈哈,故意找了丑照,秀一下一直在搞的效果。
做了个AI短动画:Devices

AI绘画特别适合奇思妙想的多重变换!
仿佛在平面色彩中穿梭!
利用好这个特点可以做出很有趣的画面🌱
(果味十足🤣

让AI可控绘制以前工作流的内容
很困难还很难出彩 一直在想AI原生的内容
到底具备什么要素
实践了一些工作流发现AI特别擅长
在潜意识中发散艺术细胞
不让它可控生成效果好得多!

新的AI内容应该放大逻辑正确、想象力的美学

点赞转发分享制作过程
*灵感来源于open interpreter宣传片
对 IPAdapter 逐渐有了灵魂级理解
在酒店见到的服务机器人,可以自由上下楼配送物品,对顾客和工作人员双方都有安全保障,还很可爱!
Back to Top