关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
今天新做了个GPT「花生的flomo助理」,用flomo的API加上GPTs Actions的能力,可以实现从ChatGPT对话到flomo归档的快捷工作流。

比如我跟ChatGPT聊了半天健康饮食的话题,聊完之后我希望把上面的内容总结并记录到flomo,需要做的就只是在对话框中 @ 这个GPT,然后要求总结并发送就好了。当然,不总结发送全文,或者自己写一段文字,要求改错别字、润色再发过去都可以。

不过呢,这个GPT暂时只限我自己使用,没法公开,因为其中的API链接是写死的,虽然不写死让每个人都可用也行,但是在不写死的情况下,如果通过@ 形式要求flomo记录,他每次都需要询问每个用户自己的flomo API链接,有点繁琐。

我把这个GPT Actions的Schema发到评论区,如果需要的话,你也可以自己定制一个。
正式向大家介绍我们最新的产品:🚀Dodoboo🚀,AI驱动的儿童绘画产品,Best AI Practice for kids!!!, 我们可以将孩子们的几笔涂鸦变成一个Masterpiece,释放他们无限的创造力。欢迎大家也来体验。希望大家可以Upvote + Comment支持⬆️💪
https://www.producthunt.com/posts/dodoboo

有PH账号的朋友麻烦点个赞啊
一个顶级 AI 产品经理的自我修养 | 对谈光年之外产品负责人 Hidecloud - 42章经

AI 产品经理到底该长什么样子,该怎么招、怎么培养?我觉得这期对市场的意义很大,相信很多人听完就会开始读 paper 和自己实践做产品了😃
张鹏对谈安克阳萌:GPU+Transformer 不是最终状态,大模型会催生新的硬件机会

阳萌:『以前我在 Google 做搜索工程师,2008 年我们内部的评价标准下,Google 搜索就已经能到 62、63 分了,但十几年过去了,这个分数也没有提高特别多。

这个背后有一些底层逻辑。首先,分治法因为要避免累积误差,所以要把每个步骤都尽可能做好。然后就发现很多步骤越往细做,其实都是在越钻牛角尖,没有意义。例如机器人要讲重定位精度,而人的重定位精度很差,也能做很复杂的操作。

其次,分治法在不断细分问题时会消耗大量人力。搜索要一千人打底,自动驾驶也要一千人。到后面更糟的情况是,分得越精细,代码越复杂,所需要的理解和迭代成本指数上升。最终它的天花板就到了,这个时候再加更多的人,或者拆得再细,都弊大于利了。…( ➠ 详见正文)』🤔
转发自通往AGI之路的ai大模型的微信🤖️搭建教程:
张梦飞|微信机器人搭建小小白教程:https://waytoagi.feishu.cn/wiki/A9w1wUcXSihF6XkeKVic8CXxnHb

Yaki|新手小白可以看这个教程:https://waytoagi.feishu.cn/wiki/UADkwZ9B0iAWdTkFJIjcN7EgnAh

熊猫大侠|梳理更详细的教程
https://waytoagi.feishu.cn/wiki/YNNuwEqCXiSj2akS5mlcjpZgnrb

丁先生|全程白嫖 - 拥有一个AI大模型的微信小助手
https://waytoagi.feishu.cn/wiki/EYdCw5tTTimCOukGiSfczj2Gnqd
AI探索指南
一篇写的非常好的文章,详细介绍了如何对大语言模型的质量进行评估。 流程包括单元测试、人工评估、模型评估和 A/B 测试,强调快速迭代和数据管理的重要性。 一个好的测试流程是模型进步的必要条件,如果没办法准确测试模型质量,就没办法帮助模型进步。 👇下面是大致的内容整理,后面有全文翻译: ✲ 大语言模型产品的评估系统 评估系统对大语言模型(LLM)产品的成功至关重要。许多 LLM 产品之所以失败,根本原因在于未能创建健壮的评估系统。评估、调试和改进是 LLM 产品成功的关键,而良好的评估系统可以创造一个良性循环…
评估系统所积累的数据和流程,可以很自然地应用到 LLM 产品的微调和数据管理中。微调最关键的是数据质量,而评估系统可以通过筛选、清洗、合成等手段来生成高质量的微调数据。评估系统中记录的跟踪数据、断言规则、人工反馈等,都可以直接用于微调数据的管理。总的来说,评估基础设施和微调及数据合成所需的基础设施有很大重叠。

✲ 调试

LLM 产品的调试也可以受益于评估系统。理想的评估系统应该能够支持快速定位错误,找到问题的根本原因。其中的关键是丰富的跟踪数据、可以标记错误的机制、高效的日志搜索和导航工具等。此外,系统的设计应当允许快速测试解决方案并验证有效性。总之,调试和评估所需的基础设施在很多方面是共通的。

全文翻译:https://quail.ink/op7418/p/e4bda0e79a84e4babae5b7a5e699bae883bde4baa7e59381e99c80e8a681e8af84e4bcb0-e5a682e4bd95e8af84e4bcb0llme4baa7e59381
一篇写的非常好的文章,详细介绍了如何对大语言模型的质量进行评估。

流程包括单元测试、人工评估、模型评估和 A/B 测试,强调快速迭代和数据管理的重要性。

一个好的测试流程是模型进步的必要条件,如果没办法准确测试模型质量,就没办法帮助模型进步。

👇下面是大致的内容整理,后面有全文翻译:

✲ 大语言模型产品的评估系统

评估系统对大语言模型(LLM)产品的成功至关重要。许多 LLM 产品之所以失败,根本原因在于未能创建健壮的评估系统。评估、调试和改进是 LLM 产品成功的关键,而良好的评估系统可以创造一个良性循环,加速产品的迭代和改进。案例研究中的 Lucy 就是一个典型的例子,它初期通过提示工程取得了进展,但后来遇到了性能瓶颈,需要建立系统的评估方法来突破瓶颈。

✲ 评估的类型

LLM 产品的评估主要分为三个层次:单元测试、人工评估和模型评估、A/B 测试。单元测试是通过编写一些断言语句,在开发过程中快速获得反馈。人工评估和模型评估是通过人工检查和训练评估模型来评估整个系统。A/B 测试则用于确保 AI 产品能够驱动期望的用户行为或结果。除了评估整个系统,还需要对子组件如 RAG 进行单独评估。

✲ 单元测试的步骤

单元测试是 LLM 产品评估的基础,通常包括三个步骤:编写特定范围的测试、创建测试用例和定期执行测试并追踪结果。编写测试时要针对 LLM 的不同功能和场景,检验相应的断言。可以利用 LLM 自动生成测试用例,触发不同的场景。测试应当定期执行,利用 CI 基础设施可以很方便地实现自动化测试和结果跟踪。测试通过率并不一定要达到100%,而是要在错误容忍度和产品目标之间取得平衡。

✲ 人工评估和模型评估

人工评估和模型评估是更高层次的测试手段。首先要记录 LLM 系统的跟踪数据,包括用户的输入和系统的响应,为后续分析提供数据基础。在查看数据时,定制化的查看工具和良好的可视化非常重要。将人工评估结果与评估模型的预测对齐,可以极大提高评估的效率。随着评估模型性能的提升,可以渐进式地用自动评估来替代人工评估。

✲ 微调和数据合成与管理
分享几个用的较多的AI工具

1. Kimi Chat

1⃣️ 能处理超长文本的内容,上传一个文档可以自动解析并总结。
上下文理解能力很强,多轮对话也能不跑题。
可以按我的要求进行输出,比如:提炼核心要点,让它根据我上传的文档内容进行回答等。

2⃣️ 能联网搜索,用来做浏览器。自动整理总结搜索的内容。
2. 通义听悟

1⃣️ 我是专门用来生成播客文字稿。经常听到好内容的播客时间都比较长。不想再听第二遍,就生成文字稿进行学习。

2⃣️ 文字稿又可以发给AI进行整理归纳,并要求用有效的方法帮助我掌握这些知识。
3. 妙鸭相机

1⃣️ 用来生成形象照、头像
2⃣️ 可能因为我上传的图片都是原图,所以生成的照片都挺像我的,我觉得还挺好用
4. 豆包

1⃣️ 用豆包都是在做英语口语练习
2⃣️ 制作一个口语训练智能体,可以用自己的声音和照片,自己跟自己对话,感觉很奇妙
3⃣️ 也可以让喜欢的人录制一段音频,就可以用喜欢的人的声音进行对话,完美
5. 秘塔写作

1⃣️ 在写完一篇文稿后,直接丢过来让它检查校对。可以很快指出哪里有错别字,哪里语法有问题,还能提供改写
2⃣️ 比语文老师还有耐心
6. deepl 翻译

1⃣️ 都是机翻,deepl会更地道,一些不常用的本土词汇也能翻译出来
7. 智谱清言

1⃣️ 对话模式离chatgpt更近一点,完美平替
2⃣️ 可以根据不同领域自定义生成智能体。可以上传文档,根据文档内容进行对话问答
8. Suno 音乐生成

1⃣️ 根据描述可以自动生成音乐
2⃣️ 各种风格的音乐都可以生成
3⃣️ 可以自己输入歌词让它作曲和演唱
4⃣️ 也可以让它自动生成歌词

AI工具细分领域做的越好,也会更受我们喜欢吧
大而全的,都做的一般

以上这些都是我日常反复使用的工具,如果觉得还不错,记得给我一些鼓励哦~
Back to Top