关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
这一段读出来真的 请gpt跨越次元找到真身来迎娶我
学习笔记:关于 AI 在心理咨询领域的应用 – 虹线

如果你还在寻找 AI 合规且 PMF 的场景,我会说 AI 心理咨询是其中一个,而且是普通个人就可以做的。
这事有点太好笑了🤣
早上醒来朋友说有一个公众号发了我和泛函的一个介绍文章,我一看,咋名字,logo,slogan都和我的播客 抄就完了 像素级相似,真的就是抄就完了🤣抄就完了被抄了
💰 AI 大事件:Poe 创作生态推出新商业模式——按消息数计费

创始人Adam D‘Angelo 今天宣布,从现在开始创建者(model developers & bot creators)拥有一种新的收入模式,按消息数结算。

精华要点 TLDR:

1. Poe 平台推出新的创作者盈利模式:每条消息定价。创作者和开发者可为机器人设置单条消息价格,即每次用户发消息都能获得收入。
2. Poe 预计今年将在平台分成上投入数千万美元,目标是培育一个繁荣的模型开发者和Bots创建者生态。
3. Poe 还发布了增强版分析面板,帮助创作者洞察定价对Chatbots使用和收益的影响。

🤖 官宣的主要内容:

创作者现在可以为他们的机器人设置每条消息的价格,每次用户向他们发送消息时都可以获得收入。 用户将只看到每个机器人的消息点数,使用与免费用户或订阅者相同的点数预算,但创作者将以美元获得报酬。

这种定价机制对于那些有大量模型推理或API成本的开发者来说很重要。Poe 的目标是培育一个繁荣的模型开发者和Bots创建者生态,他们在模型之上进行开发,而覆盖这些运营成本是其中的关键部分。

通过用户参与产生收入的能力还使Bots创建者能够投资创建有价值的定制知识库,并为用户提供独特的体验。今年,Poe 预计将在各类bots的支付上花费数千万美元。

Poe 平台预计在各个领域的提示和服务器机器人都会产生收益,包括辅导、知识、助手、分析、讲故事和图像生成等方面。虽然目前仅限于美国创作者,但我计划很快扩展到全球。

此外,Poe 还发布了一个增强的分析仪表板,每天更新、跟踪付费墙、订阅和消息的平均收益。这些洞察旨在帮助您更好地了解消息定价如何影响机器人的使用和收入。

每条消息的价格代表了我们创作者货币化计划的下一个阶段,也是我们实现拥有各种AI产品的繁荣经济目标的重要一步。Poe 很高兴能够支持创作者,并期待看到你构建的聊天机器人!

🔍 Hans 商业点评:

这是自定义Bots、GPTs和AI Agents 领域的一挤强心针,全新的定价模式不仅能推动Poe 生态的生长,也为各大平台带来了新玩法(特别是GPT Store 等)思路再一次被打开了。

🔗 Poe 最新官方文档: https://creator.poe.com/docs/welcome-to-poe-for-creators
Apple 推出了 Ferret-UI,帮助 Siri 理解手机界面。
现阶段用 LLM 做 RPA 有一个问题,LLM 通常会压缩图片分辨率,导致在UI界面理解上经常识别不准,也无法正确提取文字,识别UI元素。
看起来 Apple 对这个场景做了针对性的调整,有一个放大系统,可以将图像放大到“任何分辨率”,使图标和文本更具可读性。

可能代表着苹果在往 RPA 方向尝试。
最近有点纠结,究竟是开始上手AI视频,还是深入研究些 agent。

本着“不看广告看疗效”的态度,调研了一圈两者在商业公司的落地情况,发现还是后者更加靠谱,更加适合我。

吴恩达老师的“GPT-4+agent>GPT-5”的判断,个人是比较认同和深有感触的。

吴恩达老师在演讲中还提到agent的 4 大设计模式,并推荐了10篇相关的论文,我打算今天就开始啃起来:

1、Reflection
https://arxiv.org/pdf/2303.17651.pdf
https://arxiv.org/pdf/2303.11366.pdf
https://arxiv.org/pdf/2305.11738.pdf

2、Tool Use
https://arxiv.org/pdf/2305.15334.pdf
https://arxiv.org/pdf/2303.11381.pdf
https://arxiv.org/pdf/2401.17464.pdf

3、Planning
https://arxiv.org/pdf/2201.11903.pdf
https://arxiv.org/pdf/2303.17580.pdf

4、Multi-agent collaboration
https://arxiv.org/pdf/2307.07924.pdf
https://arxiv.org/pdf/2308.08155.pdf
苹果发布了专门用于理解应用 UI 界面的 MLLLM Ferret-UI 。

专门针对移动UI屏幕进行了优化,具备了指向、定位和推理等多种能力。

看来 iOS 18 有可能会有类似通过Siri自动操作应用界面的能力?

---------详细介绍---------

Ferret-UI模型的介绍与特点:

Ferret-UI是一个新的MLLM,专门为提高对移动UI屏幕的理解而设计。它具备引用、定位和推理能力,

能够处理UI屏幕上的各种任务。Ferret-UI的一个关键特点是其“任何分辨率”(any resolution)技术,该技术通过放大细节来解决UI屏幕中小型对象的识别问题,从而提高模型对UI元素的理解精度。

移动用户界面(UI)屏幕的理解:

UI屏幕的理解是一个复杂的问题,因为它不仅要求模型能够理解屏幕上的内容,还要能够识别和操作具体的UI元素。

与传统的自然图像相比,UI屏幕通常具有更多的长宽比和更小的元素,这些元素对于模型来说是一个挑战。此外,UI屏幕的理解还涉及到对屏幕元素间关系的识别,以及对用户可能采取的行动的预测。

“任何分辨率”(any resolution)技术的应用:

为了克服UI屏幕中的小对象识别问题,Ferret-UI采用了“任何分辨率”技术。该技术通过将屏幕分割成基于原始宽高比的子图像,并对每个子图像进行单独编码,从而在不丢失重要视觉信号的情况下放大细节。

这种方法使得模型能够更准确地识别和理解UI屏幕上的小型对象。

训练样本的收集与任务制定:

Ferret-UI的训练涉及从基础UI任务到高级任务的广泛数据样本收集。这些样本被格式化为带有区域注释的指令遵循格式,以便于模型进行精确的引用和定位。

此外,为了提高模型的推理能力,还特别编制了一个包含详细描述、感知/交互对话和功能推断等高级任务的数据集。

模型架构与数据集的建立:

Ferret-UI的架构基于Ferret模型,后者在自然图像的引用和定位任务中表现出色。为了适应UI屏幕的特点,Ferret-UI进行了架构调整,包括集成“任何分辨率”技术和使用预定义的网格配置来划分全图图像。

此外,为了全面评估模型的能力,还建立了一个包含所有研究任务的综合测试基准。

高级任务中的对话能力:

Ferret-UI在高级任务中的对话能力表现突出,尤其是在详细描述和交互对话任务中。
大牛新作
完全开源的类 pplx 搜索引擎项目。
图片、来源、回答结构都跟 pplx 非常相似。
支持一键部署到 vercel。
项目地址 https://github.com/miurla/morphic?tab=readme-ov-file
最近和几个朋友聊天记录:
1. 我问他是怎么建Prompt的验收标准的:准备好Query,归纳抽象理想回答的几条Principle,找一个更聪明的大模型基于这个Principle来给Prompt的结果打分,每次上线前跑1000条。
感觉挺make sense,想测试一下。

2.perplexity怎么解决搜索引擎响应速度的问题:去年8月份就宣布基于3.5版本的微调模型已经比GPT4快且效果好,且自研了推理堆栈(pplx-api),能大幅度提升响应速度。微调没那么难搞,只要场景垂数据集质量高,一周左右。

3.在厂里的朋友说在搞低代码搭建Agent,面向B端,找不到太落地的具体场景,还要搞权限数据集多环境版本,由于B端业务逻辑比较复杂,要依赖现有GUI,要跳卡片或者跳页面,比C端难做太多了。
早上好,继续发福利,今年生财拉新,现在可以免费加入生财有术围观群,可以免费白嫖三天生财有术,速进,满200就进不来啦。

生财有术是什么?这是一个致力于帮助普通人建立和扩大生意的付费社群,目前已有57000+会员加入。

如果你想要赚钱情报、扩大圈层、持续实战、高手案例,都可以在这里找到对标,不管你是小白还是高手,这里都有你的搞钱机会。

第8期生财有术启动,快来参与搞钱,一起生财有术。
福利及群二维码点击 https://t.me/text1024/8767
关于生财有术的介绍 https://t.me/text1024/8812
生财第七期视频集锦 https://t.me/text1024/8726
第八期视频预告 https://t.me/text1024/8824
其实蔚来的nomi一直是我喜欢蔚来很有意思的地方,直到今天我看到了一个叫Looi的桌面机器人,这才是AI实体应该做的产品,有灵魂有意思有温度有情感。
Back to Top