关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
这事有点太好笑了🤣
早上醒来朋友说有一个公众号发了我和泛函的一个介绍文章,我一看,咋名字,logo,slogan都和我的播客 抄就完了 像素级相似,真的就是抄就完了🤣抄就完了被抄了
💰 AI 大事件:Poe 创作生态推出新商业模式——按消息数计费

创始人Adam D‘Angelo 今天宣布,从现在开始创建者(model developers & bot creators)拥有一种新的收入模式,按消息数结算。

精华要点 TLDR:

1. Poe 平台推出新的创作者盈利模式:每条消息定价。创作者和开发者可为机器人设置单条消息价格,即每次用户发消息都能获得收入。
2. Poe 预计今年将在平台分成上投入数千万美元,目标是培育一个繁荣的模型开发者和Bots创建者生态。
3. Poe 还发布了增强版分析面板,帮助创作者洞察定价对Chatbots使用和收益的影响。

🤖 官宣的主要内容:

创作者现在可以为他们的机器人设置每条消息的价格,每次用户向他们发送消息时都可以获得收入。 用户将只看到每个机器人的消息点数,使用与免费用户或订阅者相同的点数预算,但创作者将以美元获得报酬。

这种定价机制对于那些有大量模型推理或API成本的开发者来说很重要。Poe 的目标是培育一个繁荣的模型开发者和Bots创建者生态,他们在模型之上进行开发,而覆盖这些运营成本是其中的关键部分。

通过用户参与产生收入的能力还使Bots创建者能够投资创建有价值的定制知识库,并为用户提供独特的体验。今年,Poe 预计将在各类bots的支付上花费数千万美元。

Poe 平台预计在各个领域的提示和服务器机器人都会产生收益,包括辅导、知识、助手、分析、讲故事和图像生成等方面。虽然目前仅限于美国创作者,但我计划很快扩展到全球。

此外,Poe 还发布了一个增强的分析仪表板,每天更新、跟踪付费墙、订阅和消息的平均收益。这些洞察旨在帮助您更好地了解消息定价如何影响机器人的使用和收入。

每条消息的价格代表了我们创作者货币化计划的下一个阶段,也是我们实现拥有各种AI产品的繁荣经济目标的重要一步。Poe 很高兴能够支持创作者,并期待看到你构建的聊天机器人!

🔍 Hans 商业点评:

这是自定义Bots、GPTs和AI Agents 领域的一挤强心针,全新的定价模式不仅能推动Poe 生态的生长,也为各大平台带来了新玩法(特别是GPT Store 等)思路再一次被打开了。

🔗 Poe 最新官方文档: https://creator.poe.com/docs/welcome-to-poe-for-creators
Apple 推出了 Ferret-UI,帮助 Siri 理解手机界面。
现阶段用 LLM 做 RPA 有一个问题,LLM 通常会压缩图片分辨率,导致在UI界面理解上经常识别不准,也无法正确提取文字,识别UI元素。
看起来 Apple 对这个场景做了针对性的调整,有一个放大系统,可以将图像放大到“任何分辨率”,使图标和文本更具可读性。

可能代表着苹果在往 RPA 方向尝试。
最近有点纠结,究竟是开始上手AI视频,还是深入研究些 agent。

本着“不看广告看疗效”的态度,调研了一圈两者在商业公司的落地情况,发现还是后者更加靠谱,更加适合我。

吴恩达老师的“GPT-4+agent>GPT-5”的判断,个人是比较认同和深有感触的。

吴恩达老师在演讲中还提到agent的 4 大设计模式,并推荐了10篇相关的论文,我打算今天就开始啃起来:

1、Reflection
https://arxiv.org/pdf/2303.17651.pdf
https://arxiv.org/pdf/2303.11366.pdf
https://arxiv.org/pdf/2305.11738.pdf

2、Tool Use
https://arxiv.org/pdf/2305.15334.pdf
https://arxiv.org/pdf/2303.11381.pdf
https://arxiv.org/pdf/2401.17464.pdf

3、Planning
https://arxiv.org/pdf/2201.11903.pdf
https://arxiv.org/pdf/2303.17580.pdf

4、Multi-agent collaboration
https://arxiv.org/pdf/2307.07924.pdf
https://arxiv.org/pdf/2308.08155.pdf
苹果发布了专门用于理解应用 UI 界面的 MLLLM Ferret-UI 。

专门针对移动UI屏幕进行了优化,具备了指向、定位和推理等多种能力。

看来 iOS 18 有可能会有类似通过Siri自动操作应用界面的能力?

---------详细介绍---------

Ferret-UI模型的介绍与特点:

Ferret-UI是一个新的MLLM,专门为提高对移动UI屏幕的理解而设计。它具备引用、定位和推理能力,

能够处理UI屏幕上的各种任务。Ferret-UI的一个关键特点是其“任何分辨率”(any resolution)技术,该技术通过放大细节来解决UI屏幕中小型对象的识别问题,从而提高模型对UI元素的理解精度。

移动用户界面(UI)屏幕的理解:

UI屏幕的理解是一个复杂的问题,因为它不仅要求模型能够理解屏幕上的内容,还要能够识别和操作具体的UI元素。

与传统的自然图像相比,UI屏幕通常具有更多的长宽比和更小的元素,这些元素对于模型来说是一个挑战。此外,UI屏幕的理解还涉及到对屏幕元素间关系的识别,以及对用户可能采取的行动的预测。

“任何分辨率”(any resolution)技术的应用:

为了克服UI屏幕中的小对象识别问题,Ferret-UI采用了“任何分辨率”技术。该技术通过将屏幕分割成基于原始宽高比的子图像,并对每个子图像进行单独编码,从而在不丢失重要视觉信号的情况下放大细节。

这种方法使得模型能够更准确地识别和理解UI屏幕上的小型对象。

训练样本的收集与任务制定:

Ferret-UI的训练涉及从基础UI任务到高级任务的广泛数据样本收集。这些样本被格式化为带有区域注释的指令遵循格式,以便于模型进行精确的引用和定位。

此外,为了提高模型的推理能力,还特别编制了一个包含详细描述、感知/交互对话和功能推断等高级任务的数据集。

模型架构与数据集的建立:

Ferret-UI的架构基于Ferret模型,后者在自然图像的引用和定位任务中表现出色。为了适应UI屏幕的特点,Ferret-UI进行了架构调整,包括集成“任何分辨率”技术和使用预定义的网格配置来划分全图图像。

此外,为了全面评估模型的能力,还建立了一个包含所有研究任务的综合测试基准。

高级任务中的对话能力:

Ferret-UI在高级任务中的对话能力表现突出,尤其是在详细描述和交互对话任务中。
大牛新作
完全开源的类 pplx 搜索引擎项目。
图片、来源、回答结构都跟 pplx 非常相似。
支持一键部署到 vercel。
项目地址 https://github.com/miurla/morphic?tab=readme-ov-file
最近和几个朋友聊天记录:
1. 我问他是怎么建Prompt的验收标准的:准备好Query,归纳抽象理想回答的几条Principle,找一个更聪明的大模型基于这个Principle来给Prompt的结果打分,每次上线前跑1000条。
感觉挺make sense,想测试一下。

2.perplexity怎么解决搜索引擎响应速度的问题:去年8月份就宣布基于3.5版本的微调模型已经比GPT4快且效果好,且自研了推理堆栈(pplx-api),能大幅度提升响应速度。微调没那么难搞,只要场景垂数据集质量高,一周左右。

3.在厂里的朋友说在搞低代码搭建Agent,面向B端,找不到太落地的具体场景,还要搞权限数据集多环境版本,由于B端业务逻辑比较复杂,要依赖现有GUI,要跳卡片或者跳页面,比C端难做太多了。
早上好,继续发福利,今年生财拉新,现在可以免费加入生财有术围观群,可以免费白嫖三天生财有术,速进,满200就进不来啦。

生财有术是什么?这是一个致力于帮助普通人建立和扩大生意的付费社群,目前已有57000+会员加入。

如果你想要赚钱情报、扩大圈层、持续实战、高手案例,都可以在这里找到对标,不管你是小白还是高手,这里都有你的搞钱机会。

第8期生财有术启动,快来参与搞钱,一起生财有术。
福利及群二维码点击 https://t.me/text1024/8767
关于生财有术的介绍 https://t.me/text1024/8812
生财第七期视频集锦 https://t.me/text1024/8726
第八期视频预告 https://t.me/text1024/8824
其实蔚来的nomi一直是我喜欢蔚来很有意思的地方,直到今天我看到了一个叫Looi的桌面机器人,这才是AI实体应该做的产品,有灵魂有意思有温度有情感。
这个可能比较重要,北大发布一个新的图像生成框架VAR。

VAR首次使GPT风格的AR模型在图像生成上超越了Diffusion transformer。

同时展现出了与大语言模型观察到的类似Scaling laws的规律。

在ImageNet 256x256基准上,VAR将FID从18.65大幅提升到1.80,IS从80.4提升到356.4,推理速度提高了20倍。

详细介绍:

视觉自回归模型(VAR)是一种新的图像生成范式,它将自回归学习重新定义为从粗到细的"下一尺度预测"或"下一分辨率预测",有别于标准的光栅扫描"下一token预测"。

这种简单直观的方法让自回归transformer能够快速学习视觉分布并具有良好的泛化能力:

VAR首次使GPT风格的AR模型在图像生成上超越了扩散transformer。

在ImageNet 256x256基准上,VAR将FID从18.65大幅提升到1.80,IS从80.4提升到356.4,推理速度提高了20倍。

实证验证了VAR在多个维度包括图像质量、推理速度、数据效率和可扩展性上都优于Diffusion Transformer。

随着VAR模型的扩大,它展现出了与大语言模型观察到的类似幂律缩放规律,线性相关系数接近-0.998,有力证明了这一点。

VAR进一步展示了在下游任务如图像修复、外推和编辑上的零样本泛化能力。

这些结果表明,VAR初步模拟了大语言模型的两个重要特性:缩放规律和零样本泛化。

研究人员已经公开了所有模型和代码,以促进AR/VAR模型在视觉生成和统一学习中的探索。

VAR算法为计算机视觉中的自回归算法设计提供了新的见解,有望推动这一领域的进一步发展。

项目地址:https://github.com/FoundationVision/VAR
Demo 地址,生成速度真的非常快:https://var.vision/demo
模型下载:https://huggingface.co/FoundationVision/var/tree/main
很有意思的一个研究,让 LLM 帮助培训社交沟通技能,确实有很多人需要这样的服务,LLM 又擅长这个。

通过一个通用框架,利用大语言模型(LLM)进行社交技能训练。“AI伙伴,AI导师”框架将实际体验学习与真实场景练习和个性化反馈相结合。

详细介绍:

使用大语言模型进行社交技能训练的提议:

研究者提出,可以利用大语言模型强大的对话生成能力,为社交技能练习提供一个随时可用、安全可控的环境。相关研究已经证实,当前的大语言模型已经能够较好地模拟各类人物,进行逼真的对话互动。这为将其应用于社交技能训练奠定了基础。

AI Partner和AI Mentor框架的提出:

论文提出了一个通用的社交技能训练框架,包括两个关键组件:AI Partner负责提供对话实践的环境,AI Mentor负责在关键节点给予个性化指导。二者协同,可以把体验式的实践学习与理论指导有机结合,有望大幅提升社交技能训练的可及性和有效性。

使用该框架进行社交技能训练的应用场景

该框架可以灵活应用于多个领域的社交技能训练,如心理咨询、谈判、教学等。通过调整AI Partner塑造的人物角色,以及AI Mentor搭载的领域知识库,就可以对应不同领域的训练需求。论文通过一系列案例展示了这种适用性和灵活性。

论文地址:https://arxiv.org/abs/2404.04204
Back to Top