关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
🎵 Text 2 music 重量级新玩家 Udio 隆重登场~
Udio 是一款用于音乐创作和共享的应用程序,通过直观、强大的文本提示功能,你可以用自己喜欢的风格创作出令人惊叹的音乐。由前 Google DeepMind 的顶尖 AI 研究人员和工程师创立。
用任何风格的富有表现力的人声让你的歌词栩栩如生。从高亢的福音到沙哑的布鲁斯,从梦幻的流行乐到柔滑的说唱,Udio 应有尽有。
探索非凡的流派和风格范围。有劲爆的 EDM、摇摆的钢琴爵士乐、温和的新灵魂乐和极端金属乐。Udio 的目标是成为音乐人和非音乐人的革命性工具,V1 模型功能强大,但并不完美。
目前 Udio 是一个免费的测试版产品, 每个人每月可以生成多达1200 首歌曲。
🔗不妨试试看:https://www.udio.com
Udio 是一款用于音乐创作和共享的应用程序,通过直观、强大的文本提示功能,你可以用自己喜欢的风格创作出令人惊叹的音乐。由前 Google DeepMind 的顶尖 AI 研究人员和工程师创立。
用任何风格的富有表现力的人声让你的歌词栩栩如生。从高亢的福音到沙哑的布鲁斯,从梦幻的流行乐到柔滑的说唱,Udio 应有尽有。
探索非凡的流派和风格范围。有劲爆的 EDM、摇摆的钢琴爵士乐、温和的新灵魂乐和极端金属乐。Udio 的目标是成为音乐人和非音乐人的革命性工具,V1 模型功能强大,但并不完美。
目前 Udio 是一个免费的测试版产品, 每个人每月可以生成多达1200 首歌曲。
🔗不妨试试看:https://www.udio.com
💰 AI 大事件:Poe 创作生态推出新商业模式——按消息数计费
创始人Adam D‘Angelo 今天宣布,从现在开始创建者(model developers & bot creators)拥有一种新的收入模式,按消息数结算。
✨ 精华要点 TLDR:
1. Poe 平台推出新的创作者盈利模式:每条消息定价。创作者和开发者可为机器人设置单条消息价格,即每次用户发消息都能获得收入。
2. Poe 预计今年将在平台分成上投入数千万美元,目标是培育一个繁荣的模型开发者和Bots创建者生态。
3. Poe 还发布了增强版分析面板,帮助创作者洞察定价对Chatbots使用和收益的影响。
🤖 官宣的主要内容:
创作者现在可以为他们的机器人设置每条消息的价格,每次用户向他们发送消息时都可以获得收入。 用户将只看到每个机器人的消息点数,使用与免费用户或订阅者相同的点数预算,但创作者将以美元获得报酬。
这种定价机制对于那些有大量模型推理或API成本的开发者来说很重要。Poe 的目标是培育一个繁荣的模型开发者和Bots创建者生态,他们在模型之上进行开发,而覆盖这些运营成本是其中的关键部分。
通过用户参与产生收入的能力还使Bots创建者能够投资创建有价值的定制知识库,并为用户提供独特的体验。今年,Poe 预计将在各类bots的支付上花费数千万美元。
Poe 平台预计在各个领域的提示和服务器机器人都会产生收益,包括辅导、知识、助手、分析、讲故事和图像生成等方面。虽然目前仅限于美国创作者,但我计划很快扩展到全球。
此外,Poe 还发布了一个增强的分析仪表板,每天更新、跟踪付费墙、订阅和消息的平均收益。这些洞察旨在帮助您更好地了解消息定价如何影响机器人的使用和收入。
每条消息的价格代表了我们创作者货币化计划的下一个阶段,也是我们实现拥有各种AI产品的繁荣经济目标的重要一步。Poe 很高兴能够支持创作者,并期待看到你构建的聊天机器人!
🔍 Hans 商业点评:
这是自定义Bots、GPTs和AI Agents 领域的一挤强心针,全新的定价模式不仅能推动Poe 生态的生长,也为各大平台带来了新玩法(特别是GPT Store 等)思路再一次被打开了。
🔗 Poe 最新官方文档: https://creator.poe.com/docs/welcome-to-poe-for-creators
创始人Adam D‘Angelo 今天宣布,从现在开始创建者(model developers & bot creators)拥有一种新的收入模式,按消息数结算。
✨ 精华要点 TLDR:
1. Poe 平台推出新的创作者盈利模式:每条消息定价。创作者和开发者可为机器人设置单条消息价格,即每次用户发消息都能获得收入。
2. Poe 预计今年将在平台分成上投入数千万美元,目标是培育一个繁荣的模型开发者和Bots创建者生态。
3. Poe 还发布了增强版分析面板,帮助创作者洞察定价对Chatbots使用和收益的影响。
🤖 官宣的主要内容:
创作者现在可以为他们的机器人设置每条消息的价格,每次用户向他们发送消息时都可以获得收入。 用户将只看到每个机器人的消息点数,使用与免费用户或订阅者相同的点数预算,但创作者将以美元获得报酬。
这种定价机制对于那些有大量模型推理或API成本的开发者来说很重要。Poe 的目标是培育一个繁荣的模型开发者和Bots创建者生态,他们在模型之上进行开发,而覆盖这些运营成本是其中的关键部分。
通过用户参与产生收入的能力还使Bots创建者能够投资创建有价值的定制知识库,并为用户提供独特的体验。今年,Poe 预计将在各类bots的支付上花费数千万美元。
Poe 平台预计在各个领域的提示和服务器机器人都会产生收益,包括辅导、知识、助手、分析、讲故事和图像生成等方面。虽然目前仅限于美国创作者,但我计划很快扩展到全球。
此外,Poe 还发布了一个增强的分析仪表板,每天更新、跟踪付费墙、订阅和消息的平均收益。这些洞察旨在帮助您更好地了解消息定价如何影响机器人的使用和收入。
每条消息的价格代表了我们创作者货币化计划的下一个阶段,也是我们实现拥有各种AI产品的繁荣经济目标的重要一步。Poe 很高兴能够支持创作者,并期待看到你构建的聊天机器人!
🔍 Hans 商业点评:
这是自定义Bots、GPTs和AI Agents 领域的一挤强心针,全新的定价模式不仅能推动Poe 生态的生长,也为各大平台带来了新玩法(特别是GPT Store 等)思路再一次被打开了。
🔗 Poe 最新官方文档: https://creator.poe.com/docs/welcome-to-poe-for-creators
现阶段用 LLM 做 RPA 有一个问题,LLM 通常会压缩图片分辨率,导致在UI界面理解上经常识别不准,也无法正确提取文字,识别UI元素。
看起来 Apple 对这个场景做了针对性的调整,有一个放大系统,可以将图像放大到“任何分辨率”,使图标和文本更具可读性。
可能代表着苹果在往 RPA 方向尝试。
本着“不看广告看疗效”的态度,调研了一圈两者在商业公司的落地情况,发现还是后者更加靠谱,更加适合我。
吴恩达老师的“GPT-4+agent>GPT-5”的判断,个人是比较认同和深有感触的。
吴恩达老师在演讲中还提到agent的 4 大设计模式,并推荐了10篇相关的论文,我打算今天就开始啃起来:
1、Reflection
https://arxiv.org/pdf/2303.17651.pdf
https://arxiv.org/pdf/2303.11366.pdf
https://arxiv.org/pdf/2305.11738.pdf
2、Tool Use
https://arxiv.org/pdf/2305.15334.pdf
https://arxiv.org/pdf/2303.11381.pdf
https://arxiv.org/pdf/2401.17464.pdf
3、Planning
https://arxiv.org/pdf/2201.11903.pdf
https://arxiv.org/pdf/2303.17580.pdf
4、Multi-agent collaboration
https://arxiv.org/pdf/2307.07924.pdf
https://arxiv.org/pdf/2308.08155.pdf
模型能够生成与视觉组件相关的详细讨论,并提出以特定目标为导向的行动计划。
此外,Ferret-UI还能够通过功能推断来解释屏幕的整体目的,显示出在理解和生成自然语言指令方面的高级能力。
论文地址:https://arxiv.org/abs/2404.05719
此外,Ferret-UI还能够通过功能推断来解释屏幕的整体目的,显示出在理解和生成自然语言指令方面的高级能力。
论文地址:https://arxiv.org/abs/2404.05719
专门针对移动UI屏幕进行了优化,具备了指向、定位和推理等多种能力。
看来 iOS 18 有可能会有类似通过Siri自动操作应用界面的能力?
---------详细介绍---------
Ferret-UI模型的介绍与特点:
Ferret-UI是一个新的MLLM,专门为提高对移动UI屏幕的理解而设计。它具备引用、定位和推理能力,
能够处理UI屏幕上的各种任务。Ferret-UI的一个关键特点是其“任何分辨率”(any resolution)技术,该技术通过放大细节来解决UI屏幕中小型对象的识别问题,从而提高模型对UI元素的理解精度。
移动用户界面(UI)屏幕的理解:
UI屏幕的理解是一个复杂的问题,因为它不仅要求模型能够理解屏幕上的内容,还要能够识别和操作具体的UI元素。
与传统的自然图像相比,UI屏幕通常具有更多的长宽比和更小的元素,这些元素对于模型来说是一个挑战。此外,UI屏幕的理解还涉及到对屏幕元素间关系的识别,以及对用户可能采取的行动的预测。
“任何分辨率”(any resolution)技术的应用:
为了克服UI屏幕中的小对象识别问题,Ferret-UI采用了“任何分辨率”技术。该技术通过将屏幕分割成基于原始宽高比的子图像,并对每个子图像进行单独编码,从而在不丢失重要视觉信号的情况下放大细节。
这种方法使得模型能够更准确地识别和理解UI屏幕上的小型对象。
训练样本的收集与任务制定:
Ferret-UI的训练涉及从基础UI任务到高级任务的广泛数据样本收集。这些样本被格式化为带有区域注释的指令遵循格式,以便于模型进行精确的引用和定位。
此外,为了提高模型的推理能力,还特别编制了一个包含详细描述、感知/交互对话和功能推断等高级任务的数据集。
模型架构与数据集的建立:
Ferret-UI的架构基于Ferret模型,后者在自然图像的引用和定位任务中表现出色。为了适应UI屏幕的特点,Ferret-UI进行了架构调整,包括集成“任何分辨率”技术和使用预定义的网格配置来划分全图图像。
此外,为了全面评估模型的能力,还建立了一个包含所有研究任务的综合测试基准。
高级任务中的对话能力:
Ferret-UI在高级任务中的对话能力表现突出,尤其是在详细描述和交互对话任务中。
大牛新作
完全开源的类 pplx 搜索引擎项目。
图片、来源、回答结构都跟 pplx 非常相似。
支持一键部署到 vercel。
项目地址 https://github.com/miurla/morphic?tab=readme-ov-file
完全开源的类 pplx 搜索引擎项目。
图片、来源、回答结构都跟 pplx 非常相似。
支持一键部署到 vercel。
项目地址 https://github.com/miurla/morphic?tab=readme-ov-file