关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
Meta 上周开源了一个端到端的语音模型 Spirit LM。
这个太重要了,居然没注意到。
这个模型有两个版本:
基础版: 适合进行一般的语音识别和生成,不包含情感变化。
高表现力版:可以捕捉语音中的情感特征,能够生成包含快乐、愤怒或兴奋等情感的语音。
主要特点有:
Spirit LM 直接使用语音标记、音高标记和声调标记 来保留语音中的表现力要素,不需要先转文本描述。
能够在不需要大量数据的情况下,完成自动语音识别、文本转语音和语音分类等复杂任务。
项目地址:speechbot.github.io/spiritlm/
论文:arxiv.org/pdf/2402.05755
这个太重要了,居然没注意到。
这个模型有两个版本:
基础版: 适合进行一般的语音识别和生成,不包含情感变化。
高表现力版:可以捕捉语音中的情感特征,能够生成包含快乐、愤怒或兴奋等情感的语音。
主要特点有:
Spirit LM 直接使用语音标记、音高标记和声调标记 来保留语音中的表现力要素,不需要先转文本描述。
能够在不需要大量数据的情况下,完成自动语音识别、文本转语音和语音分类等复杂任务。
项目地址:speechbot.github.io/spiritlm/
论文:arxiv.org/pdf/2402.05755
Ideogram 终于做了一个发挥他们模型能力的功能 Ideogram Canvas。
可以在无限画布上对生成的图片进行编辑,比如扩图、局部重绘,以及最基本的生成功能。
我提前几天体验了一下,发现真的很适合用来做海报之类的运营设计。
因为Ideogram新模型的排版和文字能力真的很好,比如我之前说可以用来设计网页。
但是由于长宽比的问题,没办法完成一整个网页,现在没问题了,哈哈。
可以在无限画布上对生成的图片进行编辑,比如扩图、局部重绘,以及最基本的生成功能。
我提前几天体验了一下,发现真的很适合用来做海报之类的运营设计。
因为Ideogram新模型的排版和文字能力真的很好,比如我之前说可以用来设计网页。
但是由于长宽比的问题,没办法完成一整个网页,现在没问题了,哈哈。
大的来了!
Claude 3.5 Haiku 和升级款的 Claude 3.5 Sonnet 也来了,Claude 3.5 Sonnet 推理得分超过O1。
而且 Claude 现在支持像人类一样操作计算机,通过查看屏幕、移动光标、单击按钮和键入文本。
升级 Claude 3.5 Sonnet 现在开放。computer use测试版也开放使用。
新版Claude 3.5 Sonnet介绍:
更新后的Claude 3.5 Sonnet在行业基准上显示出广泛的改进,尤其是在代理编码和工具使用任务方面取得了显着的进步。
它在SWE-bench Verified上的性能从 33.4% 提高到 49.0%,得分高于所有公开可用的模型,包括 OpenAI o1-preview 等推理模型和专为代理编码设计的专用系统。
它还将在代理工具使用任务TAU-bench上的表现提高,零售领域从 62.6%提高到 69.2%,在更具挑战性的航空领域从 36.0%提高到 46.0%。
早期客户反馈表明,升级后的 Claude 3.5 Sonnet 代表了 AI 编码的重大飞跃。GitLab 为 DevSecOps 任务测试了该模型,发现它在没有增加延迟的情况下提供了更强的推理能力(在各种用例中高达 10%)。
Claude 3.5 Haiku介绍:
Claude 3.5 Haiku 在各项技能上都有所提高,甚至在许多智能基准上超过了上一代最大的模型 Claude 3 Opus。
Claude 3.5 Haiku 具有低延迟、改进的指令遵循和更准确的工具使用能力。
Haiku 在编码任务上尤其强大。例如,它在 SWE-bench Verified 上得分为 40.6%,优于许多使用公开可用的最先进模型(包括原始的 Claude 3.5 Sonnet 和 GPT-4o)的代理。
教Claude使用计算机
为了使这些通用技能成为可能,构建了一个 API,使 Claude 能够感知计算机界面并与之交互。
开发人员可以集成此 API,使 Claude 能够将指令(例如,“使用我的计算机上的数据并在线填写此表格”)翻译成计算机命令(例如,检查电子表格;移动光标打开 Web 浏览器;导航到相关网页;使用这些网页中的数据填写表格;等等)。
在评估人工智能模型像人一样使用计算机的能力的OSWorld上。
Claude 3.5 Sonnet 在仅屏幕截图类别中得分为 14.9%,明显优于第二好的人工智能系统 7.8% 的得分。
当提供更多步骤来完成任务时,克劳德得分为 22.0%。
官方公告:www.anthropic.com/news/3-5-models-and-computer-use
Invalid media: video
Claude 3.5 Haiku 和升级款的 Claude 3.5 Sonnet 也来了,Claude 3.5 Sonnet 推理得分超过O1。
而且 Claude 现在支持像人类一样操作计算机,通过查看屏幕、移动光标、单击按钮和键入文本。
升级 Claude 3.5 Sonnet 现在开放。computer use测试版也开放使用。
新版Claude 3.5 Sonnet介绍:
更新后的Claude 3.5 Sonnet在行业基准上显示出广泛的改进,尤其是在代理编码和工具使用任务方面取得了显着的进步。
它在SWE-bench Verified上的性能从 33.4% 提高到 49.0%,得分高于所有公开可用的模型,包括 OpenAI o1-preview 等推理模型和专为代理编码设计的专用系统。
它还将在代理工具使用任务TAU-bench上的表现提高,零售领域从 62.6%提高到 69.2%,在更具挑战性的航空领域从 36.0%提高到 46.0%。
早期客户反馈表明,升级后的 Claude 3.5 Sonnet 代表了 AI 编码的重大飞跃。GitLab 为 DevSecOps 任务测试了该模型,发现它在没有增加延迟的情况下提供了更强的推理能力(在各种用例中高达 10%)。
Claude 3.5 Haiku介绍:
Claude 3.5 Haiku 在各项技能上都有所提高,甚至在许多智能基准上超过了上一代最大的模型 Claude 3 Opus。
Claude 3.5 Haiku 具有低延迟、改进的指令遵循和更准确的工具使用能力。
Haiku 在编码任务上尤其强大。例如,它在 SWE-bench Verified 上得分为 40.6%,优于许多使用公开可用的最先进模型(包括原始的 Claude 3.5 Sonnet 和 GPT-4o)的代理。
教Claude使用计算机
为了使这些通用技能成为可能,构建了一个 API,使 Claude 能够感知计算机界面并与之交互。
开发人员可以集成此 API,使 Claude 能够将指令(例如,“使用我的计算机上的数据并在线填写此表格”)翻译成计算机命令(例如,检查电子表格;移动光标打开 Web 浏览器;导航到相关网页;使用这些网页中的数据填写表格;等等)。
在评估人工智能模型像人一样使用计算机的能力的OSWorld上。
Claude 3.5 Sonnet 在仅屏幕截图类别中得分为 14.9%,明显优于第二好的人工智能系统 7.8% 的得分。
当提供更多步骤来完成任务时,克劳德得分为 22.0%。
官方公告:www.anthropic.com/news/3-5-models-and-computer-use
Invalid media: video
最近发了些做Cursor的视频后,一些小企业负责人就长上门非要我帮忙开发产品,功能其实都挺简单,但是因为涉及AI应用落地,他们自己的开发都不太有对应经验。报了大五位数的客单价也没劝退,就当练练手去做了。
带着实际需求去做东西还挺有趣的。就是中间为了让他们的钱显得花得值,5分钟改完的功能还要特意等第二天再发过去。
带着实际需求去做东西还挺有趣的。就是中间为了让他们的钱显得花得值,5分钟改完的功能还要特意等第二天再发过去。