关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
很久之前我就说过,用户的需求从来就不是写 prompt 指挥 AI
而是直接说需求「做个抖音出来」
这就是技术和用户之间巨大的 Gap
但是,就在刚刚...
我打开 bolt new,让它做一个抖音出来
它真的做了一个抖音出来...
😲
来看看这段录屏吧
Invalid media: video
而是直接说需求「做个抖音出来」
这就是技术和用户之间巨大的 Gap
但是,就在刚刚...
我打开 bolt new,让它做一个抖音出来
它真的做了一个抖音出来...
😲
来看看这段录屏吧
Invalid media: video
Every 专栏作者Rhea Purohit 这篇《你可能用错了人工智能》极具洞察。和她一样,很多人没有找到正确打开AI的方式,更不用说拥有持续的好奇心和融入日常的工作和生活。
作为一个AI 布道者,Hans 也曾多次分享, 不要仅将AI作为效率工具,而是深入你日常创造的伙伴。 而Rhea 说的更好,她建议要让AI服务于你的意义。
这并不抽象。
如果你在真正的写作,会意识到你不需要AI 那些无意义的观点和文本;你需要它激发出来具有共鸣的内容。因为只有你持续为自己而写,智慧才会涌现。
如果你在创造产品,会意识到你必须自己先有洞察和思考;然后Claude和GPT的深度对话才开始具有商业价值;那个初心,AI 难以赠送给你。
更广泛地学习和研究也是一样:无论Notebook LM和Perplexity 多么强大,如果你没有一个真正的项目,它们的持续升级对你毫无意义。
这就是这篇文章的精彩指向。
https://every.to/learning-curve/you-re-probably-using-ai-wrong
Rhea 用自己作为作家的故事,找到这一深刻的领悟。它将启发更多人重新审视AI和自己的关系。 Enjoy~
AI 神器推荐!自动分离人声与 BGM 音频 - 小红书
😍【AI 神器推荐—aifuse】之前刷短视频时,不时会发现自己喜欢的音频,但音频里时常又夹杂了很多人声,正好最近发现一个挺好用的 AI 工具,可以完美分离人声和音频,推荐给大家:https://www.aifuse.cn/
#AI的神奇用法
Invalid media: image
😍【AI 神器推荐—aifuse】之前刷短视频时,不时会发现自己喜欢的音频,但音频里时常又夹杂了很多人声,正好最近发现一个挺好用的 AI 工具,可以完美分离人声和音频,推荐给大家:https://www.aifuse.cn/
#AI的神奇用法
Invalid media: image
腾讯新出的这个 ima AI 知识库感觉有点上道了。
结合笔记软件和 AI 搜索,可以直接将搜索内容加入知识库和笔记列表。
写笔记的时候可以使用 AI 扩写和编辑笔记内容。
软件设计的一些小细节也很有意思,比如输入框有内容的时候熊猫会看向右边。
如果他要是再有一个浏览器插件的话我真会用,而且他现在可以总结非国内网页。
Invalid media: video
结合笔记软件和 AI 搜索,可以直接将搜索内容加入知识库和笔记列表。
写笔记的时候可以使用 AI 扩写和编辑笔记内容。
软件设计的一些小细节也很有意思,比如输入框有内容的时候熊猫会看向右边。
如果他要是再有一个浏览器插件的话我真会用,而且他现在可以总结非国内网页。
Invalid media: video
https://www.producthunt.com/posts/podlm
Meta 上周开源了一个端到端的语音模型 Spirit LM。
这个太重要了,居然没注意到。
这个模型有两个版本:
基础版: 适合进行一般的语音识别和生成,不包含情感变化。
高表现力版:可以捕捉语音中的情感特征,能够生成包含快乐、愤怒或兴奋等情感的语音。
主要特点有:
Spirit LM 直接使用语音标记、音高标记和声调标记 来保留语音中的表现力要素,不需要先转文本描述。
能够在不需要大量数据的情况下,完成自动语音识别、文本转语音和语音分类等复杂任务。
项目地址:speechbot.github.io/spiritlm/
论文:arxiv.org/pdf/2402.05755
这个太重要了,居然没注意到。
这个模型有两个版本:
基础版: 适合进行一般的语音识别和生成,不包含情感变化。
高表现力版:可以捕捉语音中的情感特征,能够生成包含快乐、愤怒或兴奋等情感的语音。
主要特点有:
Spirit LM 直接使用语音标记、音高标记和声调标记 来保留语音中的表现力要素,不需要先转文本描述。
能够在不需要大量数据的情况下,完成自动语音识别、文本转语音和语音分类等复杂任务。
项目地址:speechbot.github.io/spiritlm/
论文:arxiv.org/pdf/2402.05755
Ideogram 终于做了一个发挥他们模型能力的功能 Ideogram Canvas。
可以在无限画布上对生成的图片进行编辑,比如扩图、局部重绘,以及最基本的生成功能。
我提前几天体验了一下,发现真的很适合用来做海报之类的运营设计。
因为Ideogram新模型的排版和文字能力真的很好,比如我之前说可以用来设计网页。
但是由于长宽比的问题,没办法完成一整个网页,现在没问题了,哈哈。
可以在无限画布上对生成的图片进行编辑,比如扩图、局部重绘,以及最基本的生成功能。
我提前几天体验了一下,发现真的很适合用来做海报之类的运营设计。
因为Ideogram新模型的排版和文字能力真的很好,比如我之前说可以用来设计网页。
但是由于长宽比的问题,没办法完成一整个网页,现在没问题了,哈哈。
大的来了!
Claude 3.5 Haiku 和升级款的 Claude 3.5 Sonnet 也来了,Claude 3.5 Sonnet 推理得分超过O1。
而且 Claude 现在支持像人类一样操作计算机,通过查看屏幕、移动光标、单击按钮和键入文本。
升级 Claude 3.5 Sonnet 现在开放。computer use测试版也开放使用。
新版Claude 3.5 Sonnet介绍:
更新后的Claude 3.5 Sonnet在行业基准上显示出广泛的改进,尤其是在代理编码和工具使用任务方面取得了显着的进步。
它在SWE-bench Verified上的性能从 33.4% 提高到 49.0%,得分高于所有公开可用的模型,包括 OpenAI o1-preview 等推理模型和专为代理编码设计的专用系统。
它还将在代理工具使用任务TAU-bench上的表现提高,零售领域从 62.6%提高到 69.2%,在更具挑战性的航空领域从 36.0%提高到 46.0%。
早期客户反馈表明,升级后的 Claude 3.5 Sonnet 代表了 AI 编码的重大飞跃。GitLab 为 DevSecOps 任务测试了该模型,发现它在没有增加延迟的情况下提供了更强的推理能力(在各种用例中高达 10%)。
Claude 3.5 Haiku介绍:
Claude 3.5 Haiku 在各项技能上都有所提高,甚至在许多智能基准上超过了上一代最大的模型 Claude 3 Opus。
Claude 3.5 Haiku 具有低延迟、改进的指令遵循和更准确的工具使用能力。
Haiku 在编码任务上尤其强大。例如,它在 SWE-bench Verified 上得分为 40.6%,优于许多使用公开可用的最先进模型(包括原始的 Claude 3.5 Sonnet 和 GPT-4o)的代理。
教Claude使用计算机
为了使这些通用技能成为可能,构建了一个 API,使 Claude 能够感知计算机界面并与之交互。
开发人员可以集成此 API,使 Claude 能够将指令(例如,“使用我的计算机上的数据并在线填写此表格”)翻译成计算机命令(例如,检查电子表格;移动光标打开 Web 浏览器;导航到相关网页;使用这些网页中的数据填写表格;等等)。
在评估人工智能模型像人一样使用计算机的能力的OSWorld上。
Claude 3.5 Sonnet 在仅屏幕截图类别中得分为 14.9%,明显优于第二好的人工智能系统 7.8% 的得分。
当提供更多步骤来完成任务时,克劳德得分为 22.0%。
官方公告:www.anthropic.com/news/3-5-models-and-computer-use
Invalid media: video
Claude 3.5 Haiku 和升级款的 Claude 3.5 Sonnet 也来了,Claude 3.5 Sonnet 推理得分超过O1。
而且 Claude 现在支持像人类一样操作计算机,通过查看屏幕、移动光标、单击按钮和键入文本。
升级 Claude 3.5 Sonnet 现在开放。computer use测试版也开放使用。
新版Claude 3.5 Sonnet介绍:
更新后的Claude 3.5 Sonnet在行业基准上显示出广泛的改进,尤其是在代理编码和工具使用任务方面取得了显着的进步。
它在SWE-bench Verified上的性能从 33.4% 提高到 49.0%,得分高于所有公开可用的模型,包括 OpenAI o1-preview 等推理模型和专为代理编码设计的专用系统。
它还将在代理工具使用任务TAU-bench上的表现提高,零售领域从 62.6%提高到 69.2%,在更具挑战性的航空领域从 36.0%提高到 46.0%。
早期客户反馈表明,升级后的 Claude 3.5 Sonnet 代表了 AI 编码的重大飞跃。GitLab 为 DevSecOps 任务测试了该模型,发现它在没有增加延迟的情况下提供了更强的推理能力(在各种用例中高达 10%)。
Claude 3.5 Haiku介绍:
Claude 3.5 Haiku 在各项技能上都有所提高,甚至在许多智能基准上超过了上一代最大的模型 Claude 3 Opus。
Claude 3.5 Haiku 具有低延迟、改进的指令遵循和更准确的工具使用能力。
Haiku 在编码任务上尤其强大。例如,它在 SWE-bench Verified 上得分为 40.6%,优于许多使用公开可用的最先进模型(包括原始的 Claude 3.5 Sonnet 和 GPT-4o)的代理。
教Claude使用计算机
为了使这些通用技能成为可能,构建了一个 API,使 Claude 能够感知计算机界面并与之交互。
开发人员可以集成此 API,使 Claude 能够将指令(例如,“使用我的计算机上的数据并在线填写此表格”)翻译成计算机命令(例如,检查电子表格;移动光标打开 Web 浏览器;导航到相关网页;使用这些网页中的数据填写表格;等等)。
在评估人工智能模型像人一样使用计算机的能力的OSWorld上。
Claude 3.5 Sonnet 在仅屏幕截图类别中得分为 14.9%,明显优于第二好的人工智能系统 7.8% 的得分。
当提供更多步骤来完成任务时,克劳德得分为 22.0%。
官方公告:www.anthropic.com/news/3-5-models-and-computer-use
Invalid media: video