关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
国内AI这一波,暂时字节领先,这个应该是共识了吧。
端侧AI沙龙有人来玩嘛,北京线下
一个我觉得张一鸣大概率思考过的问题。
Meta 上周开源了一个端到端的语音模型 Spirit LM。

这个太重要了,居然没注意到。

这个模型有两个版本:

基础版: 适合进行一般的语音识别和生成,不包含情感变化。

高表现力版:可以捕捉语音中的情感特征,能够生成包含快乐、愤怒或兴奋等情感的语音。

主要特点有:

Spirit LM 直接使用语音标记、音高标记和声调标记 来保留语音中的表现力要素,不需要先转文本描述。

能够在不需要大量数据的情况下,完成自动语音识别、文本转语音和语音分类等复杂任务。

项目地址:speechbot.github.io/spiritlm/

论文:arxiv.org/pdf/2402.05755
Media is too big
VIEW IN TELEGRAM
Ideogram 终于做了一个发挥他们模型能力的功能 Ideogram Canvas。

可以在无限画布上对生成的图片进行编辑,比如扩图、局部重绘,以及最基本的生成功能。

我提前几天体验了一下,发现真的很适合用来做海报之类的运营设计。

因为Ideogram新模型的排版和文字能力真的很好,比如我之前说可以用来设计网页。

但是由于长宽比的问题,没办法完成一整个网页,现在没问题了,哈哈。
大的来了!

Claude 3.5 Haiku 和升级款的 Claude 3.5 Sonnet 也来了,Claude 3.5 Sonnet 推理得分超过O1。

而且 Claude 现在支持像人类一样操作计算机,通过查看屏幕、移动光标、单击按钮和键入文本。

升级 Claude 3.5 Sonnet 现在开放。computer use测试版也开放使用。

新版Claude 3.5 Sonnet介绍:

更新后的Claude 3.5 Sonnet在行业基准上显示出广泛的改进,尤其是在代理编码和工具使用任务方面取得了显着的进步。

它在SWE-bench Verified上的性能从 33.4% 提高到 49.0%,得分高于所有公开可用的模型,包括 OpenAI o1-preview 等推理模型和专为代理编码设计的专用系统。

它还将在代理工具使用任务TAU-bench上的表现提高,零售领域从 62.6%提高到 69.2%,在更具挑战性的航空领域从 36.0%提高到 46.0%。

早期客户反馈表明,升级后的 Claude 3.5 Sonnet 代表了 AI 编码的重大飞跃。GitLab 为 DevSecOps 任务测试了该模型,发现它在没有增加延迟的情况下提供了更强的推理能力(在各种用例中高达 10%)。

Claude 3.5 Haiku介绍:

Claude 3.5 Haiku 在各项技能上都有所提高,甚至在许多智能基准上超过了上一代最大的模型 Claude 3 Opus。

Claude 3.5 Haiku 具有低延迟、改进的指令遵循和更准确的工具使用能力。

Haiku 在编码任务上尤其强大。例如,它在 SWE-bench Verified 上得分为 40.6%,优于许多使用公开可用的最先进模型(包括原始的 Claude 3.5 Sonnet 和 GPT-4o)的代理。

教Claude使用计算机

为了使这些通用技能成为可能,构建了一个 API,使 Claude 能够感知计算机界面并与之交互。

开发人员可以集成此 API,使 Claude 能够将指令(例如,“使用我的计算机上的数据并在线填写此表格”)翻译成计算机命令(例如,检查电子表格;移动光标打开 Web 浏览器;导航到相关网页;使用这些网页中的数据填写表格;等等)。

在评估人工智能模型像人一样使用计算机的能力的OSWorld上。

Claude 3.5 Sonnet 在仅屏幕截图类别中得分为 14.9%,明显优于第二好的人工智能系统 7.8% 的得分。

当提供更多步骤来完成任务时,克劳德得分为 22.0%。

官方公告:www.anthropic.com/news/3-5-models-and-computer-use

Invalid media: video
离线大模型已经如此强大~

如果不在本地设备上亲自跑一下,可能很难体会到如今开源小模型的威力。

💎 以Gemma 2为例:

虽然它的参数量只有2B,仅为GPT-3.5(175B)参数的几十分之一,处理速度却快了数倍(每秒39 tokens);而智能水平还超越了GPT-3.5。

你唯一需要的,不过是一台手机或平板。
最近发了些做Cursor的视频后,一些小企业负责人就长上门非要我帮忙开发产品,功能其实都挺简单,但是因为涉及AI应用落地,他们自己的开发都不太有对应经验。报了大五位数的客单价也没劝退,就当练练手去做了。

带着实际需求去做东西还挺有趣的。就是中间为了让他们的钱显得花得值,5分钟改完的功能还要特意等第二天再发过去。
尝试AI 编程几个月后,我注意到,自己用AI 编程做得最多的,不是chrome插件,不是做网页、app,而是可视化。

在技术不熟的情况下,一个chrome 插件要做到基本满意的程度,大概要一小时左右。

过程中的反复调试,也挺消耗心力的。因此,除非我急需这个功能,否则不会轻易做插件。

但可视化不一样,提示词写好之后,万物皆可可视化。

只需要把素材丢进去,无论是文字、数字、代码,还是图片、文档,都可以分分钟做出好看的视觉或动图。

一、四大可视化场景

下面,我就按照使用频次的高低,把我常用的可视化场景和对应的图,挨个列出来:

1、阅读材料可视化

从第一天给ChatGPT充值开始,我个人用AI干得最多的事,就是把半懂半不懂的阅读材料逐段发过去,让它帮我解释。

最早是让它用 8 岁孩子能懂的话解释,后来还让它拆解逻辑、讲解生僻词;今年还让它用外星人类学家的局外人视角分析,以及从该观点的反面去分析。

这些方法在一定程度上颇有帮助,不过自从用AI 编程做阅读材料可视化过后,我就很少用那些提示词了。

因为AI 把材料做成合适的图表之后,确实更清晰了,一图可胜千言(图一);而从文字形式变为图表形式,本身就是一种“陌生化”处理,也能让我更好理解材料内容(图二)。

2、输出内容可视化

对象说我写东西有个毛病:又臭又长。不过我总担心读者不好理解,忍不住想解释,一直想改却改不了。

最近试着写完后让AI可视化一下,再把图表给对象看,她说这样清爽多了。

比如把前一段的“阅读材料可视化”丢过去,马上就获得了这张更好懂的图文卡片(图三)。

3、数据可视化

实不相瞒,最开始尝试可视化,是想解决数字可视化问题。

当时我只知道用mermaid,但随着尝试图表类型增多,发现这一个库能支持的图表有限。

于是,我用 perplexity 找到更多库,形成了这个图表库对照表(图四),并放进了提示词里。

具体数据的可视化效果我就不展示了,直接把图表库对照表的内容,做成一个词云吧。

4、代码学习可视化

前一段时间学吴恩达老师的AI python 课时,为方便更好理解课程内容,我就自己写了个 Python 概念解释的提示词。

具体的动图效果和提示词,我在那条帖子里也有写过,感兴趣可以查看:

https://m.okjike.com/originalPosts/66e505b12cacf9416aeefd9b
Back to Top