关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
大的来了!

Claude 3.5 Haiku 和升级款的 Claude 3.5 Sonnet 也来了,Claude 3.5 Sonnet 推理得分超过O1。

而且 Claude 现在支持像人类一样操作计算机,通过查看屏幕、移动光标、单击按钮和键入文本。

升级 Claude 3.5 Sonnet 现在开放。computer use测试版也开放使用。

新版Claude 3.5 Sonnet介绍:

更新后的Claude 3.5 Sonnet在行业基准上显示出广泛的改进,尤其是在代理编码和工具使用任务方面取得了显着的进步。

它在SWE-bench Verified上的性能从 33.4% 提高到 49.0%,得分高于所有公开可用的模型,包括 OpenAI o1-preview 等推理模型和专为代理编码设计的专用系统。

它还将在代理工具使用任务TAU-bench上的表现提高,零售领域从 62.6%提高到 69.2%,在更具挑战性的航空领域从 36.0%提高到 46.0%。

早期客户反馈表明,升级后的 Claude 3.5 Sonnet 代表了 AI 编码的重大飞跃。GitLab 为 DevSecOps 任务测试了该模型,发现它在没有增加延迟的情况下提供了更强的推理能力(在各种用例中高达 10%)。

Claude 3.5 Haiku介绍:

Claude 3.5 Haiku 在各项技能上都有所提高,甚至在许多智能基准上超过了上一代最大的模型 Claude 3 Opus。

Claude 3.5 Haiku 具有低延迟、改进的指令遵循和更准确的工具使用能力。

Haiku 在编码任务上尤其强大。例如,它在 SWE-bench Verified 上得分为 40.6%,优于许多使用公开可用的最先进模型(包括原始的 Claude 3.5 Sonnet 和 GPT-4o)的代理。

教Claude使用计算机

为了使这些通用技能成为可能,构建了一个 API,使 Claude 能够感知计算机界面并与之交互。

开发人员可以集成此 API,使 Claude 能够将指令(例如,“使用我的计算机上的数据并在线填写此表格”)翻译成计算机命令(例如,检查电子表格;移动光标打开 Web 浏览器;导航到相关网页;使用这些网页中的数据填写表格;等等)。

在评估人工智能模型像人一样使用计算机的能力的OSWorld上。

Claude 3.5 Sonnet 在仅屏幕截图类别中得分为 14.9%,明显优于第二好的人工智能系统 7.8% 的得分。

当提供更多步骤来完成任务时,克劳德得分为 22.0%。

官方公告:www.anthropic.com/news/3-5-models-and-computer-use

Invalid media: video
离线大模型已经如此强大~

如果不在本地设备上亲自跑一下,可能很难体会到如今开源小模型的威力。

💎 以Gemma 2为例:

虽然它的参数量只有2B,仅为GPT-3.5(175B)参数的几十分之一,处理速度却快了数倍(每秒39 tokens);而智能水平还超越了GPT-3.5。

你唯一需要的,不过是一台手机或平板。
最近发了些做Cursor的视频后,一些小企业负责人就长上门非要我帮忙开发产品,功能其实都挺简单,但是因为涉及AI应用落地,他们自己的开发都不太有对应经验。报了大五位数的客单价也没劝退,就当练练手去做了。

带着实际需求去做东西还挺有趣的。就是中间为了让他们的钱显得花得值,5分钟改完的功能还要特意等第二天再发过去。
尝试AI 编程几个月后,我注意到,自己用AI 编程做得最多的,不是chrome插件,不是做网页、app,而是可视化。

在技术不熟的情况下,一个chrome 插件要做到基本满意的程度,大概要一小时左右。

过程中的反复调试,也挺消耗心力的。因此,除非我急需这个功能,否则不会轻易做插件。

但可视化不一样,提示词写好之后,万物皆可可视化。

只需要把素材丢进去,无论是文字、数字、代码,还是图片、文档,都可以分分钟做出好看的视觉或动图。

一、四大可视化场景

下面,我就按照使用频次的高低,把我常用的可视化场景和对应的图,挨个列出来:

1、阅读材料可视化

从第一天给ChatGPT充值开始,我个人用AI干得最多的事,就是把半懂半不懂的阅读材料逐段发过去,让它帮我解释。

最早是让它用 8 岁孩子能懂的话解释,后来还让它拆解逻辑、讲解生僻词;今年还让它用外星人类学家的局外人视角分析,以及从该观点的反面去分析。

这些方法在一定程度上颇有帮助,不过自从用AI 编程做阅读材料可视化过后,我就很少用那些提示词了。

因为AI 把材料做成合适的图表之后,确实更清晰了,一图可胜千言(图一);而从文字形式变为图表形式,本身就是一种“陌生化”处理,也能让我更好理解材料内容(图二)。

2、输出内容可视化

对象说我写东西有个毛病:又臭又长。不过我总担心读者不好理解,忍不住想解释,一直想改却改不了。

最近试着写完后让AI可视化一下,再把图表给对象看,她说这样清爽多了。

比如把前一段的“阅读材料可视化”丢过去,马上就获得了这张更好懂的图文卡片(图三)。

3、数据可视化

实不相瞒,最开始尝试可视化,是想解决数字可视化问题。

当时我只知道用mermaid,但随着尝试图表类型增多,发现这一个库能支持的图表有限。

于是,我用 perplexity 找到更多库,形成了这个图表库对照表(图四),并放进了提示词里。

具体数据的可视化效果我就不展示了,直接把图表库对照表的内容,做成一个词云吧。

4、代码学习可视化

前一段时间学吴恩达老师的AI python 课时,为方便更好理解课程内容,我就自己写了个 Python 概念解释的提示词。

具体的动图效果和提示词,我在那条帖子里也有写过,感兴趣可以查看:

https://m.okjike.com/originalPosts/66e505b12cacf9416aeefd9b
机器人遥控,从入门到精通
Booster T1 和 Ta 的朋友们
或许需要遛狗机器人,在主人忙碌的时候替主人遛狗。让狗狗在保持每日运动量的同时,还能外出进行社会化。机器人需要能够通过蓝牙钥匙方式进出家门,自主上下楼梯,或者按电梯。能控制狗绳长短、有力量防爆冲。可以识别狗拉屎、尿尿,进行等待,还要能够包屎、捡屎、倒屎🤣
语言无处不歧义,在某种程度上,我们也可以说自然语言处理基础任务的核心就在于解决歧义问题。
爱拍照拍视频的朋友们,我宣布个事,我憋不住了,我们的新产品做的太好了,实在忍不住分享一下:

AIVlog,一个特别擅长剪Vlog的AI剪辑师,帮你全自动剪Vlog。想做这个是因为,在我的心里,人类就应该好好享受生活、认真记录生活,不应该花那么多时间学习怎么用软件剪视频(谁懂挑素材挑到老眼昏花的感觉)。

还没做完,预计11月初上架🍎
今天朋友告诉我:有个女生发现我是妹子,还看过我的自拍
好吧,摊牌了,不装了,其实我长这样🫢
【Lora 推荐】 可以生成文字海报的 FLUX Lora。

非常适合用来做一些资讯和主题的封面图。触发词:text poster。

模型下载:huggingface.co/Shakker-Labs/FLUX.1-dev-LoRA-Text-Poster
Notebook LM 产品负责人和 Karpathy 都聊了一下这个产品目前需要优化的部分和欠缺的功能。

我整理了一下,一个比 Notebook LM 更好的 AI 播客 PMF 这不就出来了?

1. 移动应用开发:需要专门的移动应用;更便捷的音频控制,特别是在屏幕锁定时。

2. 交互功能:播放过程中能够中断并提问的能力;提出或请求后续剧集的选项。

3. 简化内容生成:简化基于兴趣点生成额外剧集的流程;减少收集资料和定制内容所需的时间和精力。

4. 分享和群组功能:与家人或朋友分享剧集的能力;群组收听体验的潜在功能。

5. 内容质量和呈现:对信息上下文化的积极反馈;避免枯燥的事实陈述。

6. 资料来源管理:目前主要依赖维基百科;建议提供快速资料来源选择器,并提供推荐。

7. 自定义指令:保存自定义指令模版的能力。

8. 离线功能:在网络连接不佳的地方可以本地保存内容的选项。

9. 与其他AI工具的集成:目前使用NotebookLM pod和ChatGPT Advanced Voice的组合进行问答。

10. 基于图像的播客生成:建议从单张图片生成简短播客;利用图像识别技术识别地标自动提取高质量资料,并提供简短的审核选项。
Back to Top