关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
继 Snipd、Gamma 最打动我的 AI 产品之后,我正式宣布找到了第三个(也是今年第一个):Castmagic。

刚刚跟创始人聊了一个多小时,完全 bootstrap,不到 10 个人,竟然把产品做的这么完整(虽然延时的时候还有一些 bug),但基本满足了作为 podcaster 和内容高频消费输出者的 90% 需求,而且 customed prompt by section 的概念非常打动我!

我诚意推荐跟我一样,在做大量视频或音频输出和二创,编辑以及剪辑的朋友试试!!
RAG 效果评估教程

介绍如何使用 RAGAs 框架评估 RAG 应用的性能。

并通过构建元数据链和记录到 CometML-LLM 来监控复杂的生成过程。

详细教了 RAGAs 的评估指标、评估数据集的准备、评估过程的实现,以及如何使用 CometML 监控和记录评估链的每个步骤。

教程地址:https://www.comet.com/site/blog/rag-evaluation-framework-ragas/
【科沃斯回应扫地机被曝成偷窥工具】

8 月 13 日消息,被称为“扫地机器人第一股”的科沃斯面临隐私安全的质疑。两位安全研究人员发现,通过蓝牙连接科沃斯机器人后,黑客可以通过产品自带的WiFi连接功能对其远程控制,并访问其操作系统中的房间地图、摄像头、麦克风等功能和信息。

8 月 13 日,科沃斯回应称,这些安全隐患在用户日常使用环境中的发生概率极低,需要专业的黑客工具且近距离接触机器才有可能完成,故用户不必为此过虑。同日,客服回复表示,新闻中提及的相关产品在店铺均已下架。(21世纪经济报道)
在飞书里体验了一天的智能会议纪要功能,AKA职场刚需、摸鱼帮手、效率神器、办公副驾、免费小秘、废话扫地机⋯⋯呃,编不下去了。

讲真确实好用,相当于飞书终于在会议场景的原生应用层接入了大模型,在把会议内容转成文字这个基础上,新增了对整场会议进行精细梳理的能力。

在很多时候,开会其实是工作里最无效的行为,但是出于管理协同的目的,开会又是最主流的对齐手段,几个小时的头昏脑涨下来,很容易丢失关键信息。

使唤AI梳理会议纪要,其实是一个很普遍的呼声,它本质上带有RAG的成分,也就是并不太需要AI去创作什么——创作会带来幻觉风险——而是把冗余信息全都丢过去,让AI推理并满足那个人人都向往的需求:

用最简单的语言,把重点有序罗列出来,组织成为汇报文本。

费曼说过一句话,大意是寻找简单的规则往往需要建立复杂的系统,大多数时候一件事情无法简化,就是因为系统不够强大,现在的大模型动不动就是万卡集群来做训练,担任复杂系统的角色再适合不过了。

简而言之,就是AI的刚需用途一定是省时省力,再也不用困在从一堆信息里找那一两句有效信息了,每一个用完智能会议纪要的,一定都会离不开它,我把话放在这里,有用完不服的回来找我。

另外还有就是,在我的测试过程里,发现这套智能会议纪要系统也不是先转文本-再做分析的步骤,而是在「听」语音时就让AI介入了,不止是识别发言者说了什么,还会判断情绪和转折,对各执一词的讨论得出准确结论,最后到底拍板按谁的提案来执行。

如果是深度的飞书用户,也就是团队协作都放在飞书上,会议纪要里的指名还能对应上具体的成员,比如总监说了这个项目由谁负责,最后生成的待办事项甚至可以直接at那个人,是不是很方便?

还是那句话,workflow的搭建很容易,在飞书还没上这个能力的时候,我相信已经有很多人串起各种工具来满足类似的总结诉求了,真正的能力差别,在于模型的智能化水平。

既不怕总结差,也不怕总结慢,怕的是总结错了,本来是图省事,反而让人多事。

我的个人使用场景还有去做播客摘要,此时的入口就不是在飞书会议里了,打开飞书妙计,上传音频文件,直接在转成文本的同时也能把精华信息全都整齐列出,而且带有逻辑,不是平铺展示。

据我所知,虽然目前用的模型是豆包,但飞书还是只提供应用层的服务,未来用户可以自己选择接入哪家的模型,不是必须要死绑豆包。

如果再多想一点的话,我觉得给用户开放自定义Prompts的功能也挺好的,比如我对不同播客节目的精要需求也是不一样的,商业类的可能我会需要AI着重注意有关数据的信息,人文类的则希望AI可以多留意对话里的故事性,不要自顾自的觉得不重要就替我压缩了。

反正就很能get到科技以人为本的精髓,真正演示了什么叫脏活累活都给AI来办,为创造力节省珍贵的脑细胞。(狗头.jpg
最近跟一些AI创业公司创始人,以及大厂做AI业务(是业务不是技术)的人聊,我都一直在表达一个观点:我现在每天看得最多的AI类消息,特别不高大上,一个是政府和央国企的AI招投标信息,一个是全球和中国的各行业 AI to B 案例。两个东西气质风格完全不搭,但都是非常接地气的、鲜活的AI。

比如我听说有一家AI Startup,主要帮基层政府做基于国内模型api的微信Bot,回应社区和乡镇居民诉求,几千基层单位在用了,我听了就还是很感兴趣的。但整体上现在其实使用场景还不够多,开发者还没真的完全活跃起来,资本市场也不给他们钱,哄哄模拟器和胃之书这样的放10年前,分分钟融到钱。而开发者放不开手脚,用各种API和Infra工具就放不开手脚,整个生态就起不来。

所以我说我们接下来做的非常重要的一个工作就是用各种办法调动开发者更聪明、更便宜、更高效地使用算力、工具和消耗token,把这个变成我们跟生态共振的一个方式,进而成为我们一个新的二道贩子商业模式。不能光头部的六家大模型四小龙,那些做工具、框架、存算解决方案、Agent和应用的能融到钱,能发展,我们才能过得更好。

看得起我,想让我当二道贩子的基座模型、infra、算力、应用,以及VC朋友们,欢迎来骚扰。
特辑 | AI 与教育的未来:聊聊可汗学院创始人新书《Brave New Words》(勇敢的新词)w/ Joyce - Day1Global生而全球-Web3版

AI 与教育的未来:聊聊可汗学院创始人 Salman Khan 的新书《Brave New Words: How AI Will Revolutionize Education》( 勇敢的新词:人工智能将如何革新教育 )。

这本新书英文版发布于 3 个月前(2024 年 5 月 14 日),被众多大咖推荐,其中比尔·盖茨(Bill Gates)评价其为“A timely master class for anyone interested in the future of learning in the AI era”(对于任何关心人工智能时代学习的未来的人来说,这是一堂及时的大师课)。

这本书集思考、实践与指导与一体,推荐给每一位对 AI 和教育感兴趣的朋友,欢迎收听👇
扫地机器人是我最好的家务搭子
昨晚 Genie 宣布自己打造出了世界上最强的 AI 编程 Agents 产品。

在 SWE-Bench 评估中获得了 30.08% 的分数,在 SWE-Lite 中获得了 50.67%。

可以完美模拟人类工程师的认知过程、逻辑和工作流程。

目前需要申请才能访问:https://cosine.sh/blog/genie-technical-report

Invalid media: video
我还是不懂,我们都能投钱造通用人形机器人,为啥没有一个公司投资做半自动奶茶机器?随便一个奶茶店常常排队都是 20 杯起排。

虽然每个店的奶茶品类比咖啡略多一些,但是半自动化奶茶机器难道不是刚需吗?🤔🤔

没利润是吧?•ᴗ•💧
开眼了,看完 Claude 员工用AI写代码的经验[1]后,我发现自己有点低估了 Claude 的编程能力。

1、一次性完成整个项目

看他的分享之前,无论是处理编程任务,还是解决其他问题,我都倾向于把任务拆到足够细,然后让 AI 一小块儿一小块儿地处理。

但在文章中,这位员工是反其道而行之:自己准备好关键代码片段后,让Claude一次性写出整个「遥控机器」人的代码。

Claude真就一次性写出来了,效果还不错。而且,因为免去了手工连接各种数据的麻烦,极大节约了他们的时间。

后来这位员工还发现,在他不熟悉的领域,Claude比他更擅长把任务拆解成步骤。这时如果给AI的指令太具体,反而容易把他带进死胡同。

2、为项目定制调试工具

还是那个「遥控机器人」的项目。



机器人绕着后院转了一圈之后,吐出了一个包含GPS坐标等数据的CSV文件。他们想检查文件中数据的准确性,但却没啥现成的方法来检验。

放在以前,光搞清楚怎么查看和分析这些GPS坐标,就要花一个多小时。

但现在,他们只要把CSV的前两行发给 Claude,就可以让它生成一个Web应用。然后,快速读取这个文件的数据,并把GPS坐标在地图上显示出来(如图)。



在这个项目里,Claude无疑改变了调试的方式和效率:

一方面,不管数据多么特殊,都可以找到最合适的展示方式。AI把复杂数据转化为直观的视觉信息后,人一眼就能看到问题了。

另一方面,几分钟内就能生成一个定制化的调试工具,在一定程度上,也能把下载和学习某些专业调试工具和可视化工具的时间省下来了。

———

[1]https://erikschluntz.com/software/2024/07/30/code-with-ai.html
麻了 大哥还把项目开源了。

愣着干嘛,给大哥捐个款,搞产品啊。

项目地址:https://github.com/jbilcke-hf/clapper
非常🐂🍺的网页端 AI 生成和视频剪辑工具。

没想到居然是个人做出来的。

接入了 AI 视频需要的各种 API,包括图片生成、LLM、语音生成、音乐生成、视频生成。

时间轴直接生成对应内容,然后进行编排和剪辑。

传统界面和无线画布相互切换,一个用来发散构思,一个用来预览和精细编辑。
Back to Top