关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
前两天为了尝试Cursor写代码的能力,顺手做了个Chrome小工具,现在已经通过Google审核上线了。

功能是安装后在浏览任意网页时,碰到想分享的文字内容,可以用鼠标选择文字,然后点击分享的小图标就能帮你生成一个展示还不错的带有当前网站logo、名称及网页标题的图片。

方便在一些场合给朋友分享以及发小红书等社交媒体。

链接:https://chromewebstore.google.com/detail/%E6%99%BA%E8%83%BD%E6%96%87%E6%9C%AC%E6%88%AA%E5%9B%BE-%E4%B8%80%E9%94%AE%E5%88%86%E4%BA%AB%E9%98%85%E8%AF%BB%E7%B2%BE%E5%8D%8E/kjgmklgfekmpiiofbgdnmipogmakeiac?hl=zh-CN&authuser=0
海外最大的图像模型分享网站Civitai终于走出了这一步。

他们新开了一个 Civita Green 站点,里面只有安全的图片和模型,没有色情内容。

我上班找模型终于不用偷偷摸摸了。

同样在摆脱了色情和重口味内容后,他们也将开始更加大脚步推进商业化的进度。

这里访问:https://civitai.green/models
地表最强AI写代码工具——Cursor:人人都是P8程序员_哔哩哔哩_bilibili

做了个Cursor的实操演示视频。

作为一个确实不太懂代码,只自己看书学过点python皮毛的人。向你演示完全使用自然语言,一行代码不写、不改也确实能制作出一些简单的应用。
我愿称之为2024最火🔥最新开源 Web 爬虫项目:FireCrawl

FireCrawl可以将整个网站转换为可用于 LLM 的 Markdown 或结构化数据。使用单个 API 进行抓取、抓取和提取。

说白了就是将一个 URL 转换为 Markdown,很方便的和各种大模型进行对接,而且还支持各种各样的 SDK。

目前GitHub Stars 量已经突破 11K。

不想自己部署的话,可以直接使用它们的在线服务,直接转Markdown 格式,效果还不错。

开源地址:https://github.com/mendableai/firecrawl
为模型服务的数据系统正在从0开始发展:
1. 传统机器学习领域虽然已经发展了多年,但是由于算力和架构的限制,对数据的消耗能力非常有限。大模型时代pre training, post training 阶段数据的消费能力是非常惊人的。特别是在大家尝到1 epoch的甜头以后,对于数据的需求上涨了成千上万倍。

2. 如何在短时间内生产这么多数据来供应模型训练就成了很大的问题。其中最重要的是计算和存储。
先说计算,近几年如此大规模的计算需求基本发生在互联网公司的数据仓库链路中,承担ETL,数据建模,adhoc查询等需求。Spark也在这些IO密集型,重shuffle,aggregate的场景中胜出,所以生态基建和普及率是最高的。也正因为此成为了各家模型公司的主要数据计算引擎。但也明显有水土不服,早期版本无法使用GPU,pyspark 昂贵的序列化反序列化代价,虽然都已经补上,但异构集群困难的自定义调度,昂贵的容错代价等还是阻碍了它接管所有计算场景。

3. 一众像ray一样提供更底层任务/数据编排调度的框架弥补了Spark的不足,在这种map算子占绝大多数的轻分布式计算场景中获得了先机。我觉得ray.data被推崇的主要原因是开放了task的调度接口,以及放弃对job级别幂等性保障而全面转向到min batch带来更低的心里使用成本。

4. 但是年轻的ray.data问题还非常多,经常被我吐槽还是一个toy project。缝合的类型系统洞非常多,经常出现写出去读不回来的尴尬处境。一些为了避免OOM的提前资源切分又做的很粗,在追求性能的场景下成为累赘。聊胜于无的auto scale和backpressure机制等都让它看起来无法胜任超大型的任务。但也正是因为这个生态位的短缺,ray.data正被很多大模型公司赶着上架。
今天有个人问我之前我做的coze机器人的问题,由于我做过就给他截图了,我做过的coze案例都可以来问我。于是回答完成之后我又跟着做其他人的案例:驾照模拟考试
人形机器人商业化进行时:走自己的奥德赛之旅 |CyberRobo

维特根斯坦说,“不以他人事例为指南,而应以事物本质为向导”。希望每个人形机器人都能找到并走自己的奥德赛之旅。
我对 agi 的定义是,能完全取代建筑工人
没调好的AI不要硬上
硅谷两个月手记,AI 和其之外更重要的

最近“语音”方向的几个信号:

三个月前我在硅谷沉浸式泡了两个多月把产品上的整体感受和几个趋势简短写在了这里,在不同的创业者交流研究了40多个产品后,最终回归到了“语音”这个方向,写下“Voice is a big thing”。

“语音正在成为一个较稳定的接口扩宽人们与产品交互的物理边界,可以重点关注的几个方向:语音for 搜索、情感疗愈、社交、音乐等内容创作。”

我写完这篇文章,算是给自己的汇报后就迫不及待地投入到了一款很有意思的的语音产品建设中。这三个月经历了闭关与起起落落,对现在的实时语音交互能力边界和语音更适合做什么样的事有了更深入的理解。

今天看到 Bland.ai 官宣融资再次支棱起来了,下面是最近语音方向的几个信号:

1. 做ai call centor的bland.ai今天宣布完成了2200万美金A轮融资,YC、Paypal 和 Twillo 创始人、11labs CTO参与投资。

2. 最喜欢的Suno也成为了a16z公布的近半年增长最快的ai产品。在过去六个月中,从第 36 位增长至第 5 位。

3. Superwhisper是最近看到最喜欢的一个产品,Voice to text for any tasks,通过语音输入进行转写来嵌入到各种桌面和手机端流程。

趁回湾区前争取多输出点最近做语音产品的思考和一些有意思的产品研究。
玩了一天的Cursor,作为一个毫无技术基础的人,确实很爽。

尤其是Composer功能,尽管提要求,让它自动创建文件以及写完所有代码就好了。但是因为想象和语言表达之间的差异,往往一开始的实现效果会不尽如人意,或者有不少bug。但是只要把bug情况或者想优化的点描述清楚,就可以一直用自然语言调整。

晚上花了两小时时间,一行代码都没写,做了个可以在任意网页划线生成分享图片的Chrome插件,效果(见图2-4)自己还挺满意的。
Back to Top