关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
为模型服务的数据系统正在从0开始发展:
1. 传统机器学习领域虽然已经发展了多年,但是由于算力和架构的限制,对数据的消耗能力非常有限。大模型时代pre training, post training 阶段数据的消费能力是非常惊人的。特别是在大家尝到1 epoch的甜头以后,对于数据的需求上涨了成千上万倍。
2. 如何在短时间内生产这么多数据来供应模型训练就成了很大的问题。其中最重要的是计算和存储。
先说计算,近几年如此大规模的计算需求基本发生在互联网公司的数据仓库链路中,承担ETL,数据建模,adhoc查询等需求。Spark也在这些IO密集型,重shuffle,aggregate的场景中胜出,所以生态基建和普及率是最高的。也正因为此成为了各家模型公司的主要数据计算引擎。但也明显有水土不服,早期版本无法使用GPU,pyspark 昂贵的序列化反序列化代价,虽然都已经补上,但异构集群困难的自定义调度,昂贵的容错代价等还是阻碍了它接管所有计算场景。
3. 一众像ray一样提供更底层任务/数据编排调度的框架弥补了Spark的不足,在这种map算子占绝大多数的轻分布式计算场景中获得了先机。我觉得ray.data被推崇的主要原因是开放了task的调度接口,以及放弃对job级别幂等性保障而全面转向到min batch带来更低的心里使用成本。
4. 但是年轻的ray.data问题还非常多,经常被我吐槽还是一个toy project。缝合的类型系统洞非常多,经常出现写出去读不回来的尴尬处境。一些为了避免OOM的提前资源切分又做的很粗,在追求性能的场景下成为累赘。聊胜于无的auto scale和backpressure机制等都让它看起来无法胜任超大型的任务。但也正是因为这个生态位的短缺,ray.data正被很多大模型公司赶着上架。
1. 传统机器学习领域虽然已经发展了多年,但是由于算力和架构的限制,对数据的消耗能力非常有限。大模型时代pre training, post training 阶段数据的消费能力是非常惊人的。特别是在大家尝到1 epoch的甜头以后,对于数据的需求上涨了成千上万倍。
2. 如何在短时间内生产这么多数据来供应模型训练就成了很大的问题。其中最重要的是计算和存储。
先说计算,近几年如此大规模的计算需求基本发生在互联网公司的数据仓库链路中,承担ETL,数据建模,adhoc查询等需求。Spark也在这些IO密集型,重shuffle,aggregate的场景中胜出,所以生态基建和普及率是最高的。也正因为此成为了各家模型公司的主要数据计算引擎。但也明显有水土不服,早期版本无法使用GPU,pyspark 昂贵的序列化反序列化代价,虽然都已经补上,但异构集群困难的自定义调度,昂贵的容错代价等还是阻碍了它接管所有计算场景。
3. 一众像ray一样提供更底层任务/数据编排调度的框架弥补了Spark的不足,在这种map算子占绝大多数的轻分布式计算场景中获得了先机。我觉得ray.data被推崇的主要原因是开放了task的调度接口,以及放弃对job级别幂等性保障而全面转向到min batch带来更低的心里使用成本。
4. 但是年轻的ray.data问题还非常多,经常被我吐槽还是一个toy project。缝合的类型系统洞非常多,经常出现写出去读不回来的尴尬处境。一些为了避免OOM的提前资源切分又做的很粗,在追求性能的场景下成为累赘。聊胜于无的auto scale和backpressure机制等都让它看起来无法胜任超大型的任务。但也正是因为这个生态位的短缺,ray.data正被很多大模型公司赶着上架。
最近“语音”方向的几个信号:
三个月前我在硅谷沉浸式泡了两个多月把产品上的整体感受和几个趋势简短写在了这里,在不同的创业者交流研究了40多个产品后,最终回归到了“语音”这个方向,写下“Voice is a big thing”。
“语音正在成为一个较稳定的接口扩宽人们与产品交互的物理边界,可以重点关注的几个方向:语音for 搜索、情感疗愈、社交、音乐等内容创作。”
我写完这篇文章,算是给自己的汇报后就迫不及待地投入到了一款很有意思的的语音产品建设中。这三个月经历了闭关与起起落落,对现在的实时语音交互能力边界和语音更适合做什么样的事有了更深入的理解。
今天看到 Bland.ai 官宣融资再次支棱起来了,下面是最近语音方向的几个信号:
1. 做ai call centor的bland.ai今天宣布完成了2200万美金A轮融资,YC、Paypal 和 Twillo 创始人、11labs CTO参与投资。
2. 最喜欢的Suno也成为了a16z公布的近半年增长最快的ai产品。在过去六个月中,从第 36 位增长至第 5 位。
3. Superwhisper是最近看到最喜欢的一个产品,Voice to text for any tasks,通过语音输入进行转写来嵌入到各种桌面和手机端流程。
趁回湾区前争取多输出点最近做语音产品的思考和一些有意思的产品研究。
Lora 训练素材:
15 张现有的照片,都是用专业相机和灯光拍摄的,拍了 5 张新照片,以涵盖不同的角度和距离,以更好地充实数据。
使用 Civitai 的 FLUX Lora 训练功能训练。
来源:https://www.reddit.com/r/StableDiffusion/comments/1f2yun6/i_am_using_my_generated_photos_from_flux_on/
Claude Artifacts 已经向所有付费和免费用户在全平台开放。
他们做了个视频展示 Artifact 是如何被构建出来的。
完全从自身需求出发,敏锐的发现问题,并且找出符合逻辑的解决方式,好的功能都是这么来的。
另外 Artifact 也可以帮助 Claude 获取最好的代码相关合成数据。
来源:https://www.anthropic.com/news/artifacts
Invalid media: video
他们做了个视频展示 Artifact 是如何被构建出来的。
完全从自身需求出发,敏锐的发现问题,并且找出符合逻辑的解决方式,好的功能都是这么来的。
另外 Artifact 也可以帮助 Claude 获取最好的代码相关合成数据。
来源:https://www.anthropic.com/news/artifacts
Invalid media: video