开个帖子记录和回顾一下我和 AI 行业的 2024

- 模型层面的发展(LLM、视频、图像)
- 我最喜欢的AI产品创新
- 我目前用钱投票的所有AI产品

### 产业&模型

图像和视频领域出乎意料的快速发展,感谢Open AI在Sora发布时最后的良知爆发,多写了点架构的事情。

**图像生成成能力爆发式的增强**

- 主要源于Sora让大家看到了DiT架构的潜力,也感谢Open AI最后一次在架构上写那么多。
- 图像质量大幅进化、真实度、细节和提示词理解都比纯扩散模型强了非常多。
- 提示词理解变强带来的控制方式的变化,工作流变得更加简单的同时对大语言模型的依赖性也变得更强。
- 文字书写能力让图像模型真的可以落地,海报、封面、梗图,每个人都有作图需求,只是之前更接近手工业的设计行业没办法低成本提供服务。

**视频生成走在图像一年前的路上**

- 24年的视频生成发展路径和生成质量跟23年的图像很像,终于在单镜头上做到了80分水平
- 跟图片不一样的是,这次国产视频模型碾压式的打爆的海外模型,可灵、海螺、即梦、Pixverse这次轮到他们反思了
- 当我们觉得视频生成模型在这个规模下质量见顶的时候,谷歌的Veo2让我们看到了视频模型的能力还能再窜一窜
- 明年视频模型会发展到深水区,我们需要啃色彩、ID、场景等一致性,我们需要解决视频模型中的文字生成问题,需要利用Agents能力解决自动化编排和生成的问题。

**大语言模型的困境和方向**

- 谁都没想到在一年前让很多人奉为圭臬的 Scaling laws 预训练可以这么快的看到顶,所以这个行业没有谁可以精准的预测发展过程。
- 更没想到的是代码能力的大幅提升让AI代码生成大规模落地了,这个互联网的基座能力被加速后,会给整个下游都带来指数级的变化。
- Gemini的原生多模态生成能力带来的25年关于内容生产和分析的自动化的发展非常令人期待
- 结构化输出问题的解决能否让Agents真正落地到产品上呢?
- 大语言模型从封闭域走向开放域现在O1和O3又回到了封闭域,推理模型的问题是用户根本不知道什么时候该用,以及结果到底对不对,产品需要思考这个问题的解决方式。

### 产品

不同于模型的困顿和发展变慢,今年的AI产品才真正爆发,整个产业一起用钱和广告把用户认知和用户规模砸了出来。

**我最喜欢的AI产品层面创新**
 
 
Back to Top