关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
a16z发布了他们最新调查的前100个生成式AI应用,这次会包括移动应用,里面有些数据分析很有意思

⬇️下面是一些报告中的要点:

ChatGPT每月接近20亿次网络访问量,大约是榜单上第二名公司Bard(现在是Gemini)的五倍。

在所谓的新来者中,排名最高的包括AI研究副驾驶Liner;Anthropic的通用助手Claude;以及三个未经审查的AI伴侣应用程序:JanitorAI、Spicychat和CrushOn。

有五家人工智能公司真正实现了“跨界”,旗下的网络产品和移动应用都进入了前50名单:ChatGPT、Character AI、聊天机器人聚合平台Poe,以及图像编辑器Photoroom和Pixelcut。

ChatGPT的规模大约是第二和三名选手微软Edge和Photomath的2.5倍

截至2024年1月,有九个人工智能产品或社区在邀请流量排名前100的Discord服务器中,其中Midjourney位居榜首。

该列表中的第二个显著新类别是生产力。AI原生平台可以提升人们与软件的互动,使他们能够委派琐碎的任务并减少在行政开销上花费的时间。生产力类别包括排名中的七家公司:Liner、Eightify、Phind、MaxAI、Blackbox AI、Otter ai和ChatPDF。

对于那些有移动应用的伴侣产品来说,用户参与度异常高。在这个类别中最成功的产品成为用户日常生活的核心部分,变得和给朋友发短信一样普遍(甚至更普遍!)。这玩意是真赚钱啊。

根据SensorTower的数据,Character AI每个用户平均每月有298个会话,而Poly AI平均有74个会话。

AI在移动应用和Web上的使用类别有很大的区别。一般来说,Web产品支持更复杂、多步骤的工作流程,涉及内容生成和编辑。这些产品包括AI语音工具包ElevenLabs、AI艺术生成器Leonardo和AI演示文稿生成器Gamma,它们在基于Web的AI产品中排名前20位。

应用列表中有七个专用的头像产品;大多数人手机上保存的许多自拍照作为可随时使用的训练数据。

此外,排名前三的应用——Facemoji(第9名)、Bobble(第31名)和Genie(第37名)——是专为移动设备设计的键盘应用,可以帮助用户发送带有AI辅助的文本。
一些关于 Devin 的想法

很多投资人 & 行业内朋友都来询问怎么看待 Devin 这个产品,发布的第一时间就有关注,并且自己也在 building developer tools,所以来写一些简单的 comments,可能过段时间就打脸。

1. 我更倾向于把 Cognition Labs 这家公司看做是一家类似于 DeepMind 的研究型公司,而不是商业型公司,这两种公司的目标和愿景是不一样的;

2. Devin 发布的演示视频很惊艳,能够处理一些基本的 GitHub Issue,甚至能解决 Upwork 上实际的问题,但是对于更复杂的场景能够解决得多好现在还是未知的 (目前还没有拿到测试资本),SWE-bench 13% 的指标还是不能直接用在生产环境上 (无干预情况下);

3. 软件开发是一个复杂的系统性工程,实际的 coding 其实只占其中的很少一部分,理解需求、生成代码、Debugging、优化、部署等等涉及到非常多的环节;

4. Devin 演示的一个亮点是,它所展示的决策树很长 (按照 blog 中提到能有上千个决策节点),这个要求底层模型有非常强的 reasoning 能力和 long context window,目前看起来 Devin 应该并没有 train 自己的模型 (或者说只是在 reasoning 的某些环节使用了 finetune 的模型),核心的 reasoning 能力可能还是基于 GPT-4;

5. Devin 的演示中遇到了很多出现 error 需要 debug 的情况,这个相当于是在决策树中需要回退到某个节点,选择其他路径中的某一条,如何判断哪条路径后续是正确的?Devin 在演示的过程中有一个 keyError,解决的办法是添加一个 try catch 来捕获这个 error,这条决策路径不一定是对的,比如说如果前置的代码里面已经有这个 keyError 了,那么后面再捕获这个 error 就没有意义。如果是人来进行决策,就会对可能的清况有一个更详尽的分析 (或者说直觉);

6. 抛开各种营销号吸引眼球的标题,现在来说 Devin 代替开发者还太早,不过自动驾驶 Day 1 也不是能直接上路驾驶的,L5 级别的自动化软件开发一定是终局;

7. Devin 在用户交互上提供了一些新的探索,不再是调用外部的工具,而是自己维护了一套系统内的 shell, code editor, browser,这样的好处是可以自定义一套 DSL 来操作这些工具。但是如果考虑到现阶段没有办法实现完全的无干预 coding 的话,这套方案是和现在的整个 development workflow 脱离的。

------

一些私货:

1. Devv 最开始的愿景就是 Redefine development tools and achieve L5 level of automated software development. 为什么没有选择直接做一个 automated coding agent,就是因为当前的技术还不满足构建一个能够在生产环境使用的 coding agent,作为一家商业公司,这个路是很难直接走通的。Devv 的方法是先选择能够落地的、开发者日常最高频和刚需的信息检索这个场景去切入;

2. Devv Agent 当前的目标也不是做一个完全 automated 的 agent,而是在更好地辅助开发者去解决开发流程中遇到的问题,本质上还是在 copilot。

Jiayuan from devv.ai
OpenAI + Figure 最新成果

机器人在端到端神经网络上与人类对话:

→ OpenAI 提供视觉推理和语言理解
→ Figure 的神经网络提供快速、低等级、灵巧的机器人动作

视频无遥控操作,1 倍速。

Figure 的摄像头被喂入 OpenAI 大型视觉语言模型 (VLM)。

Figure 的神经网络还通过机器人上的摄像头以 10hz 的频率拍摄图像。

然后神经网络以 200hz 输出 24 个自由度的动作。

Domo 中展示的人工智能工作是由 Corey Lynch(刚加入)和 Toki Migimatsu 领导的。
昨天这张配图,很多人喜欢。
这是用很早之前哥飞跟大家介绍过的 https://ideogram.ai 做的,每天有免费25次使用,一次生成4张图,也就是每天可以从100张图里挑选自己想要的,够用了。
提示词我甚至直接用中文写的“漫画风格,治愈感觉,一个小果园,里边有小树苗也有结果的水果树”,这个AI画图工具前两周上线了1.0版本,可以优化提示词,最终花了四五次,我找到了这张我比较满意的图片。
Midjourney 刚发布了一致的角色功能。

现在你可以创建脸部、发型和风格一致的角色了。
老龄化、移民问题、不生孩子,机器人在一定程度上都能给出帮助。
接朋友的需求,她希望看看ai写前期分析报告能写成什么地步,题目是 ai pin为代表的 ai 硬件终端,对于移动应用市场的影响,要求是时间不超过3小时,必须内容准确和有信息来源。
这个近万字的分析内容花了不到2小时,ai 完成90%,内容质量我自己觉得比较满意。项目组成员包括 gpt4、perplexity、 kimichat 和我自己。编外成员包括monica 和秘塔。
【项目组工作流程】
1、让gpt4和 kimi完成分析和设计:针对人工智能和手机应用商店这个主题,你会做哪些构思和前期工作。对你上面的构思和前期工作,开始搜索,你会问搜索引擎哪些问题。
2、我统合问题,做了一些选择和补充。
3、把问题一个一个丢给perplexity,一键复制回答的内容和引用来源,统合到一个文档里面。稍微做了一些修改和位置的调整。
4、把所有的内容,丢给 kimi,让ta 基于内容出一个分析报告大纲。
5、让 kimi 根据大纲,基于内容,一个模块一个模块的输出。
6、把问题回答答案的应用链接,丢给 kimi,问模块还有没有补充和修改的地方。
7、最后修改语气,为更加专业和咨询报告风格。
Back to Top