关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
经过一年多的锻炼,我终于不再怯于跟「硅谷/常青藤 AI 创业者们」沟通了。
过去的几年,我一直有个心结:
那就是,跟这帮背景好的人比,我在学校成绩不如人家,出来也混得不如人家。 再加上本身就内向,又不懂技术,所以很担心对方会看不起自己。
于是,每次跟他们沟通,我都特别紧张,时刻担心自己表现不好。
1、
毕业的前些年,确实混得贼不好。早期报名群响的时候,填完报名表,都没人愿意联系我。
现在仍然混得也不好,比如今晚聊的那位硅谷创业者,虽然跟我同一年从同一所学校毕业,但人家出完国就进了世界级大厂,干的都是影响几亿人的工作。几年前出来创业,已经融了不少钱。
不过,还是能跟他们聊得比较开心的。
原因在于,我也终于可以给他们提供点增量信息了(也就是,他们之前没听过,但确实会感兴趣的信息)。
最近一年多聊下来,发现我最能勾起他们兴趣的增量信息,一共分两种:水下信息和下沉市场。
2、水下信息
“水下”,是跟“水上”相对应的,所谓“水上信息”就是大家通过公开渠道可以搜索到的,比如各家大厂的产品或新闻。
所以,“水下信息”就是市面上搜不到的一些信息。它们真实发生过且影响过不少的人,但只在一些小圈子流传。比方说,某些国内真正赚到钱的“AI 团队”的生意模式。
“水下”,并不意味着上不得台面,更多属于闷声赚钱类型。赚钱的人,不一定愿意分享出来;外面的人,乍一看觉得不是多么高大上。
例如早期的微商,人家微信生态做得好,确实能提一辆车,但正经人都看不上,只在微商和流量玩家的小圈子里流传。
等到公域流量没有红利了,各家大厂也开始学微商的搞法,顺便搞造了个高大上的概念——“私域流量”。
3、下沉市场
下沉市场的信息,又至少可以分两类。
第一类是二三线以下城市的消费者的情况,比如短剧的核心受众。这类他们可能懂一些,但知道的肯定没我多。
因为我本就是西南少数民族地区出来的,又在 58 同城跟乡镇一级的代理们打过一年多的交道,更有切身体会。
第二类则是草根的创业者,他们不奢求融资,不玩高大上,更不会一上来就要造平台。
比如聊创作者经济,今晚的这位非草根的硅谷 AI 创业者,更多会是从平台的角度去分析,有很多基于 web3 的洞察,甚至会带入马化腾等巨头老板的视角。
但我更多会补充真实抖音草根创业者的做法,比方说早在 2020 年他们就不再盲目准求流量,而是争取来的第一个粉丝就会付费。
4、最后的话
在他们还可以聊梦想、谈高科技的时候,看到我还聊这么“LOW”的内容,他们多多少少会觉得高出我一头。
高就高吧,反正我不乐意参与这帮人的鄙视链游戏。因为我确实玩不过,也从来没玩过过。
随着融资越来越难,市场对创业者造血能力的要求,也越来越高了。
在这种时候,某些踏踏实实独立面向市场的能力,也未尝不是他们所缺失的。而这,也正是我得以跟他们平等交流的底气之一。
此外,对某一个事物的热爱,也是不会受鄙视链的影响的。无论彼此处于所谓鄙视链的哪个环节,只要是有共同的热爱,总是能找到畅聊的契机。
过去的几年,我一直有个心结:
那就是,跟这帮背景好的人比,我在学校成绩不如人家,出来也混得不如人家。 再加上本身就内向,又不懂技术,所以很担心对方会看不起自己。
于是,每次跟他们沟通,我都特别紧张,时刻担心自己表现不好。
1、
毕业的前些年,确实混得贼不好。早期报名群响的时候,填完报名表,都没人愿意联系我。
现在仍然混得也不好,比如今晚聊的那位硅谷创业者,虽然跟我同一年从同一所学校毕业,但人家出完国就进了世界级大厂,干的都是影响几亿人的工作。几年前出来创业,已经融了不少钱。
不过,还是能跟他们聊得比较开心的。
原因在于,我也终于可以给他们提供点增量信息了(也就是,他们之前没听过,但确实会感兴趣的信息)。
最近一年多聊下来,发现我最能勾起他们兴趣的增量信息,一共分两种:水下信息和下沉市场。
2、水下信息
“水下”,是跟“水上”相对应的,所谓“水上信息”就是大家通过公开渠道可以搜索到的,比如各家大厂的产品或新闻。
所以,“水下信息”就是市面上搜不到的一些信息。它们真实发生过且影响过不少的人,但只在一些小圈子流传。比方说,某些国内真正赚到钱的“AI 团队”的生意模式。
“水下”,并不意味着上不得台面,更多属于闷声赚钱类型。赚钱的人,不一定愿意分享出来;外面的人,乍一看觉得不是多么高大上。
例如早期的微商,人家微信生态做得好,确实能提一辆车,但正经人都看不上,只在微商和流量玩家的小圈子里流传。
等到公域流量没有红利了,各家大厂也开始学微商的搞法,顺便搞造了个高大上的概念——“私域流量”。
3、下沉市场
下沉市场的信息,又至少可以分两类。
第一类是二三线以下城市的消费者的情况,比如短剧的核心受众。这类他们可能懂一些,但知道的肯定没我多。
因为我本就是西南少数民族地区出来的,又在 58 同城跟乡镇一级的代理们打过一年多的交道,更有切身体会。
第二类则是草根的创业者,他们不奢求融资,不玩高大上,更不会一上来就要造平台。
比如聊创作者经济,今晚的这位非草根的硅谷 AI 创业者,更多会是从平台的角度去分析,有很多基于 web3 的洞察,甚至会带入马化腾等巨头老板的视角。
但我更多会补充真实抖音草根创业者的做法,比方说早在 2020 年他们就不再盲目准求流量,而是争取来的第一个粉丝就会付费。
4、最后的话
在他们还可以聊梦想、谈高科技的时候,看到我还聊这么“LOW”的内容,他们多多少少会觉得高出我一头。
高就高吧,反正我不乐意参与这帮人的鄙视链游戏。因为我确实玩不过,也从来没玩过过。
随着融资越来越难,市场对创业者造血能力的要求,也越来越高了。
在这种时候,某些踏踏实实独立面向市场的能力,也未尝不是他们所缺失的。而这,也正是我得以跟他们平等交流的底气之一。
此外,对某一个事物的热爱,也是不会受鄙视链的影响的。无论彼此处于所谓鄙视链的哪个环节,只要是有共同的热爱,总是能找到畅聊的契机。
英伟达黄仁勋近日在被问到自己偏爱哪款搜索引擎时表示:我一般会用Perplexity,而且机会每天在用。
不是google,也不是微软bing,一语激起千层浪。Perplexity是2022年才成立的AI搜索引擎,累计融资超1亿,固执高达5.2亿美元,目前MAU已经达到了1000万。
不是google,也不是微软bing,一语激起千层浪。Perplexity是2022年才成立的AI搜索引擎,累计融资超1亿,固执高达5.2亿美元,目前MAU已经达到了1000万。
尽管我们名单上超过30%的通用人工智能网络产品起源于湾区,但只有12%的移动应用程序开发者来自那里。同样,尽管超过一半的顶级通用人工智能网络产品是在美国开发的,但不到三分之一的移动应用程序起源于美国本土。
来源:https://a16z.com/100-gen-ai-apps/
来源:https://a16z.com/100-gen-ai-apps/
一些关于 Devin 的想法
很多投资人 & 行业内朋友都来询问怎么看待 Devin 这个产品,发布的第一时间就有关注,并且自己也在 building developer tools,所以来写一些简单的 comments,可能过段时间就打脸。
1. 我更倾向于把 Cognition Labs 这家公司看做是一家类似于 DeepMind 的研究型公司,而不是商业型公司,这两种公司的目标和愿景是不一样的;
2. Devin 发布的演示视频很惊艳,能够处理一些基本的 GitHub Issue,甚至能解决 Upwork 上实际的问题,但是对于更复杂的场景能够解决得多好现在还是未知的 (目前还没有拿到测试资本),SWE-bench 13% 的指标还是不能直接用在生产环境上 (无干预情况下);
3. 软件开发是一个复杂的系统性工程,实际的 coding 其实只占其中的很少一部分,理解需求、生成代码、Debugging、优化、部署等等涉及到非常多的环节;
4. Devin 演示的一个亮点是,它所展示的决策树很长 (按照 blog 中提到能有上千个决策节点),这个要求底层模型有非常强的 reasoning 能力和 long context window,目前看起来 Devin 应该并没有 train 自己的模型 (或者说只是在 reasoning 的某些环节使用了 finetune 的模型),核心的 reasoning 能力可能还是基于 GPT-4;
5. Devin 的演示中遇到了很多出现 error 需要 debug 的情况,这个相当于是在决策树中需要回退到某个节点,选择其他路径中的某一条,如何判断哪条路径后续是正确的?Devin 在演示的过程中有一个 keyError,解决的办法是添加一个 try catch 来捕获这个 error,这条决策路径不一定是对的,比如说如果前置的代码里面已经有这个 keyError 了,那么后面再捕获这个 error 就没有意义。如果是人来进行决策,就会对可能的清况有一个更详尽的分析 (或者说直觉);
6. 抛开各种营销号吸引眼球的标题,现在来说 Devin 代替开发者还太早,不过自动驾驶 Day 1 也不是能直接上路驾驶的,L5 级别的自动化软件开发一定是终局;
7. Devin 在用户交互上提供了一些新的探索,不再是调用外部的工具,而是自己维护了一套系统内的 shell, code editor, browser,这样的好处是可以自定义一套 DSL 来操作这些工具。但是如果考虑到现阶段没有办法实现完全的无干预 coding 的话,这套方案是和现在的整个 development workflow 脱离的。
------
一些私货:
1. Devv 最开始的愿景就是 Redefine development tools and achieve L5 level of automated software development. 为什么没有选择直接做一个 automated coding agent,就是因为当前的技术还不满足构建一个能够在生产环境使用的 coding agent,作为一家商业公司,这个路是很难直接走通的。Devv 的方法是先选择能够落地的、开发者日常最高频和刚需的信息检索这个场景去切入;
2. Devv Agent 当前的目标也不是做一个完全 automated 的 agent,而是在更好地辅助开发者去解决开发流程中遇到的问题,本质上还是在 copilot。
Jiayuan from devv.ai
很多投资人 & 行业内朋友都来询问怎么看待 Devin 这个产品,发布的第一时间就有关注,并且自己也在 building developer tools,所以来写一些简单的 comments,可能过段时间就打脸。
1. 我更倾向于把 Cognition Labs 这家公司看做是一家类似于 DeepMind 的研究型公司,而不是商业型公司,这两种公司的目标和愿景是不一样的;
2. Devin 发布的演示视频很惊艳,能够处理一些基本的 GitHub Issue,甚至能解决 Upwork 上实际的问题,但是对于更复杂的场景能够解决得多好现在还是未知的 (目前还没有拿到测试资本),SWE-bench 13% 的指标还是不能直接用在生产环境上 (无干预情况下);
3. 软件开发是一个复杂的系统性工程,实际的 coding 其实只占其中的很少一部分,理解需求、生成代码、Debugging、优化、部署等等涉及到非常多的环节;
4. Devin 演示的一个亮点是,它所展示的决策树很长 (按照 blog 中提到能有上千个决策节点),这个要求底层模型有非常强的 reasoning 能力和 long context window,目前看起来 Devin 应该并没有 train 自己的模型 (或者说只是在 reasoning 的某些环节使用了 finetune 的模型),核心的 reasoning 能力可能还是基于 GPT-4;
5. Devin 的演示中遇到了很多出现 error 需要 debug 的情况,这个相当于是在决策树中需要回退到某个节点,选择其他路径中的某一条,如何判断哪条路径后续是正确的?Devin 在演示的过程中有一个 keyError,解决的办法是添加一个 try catch 来捕获这个 error,这条决策路径不一定是对的,比如说如果前置的代码里面已经有这个 keyError 了,那么后面再捕获这个 error 就没有意义。如果是人来进行决策,就会对可能的清况有一个更详尽的分析 (或者说直觉);
6. 抛开各种营销号吸引眼球的标题,现在来说 Devin 代替开发者还太早,不过自动驾驶 Day 1 也不是能直接上路驾驶的,L5 级别的自动化软件开发一定是终局;
7. Devin 在用户交互上提供了一些新的探索,不再是调用外部的工具,而是自己维护了一套系统内的 shell, code editor, browser,这样的好处是可以自定义一套 DSL 来操作这些工具。但是如果考虑到现阶段没有办法实现完全的无干预 coding 的话,这套方案是和现在的整个 development workflow 脱离的。
------
一些私货:
1. Devv 最开始的愿景就是 Redefine development tools and achieve L5 level of automated software development. 为什么没有选择直接做一个 automated coding agent,就是因为当前的技术还不满足构建一个能够在生产环境使用的 coding agent,作为一家商业公司,这个路是很难直接走通的。Devv 的方法是先选择能够落地的、开发者日常最高频和刚需的信息检索这个场景去切入;
2. Devv Agent 当前的目标也不是做一个完全 automated 的 agent,而是在更好地辅助开发者去解决开发流程中遇到的问题,本质上还是在 copilot。
Jiayuan from devv.ai
OpenAI + Figure 最新成果
机器人在端到端神经网络上与人类对话:
→ OpenAI 提供视觉推理和语言理解
→ Figure 的神经网络提供快速、低等级、灵巧的机器人动作
视频无遥控操作,1 倍速。
Figure 的摄像头被喂入 OpenAI 大型视觉语言模型 (VLM)。
Figure 的神经网络还通过机器人上的摄像头以 10hz 的频率拍摄图像。
然后神经网络以 200hz 输出 24 个自由度的动作。
Domo 中展示的人工智能工作是由 Corey Lynch(刚加入)和 Toki Migimatsu 领导的。
机器人在端到端神经网络上与人类对话:
→ OpenAI 提供视觉推理和语言理解
→ Figure 的神经网络提供快速、低等级、灵巧的机器人动作
视频无遥控操作,1 倍速。
Figure 的摄像头被喂入 OpenAI 大型视觉语言模型 (VLM)。
Figure 的神经网络还通过机器人上的摄像头以 10hz 的频率拍摄图像。
然后神经网络以 200hz 输出 24 个自由度的动作。
Domo 中展示的人工智能工作是由 Corey Lynch(刚加入)和 Toki Migimatsu 领导的。
这是用很早之前哥飞跟大家介绍过的 https://ideogram.ai 做的,每天有免费25次使用,一次生成4张图,也就是每天可以从100张图里挑选自己想要的,够用了。
提示词我甚至直接用中文写的“漫画风格,治愈感觉,一个小果园,里边有小树苗也有结果的水果树”,这个AI画图工具前两周上线了1.0版本,可以优化提示词,最终花了四五次,我找到了这张我比较满意的图片。