关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
从Surge, Scale聊到我对数据行业的总体看法
Scale被Meta投资后,非常多人来咨询我对数据行业的看法。硅谷101在6.23这期视频中邀请我分析了几个关键问题,包括Alex为什么愿意加入Meta(感兴趣的朋友可以看看视频https://b23.tv/j4oAuYu)。昨天西元@西元Levy 又问我对Surge的看法,正好借此机会,我把大家最关心的几个问题系统整理一下,一并分享出来。
⚡️1. 关于数据行业,大家有两个常见的误解:
第一个误解是,AI行业不需要人工标注数据了。但实际上,即便在强化学习的时代,高质量的人类数据依然非常重要。过去几个月,国内自媒体有一大批唱衰Scale的言论,认为有了强化学习就不需要人工标注数据。但Surge的revenue直接用真金白银证明了这种说法是错误的。
第二个误解是,认为数据行业就是血汗工厂的人力密集型行业。但事实上它是一个很有技术含量的科技行业。Surge的CEO Edwin在访谈里提到了一些关键点:如何衡量数据质量,如何衡量工作质量,如何让平台高效运转,以及如何了解frontier model所需要的数据类型和格式。
⚡️2. 为什么数据标注依然是门好生意?
高质量的人工数据标注依然是一个极好的business,但竞争极其激烈。
首先,要在数据领域取得成功,公司必须以技术为核心导向。不管是Surge还是Scale,创始人都是MIT毕业的,员工也都是能够与大模型公司需求对话的人才。
其次,高质量数据的价格遵循非线性增长逻辑。高质量数据的价格可能不是普通数据的两倍,而是十倍、百倍的关系,很多人没有理解这一点。
第三,从公开信息可以看到,Meta同时使用了Surge和Scale,但在这种情况下,Meta还是选择对Scale进行大笔投资。这说明美国领先的模型公司非常重视人工标注的高质量数据,并不像自媒体圈狂欢时说的有了强化学习就不需要人工数据了。
第四,Edwin在talk中提到的许多要点——比如需要build的产品、API,需要与客户直接对话、快速响应数据需求——这些都是业内人士一直知道,但外界很少提及的practice。想做数据必须做最高质量的数据,这样才能赚到钱,而且能赚到非常多的钱,这一点其实跟大模型本身是一样的。
⚡️3. Surge和Scale的区别是什么?
首先,在谈区别之前,Surge和Scale是非常像的两家公司。都是MIT出身的技术背景创始人,团队都充满了MIT、哈佛、斯坦福的名校生。业务也都非常专注做数据,优先从产品技术角度去解决质量问题。创始人也都对人才质量有自己的理解和追求,Edwin在访谈中强调了高人效,Alex冒着政治不正确的风险提出不要DEI,要MEI (merit, excellence, and intelligence)。
那么,为什么Surge可以提供比Scale更高质量的数据?核心是因为数据需求在不停变化,Surge出现时正好赶上大模型浪潮,从第一天就专门针对大语言模型做优化。而Scale是从自动驾驶时期开始的,经历了从自动驾驶到电商分类,再到大模型,还包括国防部的各种项目等多次转向。
其次,Surge的处理能力其实是不够的,吃不下那么多订单。客观来说,现在整个行业对数据的需求太大了,以至于你能提供多少高质量的数据,模型公司就能吃下多少。即便Surge的处理量再翻十倍,行业还是能消化得下。
在Scale被Meta投资之后,Surge现在处于一个很好的位置,成为最大的第三方中立数据服务机构。但因为这个市场非常巨大,还在非常早期,变数会很多。Surge现在可能也想融资扩张。
Scale和行业内其他公司肯定也会继续有生意可以做。局面可能是这样:比如最优质的数据是100分,但实际上没有人能做到,Surge可能做到80分,Scale可能是75分。当80分的数据量不够时,并不是说行业就不需要75分的数据了。大家都在非常努力地想把数据再往前推进一点,而且这个标准随着大模型能力的提高在更加快速的的提高。
⚡️4. 谁能成为下一个(或XX领域的)Scale或Surge?
关于数据的话题,我还有一个观点要补充:最优秀的解决数据问题的团队,不是因为解决不了其他问题而退而求其次的团队,而是相信数据本身有价值的团队。
之前和不少国内VC交流,或者我了解的很多创业公司的做法,是想现在靠提供数据服务来养活自己,之后再做别的。我认为抱着这种想法的团队肯定做不好数据。
Scale被Meta投资后,非常多人来咨询我对数据行业的看法。硅谷101在6.23这期视频中邀请我分析了几个关键问题,包括Alex为什么愿意加入Meta(感兴趣的朋友可以看看视频https://b23.tv/j4oAuYu)。昨天西元@西元Levy 又问我对Surge的看法,正好借此机会,我把大家最关心的几个问题系统整理一下,一并分享出来。
⚡️1. 关于数据行业,大家有两个常见的误解:
第一个误解是,AI行业不需要人工标注数据了。但实际上,即便在强化学习的时代,高质量的人类数据依然非常重要。过去几个月,国内自媒体有一大批唱衰Scale的言论,认为有了强化学习就不需要人工标注数据。但Surge的revenue直接用真金白银证明了这种说法是错误的。
第二个误解是,认为数据行业就是血汗工厂的人力密集型行业。但事实上它是一个很有技术含量的科技行业。Surge的CEO Edwin在访谈里提到了一些关键点:如何衡量数据质量,如何衡量工作质量,如何让平台高效运转,以及如何了解frontier model所需要的数据类型和格式。
⚡️2. 为什么数据标注依然是门好生意?
高质量的人工数据标注依然是一个极好的business,但竞争极其激烈。
首先,要在数据领域取得成功,公司必须以技术为核心导向。不管是Surge还是Scale,创始人都是MIT毕业的,员工也都是能够与大模型公司需求对话的人才。
其次,高质量数据的价格遵循非线性增长逻辑。高质量数据的价格可能不是普通数据的两倍,而是十倍、百倍的关系,很多人没有理解这一点。
第三,从公开信息可以看到,Meta同时使用了Surge和Scale,但在这种情况下,Meta还是选择对Scale进行大笔投资。这说明美国领先的模型公司非常重视人工标注的高质量数据,并不像自媒体圈狂欢时说的有了强化学习就不需要人工数据了。
第四,Edwin在talk中提到的许多要点——比如需要build的产品、API,需要与客户直接对话、快速响应数据需求——这些都是业内人士一直知道,但外界很少提及的practice。想做数据必须做最高质量的数据,这样才能赚到钱,而且能赚到非常多的钱,这一点其实跟大模型本身是一样的。
⚡️3. Surge和Scale的区别是什么?
首先,在谈区别之前,Surge和Scale是非常像的两家公司。都是MIT出身的技术背景创始人,团队都充满了MIT、哈佛、斯坦福的名校生。业务也都非常专注做数据,优先从产品技术角度去解决质量问题。创始人也都对人才质量有自己的理解和追求,Edwin在访谈中强调了高人效,Alex冒着政治不正确的风险提出不要DEI,要MEI (merit, excellence, and intelligence)。
那么,为什么Surge可以提供比Scale更高质量的数据?核心是因为数据需求在不停变化,Surge出现时正好赶上大模型浪潮,从第一天就专门针对大语言模型做优化。而Scale是从自动驾驶时期开始的,经历了从自动驾驶到电商分类,再到大模型,还包括国防部的各种项目等多次转向。
其次,Surge的处理能力其实是不够的,吃不下那么多订单。客观来说,现在整个行业对数据的需求太大了,以至于你能提供多少高质量的数据,模型公司就能吃下多少。即便Surge的处理量再翻十倍,行业还是能消化得下。
在Scale被Meta投资之后,Surge现在处于一个很好的位置,成为最大的第三方中立数据服务机构。但因为这个市场非常巨大,还在非常早期,变数会很多。Surge现在可能也想融资扩张。
Scale和行业内其他公司肯定也会继续有生意可以做。局面可能是这样:比如最优质的数据是100分,但实际上没有人能做到,Surge可能做到80分,Scale可能是75分。当80分的数据量不够时,并不是说行业就不需要75分的数据了。大家都在非常努力地想把数据再往前推进一点,而且这个标准随着大模型能力的提高在更加快速的的提高。
⚡️4. 谁能成为下一个(或XX领域的)Scale或Surge?
关于数据的话题,我还有一个观点要补充:最优秀的解决数据问题的团队,不是因为解决不了其他问题而退而求其次的团队,而是相信数据本身有价值的团队。
之前和不少国内VC交流,或者我了解的很多创业公司的做法,是想现在靠提供数据服务来养活自己,之后再做别的。我认为抱着这种想法的团队肯定做不好数据。
✅豪礼大放送、高端嫩模、劳力士手表、奔驰E300等大礼等你来豪夺、首存日存彩金送不停
✅u存u提每日提款无上限,随便提、全球不限ip、免实名绑定手机号码、银行,大额出款无忧 (您的最佳选择,欢迎体验)
#亚洲顶级真人视讯博彩盘口!
🔥平台
📢重磅消息首存彩金一倍流水
首存1000送108+100
首存3000送238+188
首存5000送358+188
首存10000送528+188
首存30000送788+188
首存50000送1088+188
首存80000送1488+188
💖福利频道:@qsty8999
💖体育赛事推单:@QSTY988
💖午夜剧场:@madoudp9
💖vip客服专属热线,添加客服领取活动福利
双向用户点击:@qsty168168_bot
🌐注册网址: qs1848.cc
从市场数据来看,头部企业的扫地机器人毛利率相对较高,以下是具体情况:
•石头科技:2025年第一季度,石头科技综合毛利率为45.5%,其扫地机器人业务毛利率为52.07%,较上年同期下滑2.87个百分点。2024年,石头科技扫地机器人及配件的毛利率为53.07%,较2023年的54.9%有所下滑。
•科沃斯:2025年第一季度,科沃斯毛利率为49.7%,同比增长2.5个百分点,主要是由于T80、X8、X9等高毛利新品占比提升。2024年,科沃斯整体毛利率为46.5%,其中科沃斯品牌扫地机毛利率有所修复。
此外,
有数据显示扫地机器人线上渠道头部企业的毛利率通常在45%~55%。
加上了付费功能,用 Turbo 模式可以在线体验 GPT-OSS 模型,而且还支持搜索
就是这个试用额度实在少,一次搜索都没完成就要收费
本地跑是不收费的
今天来分享一个利用Claude Code快速建站并在谷歌上排名第一的商业化案例,非常有价值。
有个叫James的营销专家用Claude Code帮朋友的柴油卡车维修公司做了个网站,结果24小时内就在Google上排到了前三名,电话被打爆,赚了几千美元。
不同于其他人的点在于,他选择了一个看起来非常无聊的生意。
首先,什么叫无聊生意?
如果你现在去参加任何一个科技创业活动,大概率会听到这些词:AI Agent、大模型应用、自动化工作流、SaaS工具,这些都是听起来高大上,充满想象空间。
而无聊生意呢?
修空调、通下水道、换轮胎、修卡车,这些生意存在了几十年,技术含量看似不高,也不会有风投来追捧。
但James发现了一个有趣的现象:当一个卡车司机的车在高速公路上抛锚时,他不会打开ChatGPT询问"请推荐附近最优的维修方案",更不会在Cursor里调用Perplexity MCP来做决策分析。
他会做什么?
掏出手机,打开Google,搜索"附近柴油车维修",找个评价不错的,直接打电话。
让我们再回到James的具体操作上。
第一步:选择一个真正有需求的生意
James的朋友经营着一家小型货运公司,专门在查尔斯顿和夏洛特之间运货。因为用的是二手卡车,经常出故障,他就和一个当地的机械师建立了合作关系。
注意这个细节:这不是凭空想出来的需求,而是从实际痛点中发现的机会。
《精益创业》里有个概念叫"Customer Development",意思是创业想法应该来自于和客户的深度接触,而不是闭门造车。
James的朋友找到他说:"我懂运营,也有机械师资源,就是不会做网站和营销,要不要一起搞?"
James还提到了一个有趣的思维模型,叫"杠铃策略"(Barbell Strategy),这个概念来自纳西姆·塔勒布的《反脆弱》。
简单来说,就是把资源分配到两个极端:一端是高风险高回报的创新业务,另一端是稳定但无聊的传统业务。
James的逻辑也很有意思:如果2030年真的出现AGI,数字服务和SaaS可能会被彻底颠覆,但机器人上高速公路修卡车?至少5年内不太可能。
第二步:用AI重新定义传统营销
接下来的操作就精彩了。
传统上,如果你要给一个本地服务业做网站和SEO,流程是这样的:找设计公司做网站设计,找开发公司写代码,找SEO公司做优化。整个过程少则几个月,多则半年,花费几万到十几万不等。
James用Claude Code把这个过程压缩到了4个小时。
具体来说,他做了这么几件事:
1. 关键词研究
他直接问ChatGPT:"这是我的网站,帮我找25-50个关键词。"就这么简单。
很多人在这一步就想多了,什么搜索量、竞争度、KEI指数...这些在本地市场其实没那么重要。
为什么?因为本地市场的竞争对手可能连网站都10年没更新过。
《蓝海战略》里有一个观点:与其在红海里和巨头拼刺刀,不如找一个竞争不充分的蓝海。
而本地服务业就是典型的蓝海。
2. 技术优化
James让Claude Code做了一次"ultra think"(深度思考)级别的SEO审计。这个功能很有意思,相当于让AI花更多计算资源去分析问题。
Claude发现了一堆技术问题:没有robots.txt文件、加载速度慢、缺少schema标记等等。
然后呢?James就说了一个词:"Fix them"(修复它们)。
Claude就真的去修了。
3. 内容深度
这是最让我惊讶的部分,James没有做那种千篇一律的"我们提供XX服务"的页面,而是让Claude为每个地区都做了深度内容。
比如夏洛特的页面,不仅介绍服务,还会提到当地地标、NASCAR赛车文化对货运的影响、该地区卡车常见问题等等。
当你的竞争对手只有100字的服务介绍时,你提供2000字的深度内容,Google自然会认为你的页面更有价值。
第三步:多智能体协作
James还展示了一个高级技巧:让Claude Code同时运行多个子代理(sub-agents)。
比如,当他在主窗口继续优化网站时,他让三个子代理分别去:
● 寻找缺失的alt文本
● 分析竞争对手
● 识别其他SEO机会
结果是惊人的。
第二天,James的朋友电话就被打爆了,并且接下来几天的维修预约全部排满。
在Google搜索"mobile diesel mechanic Charlotte"(夏洛特移动柴油机械师),他们的网站排在前三。
要知道,有些竞争对手已经经营了20年。
这背后的原理是什么?
首先,大多数本地服务业的网站都是多年前做的,技术栈老旧,加载速度慢,移动端体验差。
James用最新的技术标准重做,立刻就有了优势。
其次,传统服务业网站的内容密度极低,James通过AI生成的深度内容,在信息量上形成了压倒性优势。
最后一点,就是本地搜索的特殊性。
Google的本地搜索算法和普通搜索不同,它更看重地理相关性、业务信息的完整性、用户体验(特别是移动端)以及页面加载速度。
James恰好把这些都做对了。
看到这里,你可能会想:这和我有什么关系?我既不懂SEO,也没有卡车维修的朋友。
让我们把这个案例抽象一下,James真正做的是什么?
第一点,发现技术洼地。
找到那些还没有被技术充分改造的领域,可能是你们公司某个还在用Excel管理的流程,可能是你们行业某个大家都觉得"就是这样"的痛点。
第二点,实现降维打击。
用高维度的工具去解决低维度的问题,就像用Claude Code去做传统的网站开发,效率差了不止一个数量级。
第三点,深度大于广度。
与其做一个覆盖全国的平台,不如深耕一个城市的一个细分市场。深度创造价值,不是广度。
换句话说,真正的机会不在于追逐最新最热的概念,而在于用最新的工具去解决最古老的问题。
无聊生意之所以无聊,恰恰是因为大多数聪明人看不上,但技术本身不是目的,解决问题才是。
正如James说的:"最大的鸿沟不是技术,而是不知道该问什么问题。"
有个叫James的营销专家用Claude Code帮朋友的柴油卡车维修公司做了个网站,结果24小时内就在Google上排到了前三名,电话被打爆,赚了几千美元。
不同于其他人的点在于,他选择了一个看起来非常无聊的生意。
首先,什么叫无聊生意?
如果你现在去参加任何一个科技创业活动,大概率会听到这些词:AI Agent、大模型应用、自动化工作流、SaaS工具,这些都是听起来高大上,充满想象空间。
而无聊生意呢?
修空调、通下水道、换轮胎、修卡车,这些生意存在了几十年,技术含量看似不高,也不会有风投来追捧。
但James发现了一个有趣的现象:当一个卡车司机的车在高速公路上抛锚时,他不会打开ChatGPT询问"请推荐附近最优的维修方案",更不会在Cursor里调用Perplexity MCP来做决策分析。
他会做什么?
掏出手机,打开Google,搜索"附近柴油车维修",找个评价不错的,直接打电话。
让我们再回到James的具体操作上。
第一步:选择一个真正有需求的生意
James的朋友经营着一家小型货运公司,专门在查尔斯顿和夏洛特之间运货。因为用的是二手卡车,经常出故障,他就和一个当地的机械师建立了合作关系。
注意这个细节:这不是凭空想出来的需求,而是从实际痛点中发现的机会。
《精益创业》里有个概念叫"Customer Development",意思是创业想法应该来自于和客户的深度接触,而不是闭门造车。
James的朋友找到他说:"我懂运营,也有机械师资源,就是不会做网站和营销,要不要一起搞?"
James还提到了一个有趣的思维模型,叫"杠铃策略"(Barbell Strategy),这个概念来自纳西姆·塔勒布的《反脆弱》。
简单来说,就是把资源分配到两个极端:一端是高风险高回报的创新业务,另一端是稳定但无聊的传统业务。
James的逻辑也很有意思:如果2030年真的出现AGI,数字服务和SaaS可能会被彻底颠覆,但机器人上高速公路修卡车?至少5年内不太可能。
第二步:用AI重新定义传统营销
接下来的操作就精彩了。
传统上,如果你要给一个本地服务业做网站和SEO,流程是这样的:找设计公司做网站设计,找开发公司写代码,找SEO公司做优化。整个过程少则几个月,多则半年,花费几万到十几万不等。
James用Claude Code把这个过程压缩到了4个小时。
具体来说,他做了这么几件事:
1. 关键词研究
他直接问ChatGPT:"这是我的网站,帮我找25-50个关键词。"就这么简单。
很多人在这一步就想多了,什么搜索量、竞争度、KEI指数...这些在本地市场其实没那么重要。
为什么?因为本地市场的竞争对手可能连网站都10年没更新过。
《蓝海战略》里有一个观点:与其在红海里和巨头拼刺刀,不如找一个竞争不充分的蓝海。
而本地服务业就是典型的蓝海。
2. 技术优化
James让Claude Code做了一次"ultra think"(深度思考)级别的SEO审计。这个功能很有意思,相当于让AI花更多计算资源去分析问题。
Claude发现了一堆技术问题:没有robots.txt文件、加载速度慢、缺少schema标记等等。
然后呢?James就说了一个词:"Fix them"(修复它们)。
Claude就真的去修了。
3. 内容深度
这是最让我惊讶的部分,James没有做那种千篇一律的"我们提供XX服务"的页面,而是让Claude为每个地区都做了深度内容。
比如夏洛特的页面,不仅介绍服务,还会提到当地地标、NASCAR赛车文化对货运的影响、该地区卡车常见问题等等。
当你的竞争对手只有100字的服务介绍时,你提供2000字的深度内容,Google自然会认为你的页面更有价值。
第三步:多智能体协作
James还展示了一个高级技巧:让Claude Code同时运行多个子代理(sub-agents)。
比如,当他在主窗口继续优化网站时,他让三个子代理分别去:
● 寻找缺失的alt文本
● 分析竞争对手
● 识别其他SEO机会
结果是惊人的。
第二天,James的朋友电话就被打爆了,并且接下来几天的维修预约全部排满。
在Google搜索"mobile diesel mechanic Charlotte"(夏洛特移动柴油机械师),他们的网站排在前三。
要知道,有些竞争对手已经经营了20年。
这背后的原理是什么?
首先,大多数本地服务业的网站都是多年前做的,技术栈老旧,加载速度慢,移动端体验差。
James用最新的技术标准重做,立刻就有了优势。
其次,传统服务业网站的内容密度极低,James通过AI生成的深度内容,在信息量上形成了压倒性优势。
最后一点,就是本地搜索的特殊性。
Google的本地搜索算法和普通搜索不同,它更看重地理相关性、业务信息的完整性、用户体验(特别是移动端)以及页面加载速度。
James恰好把这些都做对了。
看到这里,你可能会想:这和我有什么关系?我既不懂SEO,也没有卡车维修的朋友。
让我们把这个案例抽象一下,James真正做的是什么?
第一点,发现技术洼地。
找到那些还没有被技术充分改造的领域,可能是你们公司某个还在用Excel管理的流程,可能是你们行业某个大家都觉得"就是这样"的痛点。
第二点,实现降维打击。
用高维度的工具去解决低维度的问题,就像用Claude Code去做传统的网站开发,效率差了不止一个数量级。
第三点,深度大于广度。
与其做一个覆盖全国的平台,不如深耕一个城市的一个细分市场。深度创造价值,不是广度。
换句话说,真正的机会不在于追逐最新最热的概念,而在于用最新的工具去解决最古老的问题。
无聊生意之所以无聊,恰恰是因为大多数聪明人看不上,但技术本身不是目的,解决问题才是。
正如James说的:"最大的鸿沟不是技术,而是不知道该问什么问题。"
很奇怪的一点,人们看到一个产品
第一反应应该是,这个产品给用户带来了怎样的感受,解决了什么问题
而不应该是,这个产品用的是哪个模型
一个产品用什么模型有那么重要吗?
什么时候大家都不关注模型了
才是 AI 应用的时刻真的到了
第一反应应该是,这个产品给用户带来了怎样的感受,解决了什么问题
而不应该是,这个产品用的是哪个模型
一个产品用什么模型有那么重要吗?
什么时候大家都不关注模型了
才是 AI 应用的时刻真的到了
现在 AI 的发展已经到达了一个非常尴尬的时刻。
各种模型发布,提升微小,官方运营、kol、用户都快测不出区别了
各种创始人访谈,访谈都吹的天花乱坠,产品一发布完全不是一回事
各种教程,可能是最有用的内容了,但是太多了,根本学不过来。
圈内人,已经快跟不上了。
圈外人,就直接跳过了。
信息爆炸的结果,又回到了用户自己。
每个人只应该关注与自己相关的事情。
不要试图关注一切,也没有可能关注一切。
各种模型发布,提升微小,官方运营、kol、用户都快测不出区别了
各种创始人访谈,访谈都吹的天花乱坠,产品一发布完全不是一回事
各种教程,可能是最有用的内容了,但是太多了,根本学不过来。
圈内人,已经快跟不上了。
圈外人,就直接跳过了。
信息爆炸的结果,又回到了用户自己。
每个人只应该关注与自己相关的事情。
不要试图关注一切,也没有可能关注一切。