关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
从Surge, Scale聊到我对数据行业的总体看法
Scale被Meta投资后,非常多人来咨询我对数据行业的看法。硅谷101在6.23这期视频中邀请我分析了几个关键问题,包括Alex为什么愿意加入Meta(感兴趣的朋友可以看看视频https://b23.tv/j4oAuYu)。昨天西元@西元Levy 又问我对Surge的看法,正好借此机会,我把大家最关心的几个问题系统整理一下,一并分享出来。
⚡️1. 关于数据行业,大家有两个常见的误解:
第一个误解是,AI行业不需要人工标注数据了。但实际上,即便在强化学习的时代,高质量的人类数据依然非常重要。过去几个月,国内自媒体有一大批唱衰Scale的言论,认为有了强化学习就不需要人工标注数据。但Surge的revenue直接用真金白银证明了这种说法是错误的。
第二个误解是,认为数据行业就是血汗工厂的人力密集型行业。但事实上它是一个很有技术含量的科技行业。Surge的CEO Edwin在访谈里提到了一些关键点:如何衡量数据质量,如何衡量工作质量,如何让平台高效运转,以及如何了解frontier model所需要的数据类型和格式。
⚡️2. 为什么数据标注依然是门好生意?
高质量的人工数据标注依然是一个极好的business,但竞争极其激烈。
首先,要在数据领域取得成功,公司必须以技术为核心导向。不管是Surge还是Scale,创始人都是MIT毕业的,员工也都是能够与大模型公司需求对话的人才。
其次,高质量数据的价格遵循非线性增长逻辑。高质量数据的价格可能不是普通数据的两倍,而是十倍、百倍的关系,很多人没有理解这一点。
第三,从公开信息可以看到,Meta同时使用了Surge和Scale,但在这种情况下,Meta还是选择对Scale进行大笔投资。这说明美国领先的模型公司非常重视人工标注的高质量数据,并不像自媒体圈狂欢时说的有了强化学习就不需要人工数据了。
第四,Edwin在talk中提到的许多要点——比如需要build的产品、API,需要与客户直接对话、快速响应数据需求——这些都是业内人士一直知道,但外界很少提及的practice。想做数据必须做最高质量的数据,这样才能赚到钱,而且能赚到非常多的钱,这一点其实跟大模型本身是一样的。
⚡️3. Surge和Scale的区别是什么?
首先,在谈区别之前,Surge和Scale是非常像的两家公司。都是MIT出身的技术背景创始人,团队都充满了MIT、哈佛、斯坦福的名校生。业务也都非常专注做数据,优先从产品技术角度去解决质量问题。创始人也都对人才质量有自己的理解和追求,Edwin在访谈中强调了高人效,Alex冒着政治不正确的风险提出不要DEI,要MEI (merit, excellence, and intelligence)。
那么,为什么Surge可以提供比Scale更高质量的数据?核心是因为数据需求在不停变化,Surge出现时正好赶上大模型浪潮,从第一天就专门针对大语言模型做优化。而Scale是从自动驾驶时期开始的,经历了从自动驾驶到电商分类,再到大模型,还包括国防部的各种项目等多次转向。
其次,Surge的处理能力其实是不够的,吃不下那么多订单。客观来说,现在整个行业对数据的需求太大了,以至于你能提供多少高质量的数据,模型公司就能吃下多少。即便Surge的处理量再翻十倍,行业还是能消化得下。
在Scale被Meta投资之后,Surge现在处于一个很好的位置,成为最大的第三方中立数据服务机构。但因为这个市场非常巨大,还在非常早期,变数会很多。Surge现在可能也想融资扩张。
Scale和行业内其他公司肯定也会继续有生意可以做。局面可能是这样:比如最优质的数据是100分,但实际上没有人能做到,Surge可能做到80分,Scale可能是75分。当80分的数据量不够时,并不是说行业就不需要75分的数据了。大家都在非常努力地想把数据再往前推进一点,而且这个标准随着大模型能力的提高在更加快速的的提高。
⚡️4. 谁能成为下一个(或XX领域的)Scale或Surge?
关于数据的话题,我还有一个观点要补充:最优秀的解决数据问题的团队,不是因为解决不了其他问题而退而求其次的团队,而是相信数据本身有价值的团队。
之前和不少国内VC交流,或者我了解的很多创业公司的做法,是想现在靠提供数据服务来养活自己,之后再做别的。我认为抱着这种想法的团队肯定做不好数据。
Scale被Meta投资后,非常多人来咨询我对数据行业的看法。硅谷101在6.23这期视频中邀请我分析了几个关键问题,包括Alex为什么愿意加入Meta(感兴趣的朋友可以看看视频https://b23.tv/j4oAuYu)。昨天西元@西元Levy 又问我对Surge的看法,正好借此机会,我把大家最关心的几个问题系统整理一下,一并分享出来。
⚡️1. 关于数据行业,大家有两个常见的误解:
第一个误解是,AI行业不需要人工标注数据了。但实际上,即便在强化学习的时代,高质量的人类数据依然非常重要。过去几个月,国内自媒体有一大批唱衰Scale的言论,认为有了强化学习就不需要人工标注数据。但Surge的revenue直接用真金白银证明了这种说法是错误的。
第二个误解是,认为数据行业就是血汗工厂的人力密集型行业。但事实上它是一个很有技术含量的科技行业。Surge的CEO Edwin在访谈里提到了一些关键点:如何衡量数据质量,如何衡量工作质量,如何让平台高效运转,以及如何了解frontier model所需要的数据类型和格式。
⚡️2. 为什么数据标注依然是门好生意?
高质量的人工数据标注依然是一个极好的business,但竞争极其激烈。
首先,要在数据领域取得成功,公司必须以技术为核心导向。不管是Surge还是Scale,创始人都是MIT毕业的,员工也都是能够与大模型公司需求对话的人才。
其次,高质量数据的价格遵循非线性增长逻辑。高质量数据的价格可能不是普通数据的两倍,而是十倍、百倍的关系,很多人没有理解这一点。
第三,从公开信息可以看到,Meta同时使用了Surge和Scale,但在这种情况下,Meta还是选择对Scale进行大笔投资。这说明美国领先的模型公司非常重视人工标注的高质量数据,并不像自媒体圈狂欢时说的有了强化学习就不需要人工数据了。
第四,Edwin在talk中提到的许多要点——比如需要build的产品、API,需要与客户直接对话、快速响应数据需求——这些都是业内人士一直知道,但外界很少提及的practice。想做数据必须做最高质量的数据,这样才能赚到钱,而且能赚到非常多的钱,这一点其实跟大模型本身是一样的。
⚡️3. Surge和Scale的区别是什么?
首先,在谈区别之前,Surge和Scale是非常像的两家公司。都是MIT出身的技术背景创始人,团队都充满了MIT、哈佛、斯坦福的名校生。业务也都非常专注做数据,优先从产品技术角度去解决质量问题。创始人也都对人才质量有自己的理解和追求,Edwin在访谈中强调了高人效,Alex冒着政治不正确的风险提出不要DEI,要MEI (merit, excellence, and intelligence)。
那么,为什么Surge可以提供比Scale更高质量的数据?核心是因为数据需求在不停变化,Surge出现时正好赶上大模型浪潮,从第一天就专门针对大语言模型做优化。而Scale是从自动驾驶时期开始的,经历了从自动驾驶到电商分类,再到大模型,还包括国防部的各种项目等多次转向。
其次,Surge的处理能力其实是不够的,吃不下那么多订单。客观来说,现在整个行业对数据的需求太大了,以至于你能提供多少高质量的数据,模型公司就能吃下多少。即便Surge的处理量再翻十倍,行业还是能消化得下。
在Scale被Meta投资之后,Surge现在处于一个很好的位置,成为最大的第三方中立数据服务机构。但因为这个市场非常巨大,还在非常早期,变数会很多。Surge现在可能也想融资扩张。
Scale和行业内其他公司肯定也会继续有生意可以做。局面可能是这样:比如最优质的数据是100分,但实际上没有人能做到,Surge可能做到80分,Scale可能是75分。当80分的数据量不够时,并不是说行业就不需要75分的数据了。大家都在非常努力地想把数据再往前推进一点,而且这个标准随着大模型能力的提高在更加快速的的提高。
⚡️4. 谁能成为下一个(或XX领域的)Scale或Surge?
关于数据的话题,我还有一个观点要补充:最优秀的解决数据问题的团队,不是因为解决不了其他问题而退而求其次的团队,而是相信数据本身有价值的团队。
之前和不少国内VC交流,或者我了解的很多创业公司的做法,是想现在靠提供数据服务来养活自己,之后再做别的。我认为抱着这种想法的团队肯定做不好数据。
✅豪礼大放送、高端嫩模、劳力士手表、奔驰E300等大礼等你来豪夺、首存日存彩金送不停
✅u存u提每日提款无上限,随便提、全球不限ip、免实名绑定手机号码、银行,大额出款无忧 (您的最佳选择,欢迎体验)
#亚洲顶级真人视讯博彩盘口!
🔥平台
📢重磅消息首存彩金一倍流水
首存1000送108+100
首存3000送238+188
首存5000送358+188
首存10000送528+188
首存30000送788+188
首存50000送1088+188
首存80000送1488+188
💖福利频道:@qsty8999
💖体育赛事推单:@QSTY988
💖午夜剧场:@madoudp9
💖vip客服专属热线,添加客服领取活动福利
双向用户点击:@qsty168168_bot
🌐注册网址: qs1848.cc
从市场数据来看,头部企业的扫地机器人毛利率相对较高,以下是具体情况:
•石头科技:2025年第一季度,石头科技综合毛利率为45.5%,其扫地机器人业务毛利率为52.07%,较上年同期下滑2.87个百分点。2024年,石头科技扫地机器人及配件的毛利率为53.07%,较2023年的54.9%有所下滑。
•科沃斯:2025年第一季度,科沃斯毛利率为49.7%,同比增长2.5个百分点,主要是由于T80、X8、X9等高毛利新品占比提升。2024年,科沃斯整体毛利率为46.5%,其中科沃斯品牌扫地机毛利率有所修复。
此外,
有数据显示扫地机器人线上渠道头部企业的毛利率通常在45%~55%。
加上了付费功能,用 Turbo 模式可以在线体验 GPT-OSS 模型,而且还支持搜索
就是这个试用额度实在少,一次搜索都没完成就要收费
本地跑是不收费的
今天来分享一个利用Claude Code快速建站并在谷歌上排名第一的商业化案例,非常有价值。
有个叫James的营销专家用Claude Code帮朋友的柴油卡车维修公司做了个网站,结果24小时内就在Google上排到了前三名,电话被打爆,赚了几千美元。
不同于其他人的点在于,他选择了一个看起来非常无聊的生意。
首先,什么叫无聊生意?
如果你现在去参加任何一个科技创业活动,大概率会听到这些词:AI Agent、大模型应用、自动化工作流、SaaS工具,这些都是听起来高大上,充满想象空间。
而无聊生意呢?
修空调、通下水道、换轮胎、修卡车,这些生意存在了几十年,技术含量看似不高,也不会有风投来追捧。
但James发现了一个有趣的现象:当一个卡车司机的车在高速公路上抛锚时,他不会打开ChatGPT询问"请推荐附近最优的维修方案",更不会在Cursor里调用Perplexity MCP来做决策分析。
他会做什么?
掏出手机,打开Google,搜索"附近柴油车维修",找个评价不错的,直接打电话。
让我们再回到James的具体操作上。
第一步:选择一个真正有需求的生意
James的朋友经营着一家小型货运公司,专门在查尔斯顿和夏洛特之间运货。因为用的是二手卡车,经常出故障,他就和一个当地的机械师建立了合作关系。
注意这个细节:这不是凭空想出来的需求,而是从实际痛点中发现的机会。
《精益创业》里有个概念叫"Customer Development",意思是创业想法应该来自于和客户的深度接触,而不是闭门造车。
James的朋友找到他说:"我懂运营,也有机械师资源,就是不会做网站和营销,要不要一起搞?"
James还提到了一个有趣的思维模型,叫"杠铃策略"(Barbell Strategy),这个概念来自纳西姆·塔勒布的《反脆弱》。
简单来说,就是把资源分配到两个极端:一端是高风险高回报的创新业务,另一端是稳定但无聊的传统业务。
James的逻辑也很有意思:如果2030年真的出现AGI,数字服务和SaaS可能会被彻底颠覆,但机器人上高速公路修卡车?至少5年内不太可能。
第二步:用AI重新定义传统营销
接下来的操作就精彩了。
传统上,如果你要给一个本地服务业做网站和SEO,流程是这样的:找设计公司做网站设计,找开发公司写代码,找SEO公司做优化。整个过程少则几个月,多则半年,花费几万到十几万不等。
James用Claude Code把这个过程压缩到了4个小时。
具体来说,他做了这么几件事:
1. 关键词研究
他直接问ChatGPT:"这是我的网站,帮我找25-50个关键词。"就这么简单。
很多人在这一步就想多了,什么搜索量、竞争度、KEI指数...这些在本地市场其实没那么重要。
为什么?因为本地市场的竞争对手可能连网站都10年没更新过。
《蓝海战略》里有一个观点:与其在红海里和巨头拼刺刀,不如找一个竞争不充分的蓝海。
而本地服务业就是典型的蓝海。
2. 技术优化
James让Claude Code做了一次"ultra think"(深度思考)级别的SEO审计。这个功能很有意思,相当于让AI花更多计算资源去分析问题。
Claude发现了一堆技术问题:没有robots.txt文件、加载速度慢、缺少schema标记等等。
然后呢?James就说了一个词:"Fix them"(修复它们)。
Claude就真的去修了。
3. 内容深度
这是最让我惊讶的部分,James没有做那种千篇一律的"我们提供XX服务"的页面,而是让Claude为每个地区都做了深度内容。
比如夏洛特的页面,不仅介绍服务,还会提到当地地标、NASCAR赛车文化对货运的影响、该地区卡车常见问题等等。
当你的竞争对手只有100字的服务介绍时,你提供2000字的深度内容,Google自然会认为你的页面更有价值。
第三步:多智能体协作
James还展示了一个高级技巧:让Claude Code同时运行多个子代理(sub-agents)。
比如,当他在主窗口继续优化网站时,他让三个子代理分别去:
● 寻找缺失的alt文本
● 分析竞争对手
● 识别其他SEO机会
结果是惊人的。
第二天,James的朋友电话就被打爆了,并且接下来几天的维修预约全部排满。
在Google搜索"mobile diesel mechanic Charlotte"(夏洛特移动柴油机械师),他们的网站排在前三。
要知道,有些竞争对手已经经营了20年。
这背后的原理是什么?
首先,大多数本地服务业的网站都是多年前做的,技术栈老旧,加载速度慢,移动端体验差。
James用最新的技术标准重做,立刻就有了优势。
其次,传统服务业网站的内容密度极低,James通过AI生成的深度内容,在信息量上形成了压倒性优势。
最后一点,就是本地搜索的特殊性。
Google的本地搜索算法和普通搜索不同,它更看重地理相关性、业务信息的完整性、用户体验(特别是移动端)以及页面加载速度。
James恰好把这些都做对了。
看到这里,你可能会想:这和我有什么关系?我既不懂SEO,也没有卡车维修的朋友。
让我们把这个案例抽象一下,James真正做的是什么?
第一点,发现技术洼地。
找到那些还没有被技术充分改造的领域,可能是你们公司某个还在用Excel管理的流程,可能是你们行业某个大家都觉得"就是这样"的痛点。
第二点,实现降维打击。
用高维度的工具去解决低维度的问题,就像用Claude Code去做传统的网站开发,效率差了不止一个数量级。
第三点,深度大于广度。
与其做一个覆盖全国的平台,不如深耕一个城市的一个细分市场。深度创造价值,不是广度。
换句话说,真正的机会不在于追逐最新最热的概念,而在于用最新的工具去解决最古老的问题。
无聊生意之所以无聊,恰恰是因为大多数聪明人看不上,但技术本身不是目的,解决问题才是。
正如James说的:"最大的鸿沟不是技术,而是不知道该问什么问题。"
有个叫James的营销专家用Claude Code帮朋友的柴油卡车维修公司做了个网站,结果24小时内就在Google上排到了前三名,电话被打爆,赚了几千美元。
不同于其他人的点在于,他选择了一个看起来非常无聊的生意。
首先,什么叫无聊生意?
如果你现在去参加任何一个科技创业活动,大概率会听到这些词:AI Agent、大模型应用、自动化工作流、SaaS工具,这些都是听起来高大上,充满想象空间。
而无聊生意呢?
修空调、通下水道、换轮胎、修卡车,这些生意存在了几十年,技术含量看似不高,也不会有风投来追捧。
但James发现了一个有趣的现象:当一个卡车司机的车在高速公路上抛锚时,他不会打开ChatGPT询问"请推荐附近最优的维修方案",更不会在Cursor里调用Perplexity MCP来做决策分析。
他会做什么?
掏出手机,打开Google,搜索"附近柴油车维修",找个评价不错的,直接打电话。
让我们再回到James的具体操作上。
第一步:选择一个真正有需求的生意
James的朋友经营着一家小型货运公司,专门在查尔斯顿和夏洛特之间运货。因为用的是二手卡车,经常出故障,他就和一个当地的机械师建立了合作关系。
注意这个细节:这不是凭空想出来的需求,而是从实际痛点中发现的机会。
《精益创业》里有个概念叫"Customer Development",意思是创业想法应该来自于和客户的深度接触,而不是闭门造车。
James的朋友找到他说:"我懂运营,也有机械师资源,就是不会做网站和营销,要不要一起搞?"
James还提到了一个有趣的思维模型,叫"杠铃策略"(Barbell Strategy),这个概念来自纳西姆·塔勒布的《反脆弱》。
简单来说,就是把资源分配到两个极端:一端是高风险高回报的创新业务,另一端是稳定但无聊的传统业务。
James的逻辑也很有意思:如果2030年真的出现AGI,数字服务和SaaS可能会被彻底颠覆,但机器人上高速公路修卡车?至少5年内不太可能。
第二步:用AI重新定义传统营销
接下来的操作就精彩了。
传统上,如果你要给一个本地服务业做网站和SEO,流程是这样的:找设计公司做网站设计,找开发公司写代码,找SEO公司做优化。整个过程少则几个月,多则半年,花费几万到十几万不等。
James用Claude Code把这个过程压缩到了4个小时。
具体来说,他做了这么几件事:
1. 关键词研究
他直接问ChatGPT:"这是我的网站,帮我找25-50个关键词。"就这么简单。
很多人在这一步就想多了,什么搜索量、竞争度、KEI指数...这些在本地市场其实没那么重要。
为什么?因为本地市场的竞争对手可能连网站都10年没更新过。
《蓝海战略》里有一个观点:与其在红海里和巨头拼刺刀,不如找一个竞争不充分的蓝海。
而本地服务业就是典型的蓝海。
2. 技术优化
James让Claude Code做了一次"ultra think"(深度思考)级别的SEO审计。这个功能很有意思,相当于让AI花更多计算资源去分析问题。
Claude发现了一堆技术问题:没有robots.txt文件、加载速度慢、缺少schema标记等等。
然后呢?James就说了一个词:"Fix them"(修复它们)。
Claude就真的去修了。
3. 内容深度
这是最让我惊讶的部分,James没有做那种千篇一律的"我们提供XX服务"的页面,而是让Claude为每个地区都做了深度内容。
比如夏洛特的页面,不仅介绍服务,还会提到当地地标、NASCAR赛车文化对货运的影响、该地区卡车常见问题等等。
当你的竞争对手只有100字的服务介绍时,你提供2000字的深度内容,Google自然会认为你的页面更有价值。
第三步:多智能体协作
James还展示了一个高级技巧:让Claude Code同时运行多个子代理(sub-agents)。
比如,当他在主窗口继续优化网站时,他让三个子代理分别去:
● 寻找缺失的alt文本
● 分析竞争对手
● 识别其他SEO机会
结果是惊人的。
第二天,James的朋友电话就被打爆了,并且接下来几天的维修预约全部排满。
在Google搜索"mobile diesel mechanic Charlotte"(夏洛特移动柴油机械师),他们的网站排在前三。
要知道,有些竞争对手已经经营了20年。
这背后的原理是什么?
首先,大多数本地服务业的网站都是多年前做的,技术栈老旧,加载速度慢,移动端体验差。
James用最新的技术标准重做,立刻就有了优势。
其次,传统服务业网站的内容密度极低,James通过AI生成的深度内容,在信息量上形成了压倒性优势。
最后一点,就是本地搜索的特殊性。
Google的本地搜索算法和普通搜索不同,它更看重地理相关性、业务信息的完整性、用户体验(特别是移动端)以及页面加载速度。
James恰好把这些都做对了。
看到这里,你可能会想:这和我有什么关系?我既不懂SEO,也没有卡车维修的朋友。
让我们把这个案例抽象一下,James真正做的是什么?
第一点,发现技术洼地。
找到那些还没有被技术充分改造的领域,可能是你们公司某个还在用Excel管理的流程,可能是你们行业某个大家都觉得"就是这样"的痛点。
第二点,实现降维打击。
用高维度的工具去解决低维度的问题,就像用Claude Code去做传统的网站开发,效率差了不止一个数量级。
第三点,深度大于广度。
与其做一个覆盖全国的平台,不如深耕一个城市的一个细分市场。深度创造价值,不是广度。
换句话说,真正的机会不在于追逐最新最热的概念,而在于用最新的工具去解决最古老的问题。
无聊生意之所以无聊,恰恰是因为大多数聪明人看不上,但技术本身不是目的,解决问题才是。
正如James说的:"最大的鸿沟不是技术,而是不知道该问什么问题。"