关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
从Surge, Scale聊到我对数据行业的总体看法

Scale被Meta投资后,非常多人来咨询我对数据行业的看法。硅谷101在6.23这期视频中邀请我分析了几个关键问题,包括Alex为什么愿意加入Meta(感兴趣的朋友可以看看视频https://b23.tv/j4oAuYu)。昨天西元@西元Levy 又问我对Surge的看法,正好借此机会,我把大家最关心的几个问题系统整理一下,一并分享出来。

⚡️1. 关于数据行业,大家有两个常见的误解:

第一个误解是,AI行业不需要人工标注数据了。但实际上,即便在强化学习的时代,高质量的人类数据依然非常重要。过去几个月,国内自媒体有一大批唱衰Scale的言论,认为有了强化学习就不需要人工标注数据。但Surge的revenue直接用真金白银证明了这种说法是错误的。

第二个误解是,认为数据行业就是血汗工厂的人力密集型行业。但事实上它是一个很有技术含量的科技行业。Surge的CEO Edwin在访谈里提到了一些关键点:如何衡量数据质量,如何衡量工作质量,如何让平台高效运转,以及如何了解frontier model所需要的数据类型和格式。

⚡️2. 为什么数据标注依然是门好生意?

高质量的人工数据标注依然是一个极好的business,但竞争极其激烈。

首先,要在数据领域取得成功,公司必须以技术为核心导向。不管是Surge还是Scale,创始人都是MIT毕业的,员工也都是能够与大模型公司需求对话的人才。

其次,高质量数据的价格遵循非线性增长逻辑。高质量数据的价格可能不是普通数据的两倍,而是十倍、百倍的关系,很多人没有理解这一点。

第三,从公开信息可以看到,Meta同时使用了Surge和Scale,但在这种情况下,Meta还是选择对Scale进行大笔投资。这说明美国领先的模型公司非常重视人工标注的高质量数据,并不像自媒体圈狂欢时说的有了强化学习就不需要人工数据了。

第四,Edwin在talk中提到的许多要点——比如需要build的产品、API,需要与客户直接对话、快速响应数据需求——这些都是业内人士一直知道,但外界很少提及的practice。想做数据必须做最高质量的数据,这样才能赚到钱,而且能赚到非常多的钱,这一点其实跟大模型本身是一样的。

⚡️3. Surge和Scale的区别是什么?

首先,在谈区别之前,Surge和Scale是非常像的两家公司。都是MIT出身的技术背景创始人,团队都充满了MIT、哈佛、斯坦福的名校生。业务也都非常专注做数据,优先从产品技术角度去解决质量问题。创始人也都对人才质量有自己的理解和追求,Edwin在访谈中强调了高人效,Alex冒着政治不正确的风险提出不要DEI,要MEI (merit, excellence, and intelligence)。

那么,为什么Surge可以提供比Scale更高质量的数据?核心是因为数据需求在不停变化,Surge出现时正好赶上大模型浪潮,从第一天就专门针对大语言模型做优化。而Scale是从自动驾驶时期开始的,经历了从自动驾驶到电商分类,再到大模型,还包括国防部的各种项目等多次转向。

其次,Surge的处理能力其实是不够的,吃不下那么多订单。客观来说,现在整个行业对数据的需求太大了,以至于你能提供多少高质量的数据,模型公司就能吃下多少。即便Surge的处理量再翻十倍,行业还是能消化得下。

在Scale被Meta投资之后,Surge现在处于一个很好的位置,成为最大的第三方中立数据服务机构。但因为这个市场非常巨大,还在非常早期,变数会很多。Surge现在可能也想融资扩张。

Scale和行业内其他公司肯定也会继续有生意可以做。局面可能是这样:比如最优质的数据是100分,但实际上没有人能做到,Surge可能做到80分,Scale可能是75分。当80分的数据量不够时,并不是说行业就不需要75分的数据了。大家都在非常努力地想把数据再往前推进一点,而且这个标准随着大模型能力的提高在更加快速的的提高。

⚡️4. 谁能成为下一个(或XX领域的)Scale或Surge?

关于数据的话题,我还有一个观点要补充:最优秀的解决数据问题的团队,不是因为解决不了其他问题而退而求其次的团队,而是相信数据本身有价值的团队。

之前和不少国内VC交流,或者我了解的很多创业公司的做法,是想现在靠提供数据服务来养活自己,之后再做别的。我认为抱着这种想法的团队肯定做不好数据。
❤️❤️🔥❤️😁 ❤️❤️❤️❤️❤️#PG电子 #真人百家乐 东南亚最大线上博彩平台 8️⃣ 8️⃣ 8️⃣


豪礼大放送
高端嫩模、劳力士手表、奔驰E300等大礼等你来豪夺、首存日存彩金送不停

🪙点击:泰国大老板百家乐存50万出512万 查看记录
🪙点击:反水11000出款74万史无前例查看记录
🪙点击:柬埔寨大盘总喜提42万u查看记录
🪙点击:充值30万总提款164万轻轻松松实现财富自由
🪙点击单笔提款530万全网独一档查看记录
🪙点击千万备用金、大额出款无忧查看记录

u存u提每日提款无上限,随便提、全球不限ip、免实名绑定手机号码、银行,大额出款无忧 (您的最佳选择,欢迎体验)

#亚洲顶级真人视讯博彩盘口!❤️❤️❤️ ❤️❤️❤️ ❤️❤️❤️ ❤️❤️❤️ ❤️❤️❤️ ❤️❤️❤️ ❤️❤️❤️

🔥平台😁😀 😙😏 😚🙁 😛☺️ 😉😋以及多种电子钱包存取款。东南亚国家地区 不限ip  U存U取(无须实名)

📢重磅消息首存彩金一倍流水
首存1000送108+100
首存3000送238+188
首存5000送358+188
首存10000送528+188
首存30000送788+188
首存50000送1088+188
首存80000送1488+188


💖福利频道:@qsty8999
💖体育赛事推单:
@QSTY988
💖午夜剧场:
@madoudp9

💖vip客服专属热线,添加客服领取活动福利
❤️❤️❤️❤️❤️@QSTY567
双向用户点击:@qsty168168_bot

🌐注册网址: qs1848.cc
❤️❤️❤️❤️❤️❤️❤️❤️❤️❤️❤️🔥❤️❤️
Media is too big
VIEW IN TELEGRAM
扫地机器人的毛利率因品牌、市场竞争、产品定位及成本控制等因素而有所不同。
从市场数据来看,头部企业的扫地机器人毛利率相对较高,以下是具体情况:

•石头科技:2025年第一季度,石头科技综合毛利率为45.5%,其扫地机器人业务毛利率为52.07%,较上年同期下滑2.87个百分点。2024年,石头科技扫地机器人及配件的毛利率为53.07%,较2023年的54.9%有所下滑。

•科沃斯:2025年第一季度,科沃斯毛利率为49.7%,同比增长2.5个百分点,主要是由于T80、X8、X9等高毛利新品占比提升。2024年,科沃斯整体毛利率为46.5%,其中科沃斯品牌扫地机毛利率有所修复。

此外,
有数据显示扫地机器人线上渠道头部企业的毛利率通常在45%~55%。
哈哈,刚才玩即梦又整出了好玩的!

这样做 PPT 也太牛皮了,高级而且准确的表达你的信息

一些观点列举的封面非常适合这种形式
哈哈,刚才玩即梦又整出了好玩的!#ai画图#

这样做 PPT 也太牛皮了,高级而且准确的表达你的信息

一些观点列举的封面非常适合这种形式
有意思 Ollama 这个客户端更新挺快啊#ai创造营#

加上了付费功能,用 Turbo 模式可以在线体验 GPT-OSS 模型,而且还支持搜索

就是这个试用额度实在少,一次搜索都没完成就要收费

本地跑是不收费的
去年见到的傅利叶机器人还是冰冷的金属外壳,今年就这么可爱了,宝宝你是香香软软电饭煲🤤ps发起讨论,给机器人做皮肤的难度怎么判断?
今天来分享一个利用Claude Code快速建站并在谷歌上排名第一的商业化案例,非常有价值。

有个叫James的营销专家用Claude Code帮朋友的柴油卡车维修公司做了个网站,结果24小时内就在Google上排到了前三名,电话被打爆,赚了几千美元。

不同于其他人的点在于,他选择了一个看起来非常无聊的生意。

首先,什么叫无聊生意?
如果你现在去参加任何一个科技创业活动,大概率会听到这些词:AI Agent、大模型应用、自动化工作流、SaaS工具,这些都是听起来高大上,充满想象空间。

而无聊生意呢?
修空调、通下水道、换轮胎、修卡车,这些生意存在了几十年,技术含量看似不高,也不会有风投来追捧。

但James发现了一个有趣的现象:当一个卡车司机的车在高速公路上抛锚时,他不会打开ChatGPT询问"请推荐附近最优的维修方案",更不会在Cursor里调用Perplexity MCP来做决策分析。

他会做什么?
掏出手机,打开Google,搜索"附近柴油车维修",找个评价不错的,直接打电话。

让我们再回到James的具体操作上。

第一步:选择一个真正有需求的生意
James的朋友经营着一家小型货运公司,专门在查尔斯顿和夏洛特之间运货。因为用的是二手卡车,经常出故障,他就和一个当地的机械师建立了合作关系。

注意这个细节:这不是凭空想出来的需求,而是从实际痛点中发现的机会。

《精益创业》里有个概念叫"Customer Development",意思是创业想法应该来自于和客户的深度接触,而不是闭门造车。
James的朋友找到他说:"我懂运营,也有机械师资源,就是不会做网站和营销,要不要一起搞?"

James还提到了一个有趣的思维模型,叫"杠铃策略"(Barbell Strategy),这个概念来自纳西姆·塔勒布的《反脆弱》。
简单来说,就是把资源分配到两个极端:一端是高风险高回报的创新业务,另一端是稳定但无聊的传统业务。

James的逻辑也很有意思:如果2030年真的出现AGI,数字服务和SaaS可能会被彻底颠覆,但机器人上高速公路修卡车?至少5年内不太可能。

第二步:用AI重新定义传统营销

接下来的操作就精彩了。
传统上,如果你要给一个本地服务业做网站和SEO,流程是这样的:找设计公司做网站设计,找开发公司写代码,找SEO公司做优化。整个过程少则几个月,多则半年,花费几万到十几万不等。
James用Claude Code把这个过程压缩到了4个小时。

具体来说,他做了这么几件事:
1. 关键词研究
他直接问ChatGPT:"这是我的网站,帮我找25-50个关键词。"就这么简单。

很多人在这一步就想多了,什么搜索量、竞争度、KEI指数...这些在本地市场其实没那么重要。

为什么?因为本地市场的竞争对手可能连网站都10年没更新过。

《蓝海战略》里有一个观点:与其在红海里和巨头拼刺刀,不如找一个竞争不充分的蓝海。
而本地服务业就是典型的蓝海。

2. 技术优化
James让Claude Code做了一次"ultra think"(深度思考)级别的SEO审计。这个功能很有意思,相当于让AI花更多计算资源去分析问题。

Claude发现了一堆技术问题:没有robots.txt文件、加载速度慢、缺少schema标记等等。
然后呢?James就说了一个词:"Fix them"(修复它们)。
Claude就真的去修了。

3. 内容深度
这是最让我惊讶的部分,James没有做那种千篇一律的"我们提供XX服务"的页面,而是让Claude为每个地区都做了深度内容。

比如夏洛特的页面,不仅介绍服务,还会提到当地地标、NASCAR赛车文化对货运的影响、该地区卡车常见问题等等。
当你的竞争对手只有100字的服务介绍时,你提供2000字的深度内容,Google自然会认为你的页面更有价值。

第三步:多智能体协作
James还展示了一个高级技巧:让Claude Code同时运行多个子代理(sub-agents)。
比如,当他在主窗口继续优化网站时,他让三个子代理分别去:
● 寻找缺失的alt文本
● 分析竞争对手
● 识别其他SEO机会

结果是惊人的。
第二天,James的朋友电话就被打爆了,并且接下来几天的维修预约全部排满。
在Google搜索"mobile diesel mechanic Charlotte"(夏洛特移动柴油机械师),他们的网站排在前三。

要知道,有些竞争对手已经经营了20年。

这背后的原理是什么?
首先,大多数本地服务业的网站都是多年前做的,技术栈老旧,加载速度慢,移动端体验差。
James用最新的技术标准重做,立刻就有了优势。

其次,传统服务业网站的内容密度极低,James通过AI生成的深度内容,在信息量上形成了压倒性优势。

最后一点,就是本地搜索的特殊性。
Google的本地搜索算法和普通搜索不同,它更看重地理相关性、业务信息的完整性、用户体验(特别是移动端)以及页面加载速度。
James恰好把这些都做对了。

看到这里,你可能会想:这和我有什么关系?我既不懂SEO,也没有卡车维修的朋友。

让我们把这个案例抽象一下,James真正做的是什么?
第一点,发现技术洼地。
找到那些还没有被技术充分改造的领域,可能是你们公司某个还在用Excel管理的流程,可能是你们行业某个大家都觉得"就是这样"的痛点。

第二点,实现降维打击。
用高维度的工具去解决低维度的问题,就像用Claude Code去做传统的网站开发,效率差了不止一个数量级。

第三点,深度大于广度。
与其做一个覆盖全国的平台,不如深耕一个城市的一个细分市场。深度创造价值,不是广度。

换句话说,真正的机会不在于追逐最新最热的概念,而在于用最新的工具去解决最古老的问题。
无聊生意之所以无聊,恰恰是因为大多数聪明人看不上,但技术本身不是目的,解决问题才是。

正如James说的:"最大的鸿沟不是技术,而是不知道该问什么问题。"
很奇怪的一点,人们看到一个产品
第一反应应该是,这个产品给用户带来了怎样的感受,解决了什么问题
而不应该是,这个产品用的是哪个模型
一个产品用什么模型有那么重要吗?
什么时候大家都不关注模型了
才是 AI 应用的时刻真的到了
现在 AI 的发展已经到达了一个非常尴尬的时刻。
各种模型发布,提升微小,官方运营、kol、用户都快测不出区别了
各种创始人访谈,访谈都吹的天花乱坠,产品一发布完全不是一回事
各种教程,可能是最有用的内容了,但是太多了,根本学不过来。
圈内人,已经快跟不上了。
圈外人,就直接跳过了。
信息爆炸的结果,又回到了用户自己。
每个人只应该关注与自己相关的事情。
不要试图关注一切,也没有可能关注一切。
昨晚 Open AI 居然发布的是开源模型就是前几天泄露的 gpt-oss-120b 和 gpt-oss-20b

Gpt-oss-120b 大致相当于 OpenAI o4-mini,20B 的相当于 o3-mini

120B 需要 80G 显存推理,20B 只需要 16G 显存设备。

目前你知道的所有 LLM 周边生态都已经支持这两个模型,比如 ollama 这种

架构与技术细节:

均为 Transformer 架构,采用专家混合(MoE)技术,提升推理效率。
gpt-oss-120b:36 层,1170 亿参数,每个 token 激活 51 亿参数,128 个专家,每 token 激活 4 个专家。
gpt-oss-20b:24 层,210 亿参数,每个 token 激活 36 亿参数,32 个专家,每 token 激活 4 个专家。
支持分组多查询注意力(grouped multi-query attention)、RoPE 位置编码,原生支持超长上下文。
训练数据以高质量英文纯文本为主,重点覆盖 STEM、编程和通用知识。

训练与后训练:

采用与 o4-mini 类似的后训练流程,包括监督微调和强化学习阶段。
支持三档推理强度(低、中、高),可通过系统消息灵活设置,兼顾延迟和性能。
具备强大的指令执行、工具调用(如网页搜索、Python 代码执行)和推理能力。

开源与生态:

权重已在 Hugging Face 免费开放下载,支持 MXFP4 量化格式,便于本地和多平台部署。
提供 Harmony 提示格式、Python/Rust 渲染器、PyTorch/Metal 参考实现和示例工具。
与 Hugging Face、Azure、Ollama、AWS、Cloudflare 等主流平台合作,优化多硬件支持。
Windows 设备有专门的 GPU 优化版本,支持本地推理和开发。
Back to Top