关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
这一思路帮助团队避免在过快迭代的基础设施上投入过深,同时让产品能够「踩准节拍」地吃到每一波模型红利。
评测即训练:
自对抗曲线的正反馈,Game Arena 体现了「让评测成为驱动器」的策略:
把模型置于互博环境,通过 Elo 或胜率即时量化实力;
任务难度随着排名自动提高,模型若要保级必须进化;
研究者可观察「拐点」位置以定位能力瓶颈,再定向优化。
如此一来,评测与训练不再割裂;模型越强,环境越苛刻,形成螺旋式上升。这不仅减轻了人工出题负担,也让能力边界持续被刷新。
评测即训练:
自对抗曲线的正反馈,Game Arena 体现了「让评测成为驱动器」的策略:
把模型置于互博环境,通过 Elo 或胜率即时量化实力;
任务难度随着排名自动提高,模型若要保级必须进化;
研究者可观察「拐点」位置以定位能力瓶颈,再定向优化。
如此一来,评测与训练不再割裂;模型越强,环境越苛刻,形成螺旋式上升。这不仅减轻了人工出题负担,也让能力边界持续被刷新。
-Genie 3 世界模型的信息
-通往 AGI 的路径
- 产品迭代方法
- 模型评估策略
干货挺多的,我总结了一下:
迈向 AGI 的路径拆分为模型、评测、工具三个相互强化的支点:
模型:在基础网络中引入显式「思考」与「世界模型」,通过多模态互补、规划搜索和自监督,对感知与推理进行一体化表征。
评测:从静态数据集转向动态、自适应、对抗性环境,让基准能随能力提升而自动升级难度,并覆盖物理直觉与安全性维度。
工具:把外部算力与专用子模型视为「延伸器官」,允许主模型在推理过程中即时调用,并通过代理调度形成系统级闭环。
这三者缺一不可:没有强模型,再复杂的评测只是「秀场」;没有合适的测评,模型无法有针对性地优化;缺少工具链则会让模型陷入「闭门造车」。这一三角形心智模型为 DeepMind 制定路线图提供了结构化的思考框架。
Genie 3 引出一种「内化现实」的方法论:
不再单纯追求图像或文字的表层相似度,而是要求模型在潜在空间建立对物理规律、材料属性、时间连续性的因果图谱。训练流程可按以下逻辑拆解:
从高保真模拟环境中收集具备物理一致性的多模态数据(视觉、深度、动作);
通过自监督损失逼迫网络同时最小化预测下一帧像素和保持对象持久性;
在推理阶段反向使用该世界模型生成新场景,验证其自洽性;
利用外部 Agent 在生成世界中完成任务,进一步采样「硬例」细化模型。
这一框架的核心心智在于:只有当 AI 能「想象」世界并用行动检验想象,才算真正理解世界。团队接下来的重点将是降低推理成本以开放给更多外部开发者,同时设计版本管理与重现机制,确保优秀关卡能被社区反复分享且状态一致 .
产品设计需要前瞻性:
与指数级底座赛跑,对创业者而言,底层模型更新速度已逼近「双周级」,传统瀑布式需求规划难以跟上。Demis 提供了如下心智模型:
以「能力预测表」替代「需求列表」:先列出未来 12 个月大模型大概率将具备的 API 与思考能力,再反推用户体验。
设计「可撤换引擎」:核心逻辑应与模型调用松耦合,后端一旦升级仅需调整提示词或调用格式。
构建「不可平替」价值层」:把精力投入模型短期内难以原生支持的环节,如高精度数据管道、合规策略或领域知识图谱。
同时 Microsoft 正把 GitHub 合并进 CoreAI 团队。#ai创造营#
Microsoft 的 CoreAI 团队是由前 Meta 高管 Jay Parikh 领导的新工程小组。
这老哥不会要离职之后再造一个新的 AI github 吧
Avneesh在不同阶段有不同目标。早期他在Reddit的每周问答帖里征求反馈,连续发了三个多月,这些反馈直接指导了产品开发。
产品成熟后,他才开始引流。
第四步:设置关键词提醒。
他用了一个叫F5bot的工具,设置关键词提醒。
只要有人在Reddit上提到这几个关键词时,他就会收到邮件,然后他就会去阅读Reddit和Facebook上的整个帖子,看看是否有机会获得关于他正在构建的产品的反馈,或者更好地了解他的目标用户群的需求和愿望。
这个方法的妙处在于,你总能在最合适的时机出现。
比如有人问"怎么赚信用卡积分",你马上就能出现提供帮助。
这不是广告,是雪中送炭。
第五步:先给予,后索取。这是整个策略的精髓。
Avneesh用SQL查询整理了一份优惠信息表格,免费分享给Facebook群组。
表格里有各个商家的返现比例、信用卡优惠等信息。群友打开表格,看到这些有用的信息,顺便注意到数据来源是他的网站。
就这一个帖子,带来了1500多个访问。
这个过程特别像爬山,你不会一开始就冲顶,而是先适应海拔,逐步攀登。
Avneesh先在评论区活跃了三个多月。每周的问答帖,他都会参与,分享经验,回答问题,偶尔提到自己的产品。
慢慢地,版主和群友都认识了他。
三个多月后,他私信版主,申请发主贴,版主同意了。
因为他已经是社群的活跃贡献者,不是突然冒出来的广告党。
这个主贴的效果,直接让他的用户从几千涨到几万。
Avneesh还分享了一个特别有意思的发现:消费者讨厌订阅制。
他最初推出的是月付订阅服务,结果用户纷纷要求终身会员。
现在,97%的收入来自终身会员,而不是月付或年付。
在SaaS圈子里,大家都在推订阅制,说这样LTV(用户生命周期价值)更高,现金流更稳定。
但消费者的心理是,他们已经厌倦了每月扣费的各种订阅。Netflix、Spotify、各种App,钱包被掏空的感觉很糟糕。
一次性付费,反而让他们感觉掌控感更强。
Avneesh说,理解目标用户,不只是为了做产品功能,更重要的是为了找到他们。
你的用户在哪里?他们在网上的行为模式是什么?
知道这些,你才知道去哪里找她们,用什么方式和她们对话。
社群营销的本质,不是营销,是参与,不是索取,是贡献。
当你真正成为社群的一份子,真心帮助他人解决问题,商业上的成功反而是水到渠成的事。
更深一层,这涉及到人类学家邓巴提出的"邓巴数"理论。人类的大脑只能维持约150个稳定的社交关系。
在一个几千人的社群里,如果你能成为那150个"熟人"之一,你的影响力会呈指数级放大。
Anish从0到月入2.5万美元,没花一分钱广告费。
他做的,只是在对的地方,成为了一个有价值的人。
产品成熟后,他才开始引流。
第四步:设置关键词提醒。
他用了一个叫F5bot的工具,设置关键词提醒。
只要有人在Reddit上提到这几个关键词时,他就会收到邮件,然后他就会去阅读Reddit和Facebook上的整个帖子,看看是否有机会获得关于他正在构建的产品的反馈,或者更好地了解他的目标用户群的需求和愿望。
这个方法的妙处在于,你总能在最合适的时机出现。
比如有人问"怎么赚信用卡积分",你马上就能出现提供帮助。
这不是广告,是雪中送炭。
第五步:先给予,后索取。这是整个策略的精髓。
Avneesh用SQL查询整理了一份优惠信息表格,免费分享给Facebook群组。
表格里有各个商家的返现比例、信用卡优惠等信息。群友打开表格,看到这些有用的信息,顺便注意到数据来源是他的网站。
就这一个帖子,带来了1500多个访问。
这个过程特别像爬山,你不会一开始就冲顶,而是先适应海拔,逐步攀登。
Avneesh先在评论区活跃了三个多月。每周的问答帖,他都会参与,分享经验,回答问题,偶尔提到自己的产品。
慢慢地,版主和群友都认识了他。
三个多月后,他私信版主,申请发主贴,版主同意了。
因为他已经是社群的活跃贡献者,不是突然冒出来的广告党。
这个主贴的效果,直接让他的用户从几千涨到几万。
Avneesh还分享了一个特别有意思的发现:消费者讨厌订阅制。
他最初推出的是月付订阅服务,结果用户纷纷要求终身会员。
现在,97%的收入来自终身会员,而不是月付或年付。
在SaaS圈子里,大家都在推订阅制,说这样LTV(用户生命周期价值)更高,现金流更稳定。
但消费者的心理是,他们已经厌倦了每月扣费的各种订阅。Netflix、Spotify、各种App,钱包被掏空的感觉很糟糕。
一次性付费,反而让他们感觉掌控感更强。
Avneesh说,理解目标用户,不只是为了做产品功能,更重要的是为了找到他们。
你的用户在哪里?他们在网上的行为模式是什么?
知道这些,你才知道去哪里找她们,用什么方式和她们对话。
社群营销的本质,不是营销,是参与,不是索取,是贡献。
当你真正成为社群的一份子,真心帮助他人解决问题,商业上的成功反而是水到渠成的事。
更深一层,这涉及到人类学家邓巴提出的"邓巴数"理论。人类的大脑只能维持约150个稳定的社交关系。
在一个几千人的社群里,如果你能成为那150个"熟人"之一,你的影响力会呈指数级放大。
Anish从0到月入2.5万美元,没花一分钱广告费。
他做的,只是在对的地方,成为了一个有价值的人。
一个叫Avneesh的程序员,曾经在微软、Instagram、Dropbox这些大厂工作,后来辞职创业做了个帮人省钱的工具SaveWise。
结果产品做出来了,用户却一个都没有。
他发了三四百封邮件给各路大V,却只收到一封回复。他的产品在Product Hunt、Hacker News这些平台上线,来了一些流量,结果跳出率高达95%,并且没有得到任何他真正想要的反馈。
但15个月后,他的月收入达到了2.5万美元,而且没花一分钱广告费,仅仅只靠Reddit和Facebook。
他是怎么做到的?
首先,为什么做出来的产品没人用?
你有没有注意过,有些餐厅门庭若市,有些却门可罗雀?
很多时候不是菜品问题,而是选址问题。比如你把川菜馆开在不吃辣的社区,生意能好吗?
Avneesh一开始就犯了这个错误。
他把产品发到了Indie Hackers、Product Hunt这些平台,但这些地方聚集的是什么人?都是创业者、产品经理、程序员。
他们对你的产品感兴趣吗?感兴趣。
但他们是你的目标用户吗?不是。
Avneesh的产品SaveWise是帮人赚信用卡积分和航空里程的。
谁最需要这个?是那些经常网购、想要薅羊毛的普通消费者,而不是天天讨论技术架构的程序员。
换句话说,你得去你的用户在的地方,而不是你自己熟悉的地方。
Avneesh总结了一套方法,这套方法的核心其实就一句话:先成为社群的一份子,再谈你的产品。
第一步:画出你的用户地图。这一步看起来简单,但大多数人都做不好。
他用了一个叫Map of Reddit的工具,你输入一个相关的subreddit,比如"信用卡",它会把所有相关的社区都显示出来,像一张蜘蛛网。
他找到了Rakuten Stacks这个Facebook群组,里面有上千人每天手动查找优惠信息。
这些人花大量时间做的事,正好是他的产品能自动完成的。
第二步:先潜水观察,不要急着说话。
Avneesh在每个群组里潜水了好几周,他观察群友们怎么说话,用什么词汇,讨论什么话题,什么内容受欢迎,什么会被骂。
第三步:明确你要什么。这一步听起来像废话,但很多人真的不知道自己要什么。
你进入一个社群,目的是什么?是收集反馈?找种子用户?还是直接卖产品?
目标不同,策略完全不同。
大厂能干成的,往往是资源密集型的事。比如云计算、外卖。AGI 可能最终得靠大厂才能做成。大厂更有钱获取芯片、数据、人才等资源。
OpenAI 正在逐步成为大厂。DeepSeek 如果坚持不融资,芯片等资源会不够用,然后掉队。
非资源密集型的事,可能创业公司更有机会。很多应用层的创新,需要不内卷的放松环境,需要没有绩效压力的持续探索。在非大厂叙事下,创新应用更容易生长出来。
以上,可能都是对的。
对的,也就都是错的。
OpenAI 正在逐步成为大厂。DeepSeek 如果坚持不融资,芯片等资源会不够用,然后掉队。
非资源密集型的事,可能创业公司更有机会。很多应用层的创新,需要不内卷的放松环境,需要没有绩效压力的持续探索。在非大厂叙事下,创新应用更容易生长出来。
以上,可能都是对的。
对的,也就都是错的。
网站使用 trickle ai 搭建和部署,第一次在生产级别解放了前端人力
公司的 logo 和这套字体,在上周设计完成,终于,终于可以印T恤了发周边了
网站使用 trickle ai 搭建和部署,第一次在生产级别解放了前端人力
公司的 logo 和这套字体,在上周设计完成,终于,终于可以印T恤了发周边了
国内极摩客的方案,rmb 15k 就可,比 mac studio 便宜太多了。
现在 Plus 用户每周可以使用 3000 次推理模型,已经相当够用了
同时 Sam 还在考虑给 Plus 会员一些 Pro 模型的访问次数
具体包括:智能体任务与工具调用、推理与上下文复用、代码生成与协作、可控性与指令遵循、Markdown 格式化、元提示(Metaprompting)代码工具与环境说明
基本涉及了 AI 产品和 Agent 构建的各个方面,我总结了一下还是推荐看原文👇
智能体任务与工具调用
Agentic Workflow Predictability:推荐使用 Responses API 持续保存推理过程,提升智能体应用效率。
Agentic Eagerness:可通过调整 `reasoning_effort` 参数和提示词,控制模型的主动性。
降低主动性:使用低 `reasoning_effort`,明确探索范围和早停标准,减少不必要的工具调用和上下文收集。
提高主动性:提升 `reasoning_effort`,鼓励模型持续完成任务,减少向用户确认或交还的频率。
Tool Preambles:通过提示词引导模型在工具调用前,简明扼要地重述用户目标、规划执行步骤。
推理与上下文复用
Reasoning Effort:可根据任务复杂度调整推理深度。复杂任务建议高推理力度,并将任务拆分为多个步骤分批完成。
Responses API:推荐使用 Responses API 传递前序推理结果,节省 token。
代码生成与协作
前端开发推荐栈:GPT-5 在前端开发表现优异,推荐使用 Next.js、React、Tailwind CSS、shadcn/ui 等主流框架和组件库。
零到一应用生成:通过提示模型自建评估标准,并据此反复自我优化,提升一次性生成应用的质量。
代码风格与规范:明确代码编辑规则、工程原则、目录结构和 UI/UX 最佳实践,确保模型生成代码与现有项目风格一致。
协作编码案例:通过参数和提示词双重控制,平衡输出简洁性与代码可读性,鼓励模型主动提出变更并让用户审核。
可控性与指令遵循
Steerability:GPT-5 对提示词的可控性极高,可控制输出长度、风格和工具调用行为。
Verbosity:新增 `verbosity` 参数,控制最终答案的长度。可在提示词中覆盖默认设置,实现场景化定制。
Instruction Following:GPT-5 对提示词指令极为敏感,需避免矛盾或模糊的指令。