关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
Google DeepMind 刚刚发布了 Genie3 这款“世界模型”。一句话概括:它能瞬间把文字变成七百二十 P、二十四帧每秒的 3D 互动世界,而且你还能实时在里面溜达几分钟,画面不会崩。

想体验火山越野、飓风夜行、深海追水母?直接打字就行。更酷的是,它还能“记住”你一分钟后回头看到的同一棵树,环境一致性拉满。

它背后的黑科技是:模型每秒要多次回看之前生成的画面,边想边画,既保证了实时性,又保证了不“穿帮”。这可比纯粹生成一整段视频难多了。

除了当“元宇宙生成器”,Genie 3 还是训练 AI 代理的新操场。把 SIMA 机器人扔进去做任务,走迷宫、拿钥匙、躲障碍,一串长动作毫无违和感。未来机器人、自动驾驶都能用它来练级。

当然,它还在“研究预览”阶段:只能玩几分钟、动作空间有限、多人互动和世界地图精度都在打磨。DeepMind 已经拉上了安全团队,先让少量学者和创作者试玩,收集反馈后再放大招。

一句话总结:Genie 3 把“想象的下一秒”实时变成了“可玩的下一帧”
现在 AI 的发展已经到达了一个非常尴尬的时刻。
各种模型发布,提升微小,官方运营、kol、用户都快测不出区别了
各种创始人访谈,访谈都吹的天花乱坠,产品一发布完全不是一回事
各种教程,可能是最有用的内容了,但是太多了,根本学不过来。
圈内人,已经快跟不上了。
圈外人,就直接跳过了。
信息爆炸的结果,又回到了用户自己。
每个人只应该关注与自己相关的事情。
不要试图关注一切,也没有可能关注一切。
谷歌发布了一个非常牛皮的世界模型 Genie 3!

这次生成时长和分辨率都很给力,而且还支持通过文本动态改变世界事件,这搭配一个 LLM 不就妥妥的 AI 游戏吗

能以 24 帧每秒的速度生成,分辨率高达 720P,支持超过几分钟保持环境一致性

模型能模拟自然现象,并展现真实世界的物理特性。

支持跨越地理和时间界限,生成如阿尔卑斯山、威尼斯、古希腊等多样场景

通过自回归方式逐帧生成,Genie 3 能在几分钟内保持环境物体和细节的一致性,视觉记忆最长可达一分钟。

不仅支持导航,还能通过文本 prompt 动态改变世界事件

可为 AI 智能体(如 SIMA agent)生成丰富环境,支持复杂目标的达成和长期任务训练

详细信息:https://deepmind.google/discover/blog/genie-3-a-new-frontier-for-world-models/

Invalid media: video
Anthropic 发力了,发布 Claude Opue 4.1 !#ai创造营#

在 Agent 任务、真实世界编码和推理方面的升级,已经向Claude 用户开放,API也已经上线,定价与 Opus 4 相同

GitHub 指出,Claude Opus 4.1 相较于 Opus 4 在大多数能力上都有提升,尤其是在多文件代码重构方面表现尤为突出
要来了!朋友们。看来不止GPT-5#ai创造营#
WAIC刚落幕,AI圈又传来新消息,苹果组建了新的AI团队。
AI领域迭代日新月异,如果你想掌握更多AI领域专业前沿的知识,不妨来ima看看这几个知识库👇

· 智能体宇宙

身为AI开发者,担忧Agent框架复杂难上手? 作为产品经理,头疼智能体商业落地难?......快来特工宇宙团队@缱绻怡然 的「智能体宇宙」知识库找答案!
精选AI Agent领域前沿论文、研报、白皮书等权威专业内容,助你一站式掌握前沿方法论与硬核案例,高效构建下一代AI Agent!📈

· AGI数据库.腾讯研究院

由腾讯研究院打造的官方知识库,精选每日全球最新AI技术与产业动态——从ChatGPT升级到机器人革命,从大模型趋势解读到医疗AI突破,
看不懂技术新名词?跟不上日新月异的产品迭代?
你对AI的各种困惑与好奇,都能在这里找到答案💬

· 人形机器人、具身智能资料库 [强烈推荐]

腾讯科技官方打造「人形机器人、具身智能资料库」,涵盖高盛、斯坦福、MIT等知名机构的论文研报。如果你也想了解人形机器人,好奇它们的技术底层逻辑和行业发展动态,就来这个知识库找答案吧!🤖

· 故事接龙StoryStormAI社区

想要学习AIGC创作,却不了解应该用什么软件?如何写好提示词?快来向这个知识库提问吧!
涵盖3000+份AIGC领域的优质内容,为你提供专业、全面的AIGC实战技巧与行业动态,从入门到进阶,帮助你快速成长,高效上手AIGC创作📝

更多知识库内的精彩内容,欢迎扫描下方知识码,或在ima各端中搜索知识库名称一探究竟🔍

如果你也有其他优质的知识库想分享,欢迎加入圈子「知识库研究小组」,带话题 #安利我的ima知识库 ,发布动态向大家安利吧!

和ima一起,让知识流动起来🌊
这篇文章有意思。

提出在 AI Agent 时代,任何“固定费率+高token消耗”的订阅模式都难以为继。

他分析了一下目前虽然 LLM 不断的在降价,但是综合的 LLM 成本反而在越来越贵的原因和这种现象会产生的问题。

前段时间的 Cursor 涨价和 Claude Code 涨价都反应了这种囚徒困境。

同时还分析了一下避免这种问题的几个方法。

详细内容:

许多AI公司认为,只要模型推理成本每年下降10倍,先亏损后盈利是可行的。但现实是,虽然如GPT-3.5等旧模型确实变便宜了,但用户需求始终集中在最新、最强的前沿模型(SOTA),而这些模型的价格始终居高不下。

虽然每个token的成本没变高,但AI模型每次任务消耗的token数量却呈指数级增长。AI代理和长时间任务让单用户每日消耗的成本远超传统订阅价格(如$20/月),导致公司亏损加剧。

在AI Agent时代,任何“固定费率+高token消耗”的订阅模式都难以为继。

Anthropic等公司尝试通过高价(如$200/月)、模型自动切换、部分计算卸载到用户本地等方式应对,但依然无法阻止token消耗失控,最终不得不取消无限量套餐。

所有AI公司都明白按用量计费才可持续,但只要有竞争对手提供低价无限量,用户就会流向后者,导致行业陷入“价格战—亏损—倒闭”的恶性循环。

三种可能的出路

从一开始就按用量计费:理论上可行,但消费者普遍讨厌计量收费,实际难以增长。

制造高切换成本:如Devin等企业级AI,通过深度集成和复杂流程锁定大客户,利润率高但市场有限。

垂直整合,基础设施变现:如Replit,将AI代理与托管、数据库、监控等服务打包,AI推理作为引流,真正盈利点在于全栈服务。

文章地址:https://ethanding.substack.com/p/ai-subscriptions-get-short-squeezed
一位前苹果硬件工程师,放弃了在大厂的稳定工作,投身AI创业。她的第一个产品界面粗糙,功能也很简陋,甚至连批量处理都没有。

但就是这样一个半成品,在一年内获得了1000万下载量和千万美元的年化收入。

今天来给大家讲的这个故事的主角是Ella Zhang,同时也是Creati AI这个产品的创始人。

Ella在苹果参与研发第一代AirPods时,就学到了一个看似简单却极其重要的方法论。
当时团队面临一个挑战:没人知道用户到底需要什么样的无线耳机。
市面上有各种猜测和假设,但都缺乏实际依据。

苹果的做法就很特别,他们不是发放在线问卷,而是把用户请到小会议室,进行面对面的深度访谈。

面对面访谈有两个关键优势。
第一,你能获得问卷之外的信息。
举个例子:产品团队可能预设用户需要A、B、C三个功能,但实际交流中发现,用户根本不在乎这些,他们真正需要的是D,这可能是一个团队从未想过的需求点。

第二,你能观察到用户的非语言信息。
当用户说"这个功能还行"时,他的表情是兴奋还是勉强?这些微表情往往比语言本身更真实。
这个方法论后来也成了Ella创业路上最重要的武器。

离开苹果后,Ella的第一个创业项目是ZMO.ai,一个文生图的AI工具。
当时正值Midjourney爆火,整个行业都在追逐这个风口。Ella也不例外,她觉得既然大家都在做,市场需求肯定存在。

但很快她就发现了问题:用户增长很快,收入却上不去。
面对困境,Ella想起了在苹果学到的方法。
所以她给500多个活跃用户发邮件,最终和300多人进行了深度访谈。

但结果让她大吃一惊:大部分用户使用产品只是出于好奇,想体验一下AI的神奇,并没有真实的使用需求。

但访谈中也有惊喜,一小部分用户,主要是电商卖家确实有刚需。他们在亚马逊、eBay上卖货,需要大量的产品图片用于营销,但又请不起专业设计师。
更有意思的发现是,这些卖家主要用手机拍摄产品照片,社交媒体营销也在手机上完成。所以他们更需要的是移动端的解决方案,而不是PC端的专业工具。

这个洞察直接促成了Creati的诞生——一个专注于移动端营销视频创作的AI工具。

需求明确了,下一步是如何构建网络效应的飞轮?

传统的工具类产品往往陷入一个困境:用户用完就走,很难形成粘性。
Ella的解决方案很巧妙,她没有把Creati做成纯工具,而是构建了一个连接网红和品牌商的生态系统。

这个设计背后有深刻的商业逻辑。
网红是内容创作的专家,他们最懂什么样的视频能在社交媒体上爆火。
品牌商有营销需求,但不懂如何创作吸引人的内容。
而Creati就成为了连接两者的桥梁:网红在平台上创建视频模板,品牌商付费使用这些模板制作自己的营销视频。

这形成了一个正向循环,网红创作的模板越优质,使用的品牌商越多,平台收入越高;平台收入高了,能够吸引更多优秀网红加入,创作更多优质模板。

这就是Peter Senge在《第五项修炼》中提到的"增强回路":系统中的各个要素相互促进,形成指数级增长。

更巧妙的是,当网红使用自己创作的模板制作视频并发布到社交媒体上时,如果视频爆火,会自然地为Creati带来新用户,这种基于内容的病毒式传播,获客成本几乎为零。

Ella反复强调一个观点:不要等产品完美才上线。
因为技术进步太快,市场变化太快,等你把产品打磨完美,可能机会窗口已经关闭。

Creati的第一版产品确实很粗糙,没有批量处理功能,UI设计简陋,用户体验并不理想。

但Ella发现了一个有趣的现象:尽管产品不完美,用户还是愿意用,而且用得很频繁。
这说明什么?说明产品击中了真实痛点。

先用最简单的方式验证核心假设,确认用户确实需要这个产品后,再逐步完善体验。
这种"先开枪后瞄准"的策略,在快速变化的市场中特别有效。

AI创业与传统创业最大的不同是什么?
是变化速度。
Ella说,每天醒来都会发现有新技术、新产品出现。今天看起来先进的技术,可能明天就过时了。
在这种环境下,创始人最重要的能力不是预测未来,而是快速适应变化。

Ella的策略是抓住变化中的不变:技术会变,但用户想要创作出能在社交媒体上爆火的内容,这个需求不会变。所以她把精力集中在理解什么样的内容会火,如何帮用户更容易地创作这样的内容上。

我特别想聊聊Ella离开苹果的决定。
很多人说她应该在大公司待更久,积累更多经验和资源。这个建议不无道理,但Ella的选择让我想起了行为经济学中的"机会成本"概念。

留在苹果,她可能会有稳定的收入、体面的职位、轻松的生活。
但她会失去什么?失去的是按照自己的想法改变世界的机会,是经历从0到1创造过程的体验,是在不确定性中成长的可能。

更重要的是时机,AI浪潮刚刚开始,正是创业的黄金窗口期。
用投资人的话说,这叫时间套利——在大多数人还在观望时果断行动,才能获得超额回报。

当然,这个选择并不容易。
Ella坦言,她也怀念在大公司的日子,怀念和朋友家人在一起的时光。但她也不后悔,因为她在做自己真正热爱的事情。

回顾Ella的创业历程,我发现了一个规律,那就是成功的产品往往不是功能最全、设计最美的,而是最懂用户、迭代最快的。

分享一个细节,Ella说她从小就发现,通过视频获取信息比阅读文字容易得多。
这个个人体验成为她创业的原动力,如果能让更多人通过视频轻松地传递信息,那将帮助很多人。

最好的创业者,往往是在解决自己的问题,只不过这个问题恰好也是千万人的问题。
从这个角度看,Creati的成功并不偶然。
通义发布 Qwen-Image 图像生成模型。#ai创造营#

擅长图片中的文字生成和海报生成,中英文都可以

试了几张,文字还行,尤其中文很不错,就是这个美学得注意一下,看起来是一个实验性模型

这里尝试:modelscope.cn/aigc/imageGeneration
⛰️ 新世界的里程碑:ChatGPT 即将达到7亿周活

Open AI 副总裁 Nick Turley 宣布,本周ChatGPT 即将迎来7亿周活的惊人成就。 这一个数字在去年同期只有2亿~

📖 一并附上Hans过去一年ChatGPT 相关重大事件的独家评测:

1️⃣ 2024.8 ChatGPT 周活2亿,92% 全球500强企业采用 https://m.okjike.com/originalPosts/66de78b1be1b0f6ab799dc74
2️⃣ 2024.9 ChatGPT 推出第一个推理模型 o1 https://m.okjike.com/originalPosts/66e79687dd7383e4721e1cf9
3️⃣ 2024.11 ChatGPT 支持 AI 搜索 https://m.okjike.com/originalPosts/6724416cc5328b51c42a9f0c
4️⃣ 2024.11 ChatGPT 成为全球第8大网站 https://m.okjike.com/originalPosts/6731a10d32f03efa7798160e
5️⃣ 2024.12 ChatGPT 周活3亿 https://m.okjike.com/originalPosts/67512e1753ab99f7fda95336
6️⃣ 2025.2 ChatGPT 推出Deep Research https://m.okjike.com/originalPosts/67a188c6b6302275b52a3800
7️⃣ 2025.3 ChatGPT 推出 GPT image https://m.okjike.com/originalPosts/67e389d6e27d1edbbb449c47
8️⃣ 2025.7 ChatGPT 推出Agent 模式 https://m.okjike.com/originalPosts/6879bb79a9ac225444acc1e9

时代滚滚前行,韦恩·格雷茨基的名句再次回响: 「我滑向冰球将要到达的地方,而不是它已经所处的位置。」
这篇文章有意思。#ai创造营#

提出在 AI Agent 时代,任何“固定费率+高token消耗”的订阅模式都难以为继。

他分析了一下目前虽然 LLM 不断的在降价,但是综合的 LLM 成本反而在越来越贵的原因和这种现象会产生的问题。

前段时间的 Cursor 涨价和 Claude Code 涨价都反应了这种囚徒困境。

同时还分析了一下避免这种问题的几个方法。

详细内容:

许多AI公司认为,只要模型推理成本每年下降10倍,先亏损后盈利是可行的。但现实是,虽然如GPT-3.5等旧模型确实变便宜了,但用户需求始终集中在最新、最强的前沿模型(SOTA),而这些模型的价格始终居高不下。

虽然每个token的成本没变高,但AI模型每次任务消耗的token数量却呈指数级增长。AI代理和长时间任务让单用户每日消耗的成本远超传统订阅价格(如$20/月),导致公司亏损加剧。

在AI Agent时代,任何“固定费率+高token消耗”的订阅模式都难以为继。

Anthropic等公司尝试通过高价(如$200/月)、模型自动切换、部分计算卸载到用户本地等方式应对,但依然无法阻止token消耗失控,最终不得不取消无限量套餐。

所有AI公司都明白按用量计费才可持续,但只要有竞争对手提供低价无限量,用户就会流向后者,导致行业陷入“价格战—亏损—倒闭”的恶性循环。

三种可能的出路

从一开始就按用量计费:理论上可行,但消费者普遍讨厌计量收费,实际难以增长。

制造高切换成本:如Devin等企业级AI,通过深度集成和复杂流程锁定大客户,利润率高但市场有限。

垂直整合,基础设施变现:如Replit,将AI代理与托管、数据库、监控等服务打包,AI推理作为引流,真正盈利点在于全栈服务。

文章地址:ethanding.substack.com/p/ai-subscriptions-get-short-squeezed
Back to Top