关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
很奇怪的一点,人们看到一个产品
第一反应应该是,这个产品给用户带来了怎样的感受,解决了什么问题
而不应该是,这个产品用的是哪个模型
一个产品用什么模型有那么重要吗?
什么时候大家都不关注模型了
才是 AI 应用的时刻真的到了
第一反应应该是,这个产品给用户带来了怎样的感受,解决了什么问题
而不应该是,这个产品用的是哪个模型
一个产品用什么模型有那么重要吗?
什么时候大家都不关注模型了
才是 AI 应用的时刻真的到了
现在 AI 的发展已经到达了一个非常尴尬的时刻。
各种模型发布,提升微小,官方运营、kol、用户都快测不出区别了
各种创始人访谈,访谈都吹的天花乱坠,产品一发布完全不是一回事
各种教程,可能是最有用的内容了,但是太多了,根本学不过来。
圈内人,已经快跟不上了。
圈外人,就直接跳过了。
信息爆炸的结果,又回到了用户自己。
每个人只应该关注与自己相关的事情。
不要试图关注一切,也没有可能关注一切。
各种模型发布,提升微小,官方运营、kol、用户都快测不出区别了
各种创始人访谈,访谈都吹的天花乱坠,产品一发布完全不是一回事
各种教程,可能是最有用的内容了,但是太多了,根本学不过来。
圈内人,已经快跟不上了。
圈外人,就直接跳过了。
信息爆炸的结果,又回到了用户自己。
每个人只应该关注与自己相关的事情。
不要试图关注一切,也没有可能关注一切。
Google DeepMind 刚刚发布了 Genie3 这款“世界模型”。一句话概括:它能瞬间把文字变成七百二十 P、二十四帧每秒的 3D 互动世界,而且你还能实时在里面溜达几分钟,画面不会崩。
想体验火山越野、飓风夜行、深海追水母?直接打字就行。更酷的是,它还能“记住”你一分钟后回头看到的同一棵树,环境一致性拉满。
它背后的黑科技是:模型每秒要多次回看之前生成的画面,边想边画,既保证了实时性,又保证了不“穿帮”。这可比纯粹生成一整段视频难多了。
除了当“元宇宙生成器”,Genie 3 还是训练 AI 代理的新操场。把 SIMA 机器人扔进去做任务,走迷宫、拿钥匙、躲障碍,一串长动作毫无违和感。未来机器人、自动驾驶都能用它来练级。
当然,它还在“研究预览”阶段:只能玩几分钟、动作空间有限、多人互动和世界地图精度都在打磨。DeepMind 已经拉上了安全团队,先让少量学者和创作者试玩,收集反馈后再放大招。
一句话总结:Genie 3 把“想象的下一秒”实时变成了“可玩的下一帧”
想体验火山越野、飓风夜行、深海追水母?直接打字就行。更酷的是,它还能“记住”你一分钟后回头看到的同一棵树,环境一致性拉满。
它背后的黑科技是:模型每秒要多次回看之前生成的画面,边想边画,既保证了实时性,又保证了不“穿帮”。这可比纯粹生成一整段视频难多了。
除了当“元宇宙生成器”,Genie 3 还是训练 AI 代理的新操场。把 SIMA 机器人扔进去做任务,走迷宫、拿钥匙、躲障碍,一串长动作毫无违和感。未来机器人、自动驾驶都能用它来练级。
当然,它还在“研究预览”阶段:只能玩几分钟、动作空间有限、多人互动和世界地图精度都在打磨。DeepMind 已经拉上了安全团队,先让少量学者和创作者试玩,收集反馈后再放大招。
一句话总结:Genie 3 把“想象的下一秒”实时变成了“可玩的下一帧”
现在 AI 的发展已经到达了一个非常尴尬的时刻。
各种模型发布,提升微小,官方运营、kol、用户都快测不出区别了
各种创始人访谈,访谈都吹的天花乱坠,产品一发布完全不是一回事
各种教程,可能是最有用的内容了,但是太多了,根本学不过来。
圈内人,已经快跟不上了。
圈外人,就直接跳过了。
信息爆炸的结果,又回到了用户自己。
每个人只应该关注与自己相关的事情。
不要试图关注一切,也没有可能关注一切。
各种模型发布,提升微小,官方运营、kol、用户都快测不出区别了
各种创始人访谈,访谈都吹的天花乱坠,产品一发布完全不是一回事
各种教程,可能是最有用的内容了,但是太多了,根本学不过来。
圈内人,已经快跟不上了。
圈外人,就直接跳过了。
信息爆炸的结果,又回到了用户自己。
每个人只应该关注与自己相关的事情。
不要试图关注一切,也没有可能关注一切。
谷歌发布了一个非常牛皮的世界模型 Genie 3!
这次生成时长和分辨率都很给力,而且还支持通过文本动态改变世界事件,这搭配一个 LLM 不就妥妥的 AI 游戏吗
能以 24 帧每秒的速度生成,分辨率高达 720P,支持超过几分钟保持环境一致性
模型能模拟自然现象,并展现真实世界的物理特性。
支持跨越地理和时间界限,生成如阿尔卑斯山、威尼斯、古希腊等多样场景
通过自回归方式逐帧生成,Genie 3 能在几分钟内保持环境物体和细节的一致性,视觉记忆最长可达一分钟。
不仅支持导航,还能通过文本 prompt 动态改变世界事件
可为 AI 智能体(如 SIMA agent)生成丰富环境,支持复杂目标的达成和长期任务训练
详细信息:https://deepmind.google/discover/blog/genie-3-a-new-frontier-for-world-models/
Invalid media: video
这次生成时长和分辨率都很给力,而且还支持通过文本动态改变世界事件,这搭配一个 LLM 不就妥妥的 AI 游戏吗
能以 24 帧每秒的速度生成,分辨率高达 720P,支持超过几分钟保持环境一致性
模型能模拟自然现象,并展现真实世界的物理特性。
支持跨越地理和时间界限,生成如阿尔卑斯山、威尼斯、古希腊等多样场景
通过自回归方式逐帧生成,Genie 3 能在几分钟内保持环境物体和细节的一致性,视觉记忆最长可达一分钟。
不仅支持导航,还能通过文本 prompt 动态改变世界事件
可为 AI 智能体(如 SIMA agent)生成丰富环境,支持复杂目标的达成和长期任务训练
详细信息:https://deepmind.google/discover/blog/genie-3-a-new-frontier-for-world-models/
Invalid media: video
一位前苹果硬件工程师,放弃了在大厂的稳定工作,投身AI创业。她的第一个产品界面粗糙,功能也很简陋,甚至连批量处理都没有。
但就是这样一个半成品,在一年内获得了1000万下载量和千万美元的年化收入。
今天来给大家讲的这个故事的主角是Ella Zhang,同时也是Creati AI这个产品的创始人。
Ella在苹果参与研发第一代AirPods时,就学到了一个看似简单却极其重要的方法论。
当时团队面临一个挑战:没人知道用户到底需要什么样的无线耳机。
市面上有各种猜测和假设,但都缺乏实际依据。
苹果的做法就很特别,他们不是发放在线问卷,而是把用户请到小会议室,进行面对面的深度访谈。
面对面访谈有两个关键优势。
第一,你能获得问卷之外的信息。
举个例子:产品团队可能预设用户需要A、B、C三个功能,但实际交流中发现,用户根本不在乎这些,他们真正需要的是D,这可能是一个团队从未想过的需求点。
第二,你能观察到用户的非语言信息。
当用户说"这个功能还行"时,他的表情是兴奋还是勉强?这些微表情往往比语言本身更真实。
这个方法论后来也成了Ella创业路上最重要的武器。
离开苹果后,Ella的第一个创业项目是ZMO.ai,一个文生图的AI工具。
当时正值Midjourney爆火,整个行业都在追逐这个风口。Ella也不例外,她觉得既然大家都在做,市场需求肯定存在。
但很快她就发现了问题:用户增长很快,收入却上不去。
面对困境,Ella想起了在苹果学到的方法。
所以她给500多个活跃用户发邮件,最终和300多人进行了深度访谈。
但结果让她大吃一惊:大部分用户使用产品只是出于好奇,想体验一下AI的神奇,并没有真实的使用需求。
但访谈中也有惊喜,一小部分用户,主要是电商卖家确实有刚需。他们在亚马逊、eBay上卖货,需要大量的产品图片用于营销,但又请不起专业设计师。
更有意思的发现是,这些卖家主要用手机拍摄产品照片,社交媒体营销也在手机上完成。所以他们更需要的是移动端的解决方案,而不是PC端的专业工具。
这个洞察直接促成了Creati的诞生——一个专注于移动端营销视频创作的AI工具。
需求明确了,下一步是如何构建网络效应的飞轮?
传统的工具类产品往往陷入一个困境:用户用完就走,很难形成粘性。
Ella的解决方案很巧妙,她没有把Creati做成纯工具,而是构建了一个连接网红和品牌商的生态系统。
这个设计背后有深刻的商业逻辑。
网红是内容创作的专家,他们最懂什么样的视频能在社交媒体上爆火。
品牌商有营销需求,但不懂如何创作吸引人的内容。
而Creati就成为了连接两者的桥梁:网红在平台上创建视频模板,品牌商付费使用这些模板制作自己的营销视频。
这形成了一个正向循环,网红创作的模板越优质,使用的品牌商越多,平台收入越高;平台收入高了,能够吸引更多优秀网红加入,创作更多优质模板。
这就是Peter Senge在《第五项修炼》中提到的"增强回路":系统中的各个要素相互促进,形成指数级增长。
更巧妙的是,当网红使用自己创作的模板制作视频并发布到社交媒体上时,如果视频爆火,会自然地为Creati带来新用户,这种基于内容的病毒式传播,获客成本几乎为零。
Ella反复强调一个观点:不要等产品完美才上线。
因为技术进步太快,市场变化太快,等你把产品打磨完美,可能机会窗口已经关闭。
Creati的第一版产品确实很粗糙,没有批量处理功能,UI设计简陋,用户体验并不理想。
但Ella发现了一个有趣的现象:尽管产品不完美,用户还是愿意用,而且用得很频繁。
这说明什么?说明产品击中了真实痛点。
先用最简单的方式验证核心假设,确认用户确实需要这个产品后,再逐步完善体验。
这种"先开枪后瞄准"的策略,在快速变化的市场中特别有效。
AI创业与传统创业最大的不同是什么?
是变化速度。
Ella说,每天醒来都会发现有新技术、新产品出现。今天看起来先进的技术,可能明天就过时了。
在这种环境下,创始人最重要的能力不是预测未来,而是快速适应变化。
Ella的策略是抓住变化中的不变:技术会变,但用户想要创作出能在社交媒体上爆火的内容,这个需求不会变。所以她把精力集中在理解什么样的内容会火,如何帮用户更容易地创作这样的内容上。
我特别想聊聊Ella离开苹果的决定。
很多人说她应该在大公司待更久,积累更多经验和资源。这个建议不无道理,但Ella的选择让我想起了行为经济学中的"机会成本"概念。
留在苹果,她可能会有稳定的收入、体面的职位、轻松的生活。
但她会失去什么?失去的是按照自己的想法改变世界的机会,是经历从0到1创造过程的体验,是在不确定性中成长的可能。
更重要的是时机,AI浪潮刚刚开始,正是创业的黄金窗口期。
用投资人的话说,这叫时间套利——在大多数人还在观望时果断行动,才能获得超额回报。
当然,这个选择并不容易。
Ella坦言,她也怀念在大公司的日子,怀念和朋友家人在一起的时光。但她也不后悔,因为她在做自己真正热爱的事情。
回顾Ella的创业历程,我发现了一个规律,那就是成功的产品往往不是功能最全、设计最美的,而是最懂用户、迭代最快的。
分享一个细节,Ella说她从小就发现,通过视频获取信息比阅读文字容易得多。
这个个人体验成为她创业的原动力,如果能让更多人通过视频轻松地传递信息,那将帮助很多人。
最好的创业者,往往是在解决自己的问题,只不过这个问题恰好也是千万人的问题。
从这个角度看,Creati的成功并不偶然。
但就是这样一个半成品,在一年内获得了1000万下载量和千万美元的年化收入。
今天来给大家讲的这个故事的主角是Ella Zhang,同时也是Creati AI这个产品的创始人。
Ella在苹果参与研发第一代AirPods时,就学到了一个看似简单却极其重要的方法论。
当时团队面临一个挑战:没人知道用户到底需要什么样的无线耳机。
市面上有各种猜测和假设,但都缺乏实际依据。
苹果的做法就很特别,他们不是发放在线问卷,而是把用户请到小会议室,进行面对面的深度访谈。
面对面访谈有两个关键优势。
第一,你能获得问卷之外的信息。
举个例子:产品团队可能预设用户需要A、B、C三个功能,但实际交流中发现,用户根本不在乎这些,他们真正需要的是D,这可能是一个团队从未想过的需求点。
第二,你能观察到用户的非语言信息。
当用户说"这个功能还行"时,他的表情是兴奋还是勉强?这些微表情往往比语言本身更真实。
这个方法论后来也成了Ella创业路上最重要的武器。
离开苹果后,Ella的第一个创业项目是ZMO.ai,一个文生图的AI工具。
当时正值Midjourney爆火,整个行业都在追逐这个风口。Ella也不例外,她觉得既然大家都在做,市场需求肯定存在。
但很快她就发现了问题:用户增长很快,收入却上不去。
面对困境,Ella想起了在苹果学到的方法。
所以她给500多个活跃用户发邮件,最终和300多人进行了深度访谈。
但结果让她大吃一惊:大部分用户使用产品只是出于好奇,想体验一下AI的神奇,并没有真实的使用需求。
但访谈中也有惊喜,一小部分用户,主要是电商卖家确实有刚需。他们在亚马逊、eBay上卖货,需要大量的产品图片用于营销,但又请不起专业设计师。
更有意思的发现是,这些卖家主要用手机拍摄产品照片,社交媒体营销也在手机上完成。所以他们更需要的是移动端的解决方案,而不是PC端的专业工具。
这个洞察直接促成了Creati的诞生——一个专注于移动端营销视频创作的AI工具。
需求明确了,下一步是如何构建网络效应的飞轮?
传统的工具类产品往往陷入一个困境:用户用完就走,很难形成粘性。
Ella的解决方案很巧妙,她没有把Creati做成纯工具,而是构建了一个连接网红和品牌商的生态系统。
这个设计背后有深刻的商业逻辑。
网红是内容创作的专家,他们最懂什么样的视频能在社交媒体上爆火。
品牌商有营销需求,但不懂如何创作吸引人的内容。
而Creati就成为了连接两者的桥梁:网红在平台上创建视频模板,品牌商付费使用这些模板制作自己的营销视频。
这形成了一个正向循环,网红创作的模板越优质,使用的品牌商越多,平台收入越高;平台收入高了,能够吸引更多优秀网红加入,创作更多优质模板。
这就是Peter Senge在《第五项修炼》中提到的"增强回路":系统中的各个要素相互促进,形成指数级增长。
更巧妙的是,当网红使用自己创作的模板制作视频并发布到社交媒体上时,如果视频爆火,会自然地为Creati带来新用户,这种基于内容的病毒式传播,获客成本几乎为零。
Ella反复强调一个观点:不要等产品完美才上线。
因为技术进步太快,市场变化太快,等你把产品打磨完美,可能机会窗口已经关闭。
Creati的第一版产品确实很粗糙,没有批量处理功能,UI设计简陋,用户体验并不理想。
但Ella发现了一个有趣的现象:尽管产品不完美,用户还是愿意用,而且用得很频繁。
这说明什么?说明产品击中了真实痛点。
先用最简单的方式验证核心假设,确认用户确实需要这个产品后,再逐步完善体验。
这种"先开枪后瞄准"的策略,在快速变化的市场中特别有效。
AI创业与传统创业最大的不同是什么?
是变化速度。
Ella说,每天醒来都会发现有新技术、新产品出现。今天看起来先进的技术,可能明天就过时了。
在这种环境下,创始人最重要的能力不是预测未来,而是快速适应变化。
Ella的策略是抓住变化中的不变:技术会变,但用户想要创作出能在社交媒体上爆火的内容,这个需求不会变。所以她把精力集中在理解什么样的内容会火,如何帮用户更容易地创作这样的内容上。
我特别想聊聊Ella离开苹果的决定。
很多人说她应该在大公司待更久,积累更多经验和资源。这个建议不无道理,但Ella的选择让我想起了行为经济学中的"机会成本"概念。
留在苹果,她可能会有稳定的收入、体面的职位、轻松的生活。
但她会失去什么?失去的是按照自己的想法改变世界的机会,是经历从0到1创造过程的体验,是在不确定性中成长的可能。
更重要的是时机,AI浪潮刚刚开始,正是创业的黄金窗口期。
用投资人的话说,这叫时间套利——在大多数人还在观望时果断行动,才能获得超额回报。
当然,这个选择并不容易。
Ella坦言,她也怀念在大公司的日子,怀念和朋友家人在一起的时光。但她也不后悔,因为她在做自己真正热爱的事情。
回顾Ella的创业历程,我发现了一个规律,那就是成功的产品往往不是功能最全、设计最美的,而是最懂用户、迭代最快的。
分享一个细节,Ella说她从小就发现,通过视频获取信息比阅读文字容易得多。
这个个人体验成为她创业的原动力,如果能让更多人通过视频轻松地传递信息,那将帮助很多人。
最好的创业者,往往是在解决自己的问题,只不过这个问题恰好也是千万人的问题。
从这个角度看,Creati的成功并不偶然。