关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
终于有普通人可以立刻使用的类 Sora 视频生成工具了!#ai视频# #sora#
海外产品 viva 发布了首个开放给全部用户使用的 Sora 同架构视频生成模型,而且现阶段免费。
支持文本生成视频、图片生成视频以及 4K 分辨率放大功能,另外也支持提示词的自动优化。
文生视频单次可以生成一条 5 秒的视频,图生视频是 4 秒视频
我测试了一下应该是目前运动幅度最大的视频生成模型,同时图像分辨率也是现在可以用的视频生成产品中最大的。文生视频的效果比图生视频要更好,同时如果要是用的话建议把运动幅度调到 20 左右比较合适。
viva 优势领域就是可以生成比较好的竖屏视频,目前很多视频模型的演示都是横屏视频,竖屏的表现并不好,但是短视频又是视频内容的大头,所以竖屏视频的生成质量是个很重要的指标。
但是一致性有一部分测试中保持的不是很好,同时没有表现出 Sora 那样强大的物理特性模拟以及 3D 一致性。跟谷歌 刚发布的 Veo 模型对比来看在写实内容上其实以及差不多了。
下面是 viva 的视频演示,15 秒开始有相同的提示词跟谷歌刚发布的 Veo 模型的对比。
这里体验 viva:https://vivago.ai/video?type=1
海外产品 viva 发布了首个开放给全部用户使用的 Sora 同架构视频生成模型,而且现阶段免费。
支持文本生成视频、图片生成视频以及 4K 分辨率放大功能,另外也支持提示词的自动优化。
文生视频单次可以生成一条 5 秒的视频,图生视频是 4 秒视频
我测试了一下应该是目前运动幅度最大的视频生成模型,同时图像分辨率也是现在可以用的视频生成产品中最大的。文生视频的效果比图生视频要更好,同时如果要是用的话建议把运动幅度调到 20 左右比较合适。
viva 优势领域就是可以生成比较好的竖屏视频,目前很多视频模型的演示都是横屏视频,竖屏的表现并不好,但是短视频又是视频内容的大头,所以竖屏视频的生成质量是个很重要的指标。
但是一致性有一部分测试中保持的不是很好,同时没有表现出 Sora 那样强大的物理特性模拟以及 3D 一致性。跟谷歌 刚发布的 Veo 模型对比来看在写实内容上其实以及差不多了。
下面是 viva 的视频演示,15 秒开始有相同的提示词跟谷歌刚发布的 Veo 模型的对比。
这里体验 viva:https://vivago.ai/video?type=1
最近在总结美国创作者调研分享,分享一些跟AI相关的关键用户认知:
一、效果比效率更重要——对应产品价值
1. 这也是我过去一年收获的最有价值的一句话,经历很多血泪教训才真正理解
2. 效果的关键是符合甚至超出用户预期,如果不符合预期,用户就不会完成创作,甚至没有留存。
3. 不要为了效率而牺牲效果,这是我很容易犯的错误,尤其在漏斗分析的大厂思维下。
4. AI大模型存在效果不稳定且不可控的问题,一方面通过「雕花」策略来优化给用户交付的结果,另一方面管理用户的预期,比如让用户理解这不是最终结果,而是一个可以继续编辑的草稿。雕花是应用层产品的宿命。
二、用户又懒又有惯性思维——对应推广方式
1. 最顺的是在老产品的已有主路径workflow,通过AI提效,用户甚至是无意识使用,渗透相对容易做起来
2. 但在老产品上独立的新AI workflow能力模块,单纯通过产品策略(强插、增加入口、红点)的导流有限,用户很难注意到,也不愿意为一个不确定的结果而付出额外的上手成本
3. 可能就需要运营和推广手段,做用户认知教育,甚至一个好的demo视频都比产品策略有效。好的内容有随机性,但也是最大的杠杆。
4. 在字节,最有效的是抖音锚点;在腾讯,最有效的手段是微信QQ红点;它们过于成功,也导致我们过于依赖。如果我们做的产品在这个路径增长逻辑不那么成立,那么我们的方法论,经验,甚至能力模型,都很难支撑我们去推广新产品
三、用户为刚需付费——对应付费模式
1. 工具类产品,用户的决策是理性的,所以更多为刚需付费,而较难为冲动付费
2. 服务偶发性刚需,比如母亲节这天,用户会为母亲节模板单次付费;
3. 服务持续性刚需,比如通过AI能力帮助制作创作者Tiktok/Ins账号的主营内容,例如美妆博主的美妆vlog,帮助他们持续涨粉赚钱,用户会更愿意订阅付费;
4. 目前AI创业更适合,服务少数人的持续性刚需,而不是服务大众的偶发性刚需
4. 用户已被市场教育AI需要付费,所以强化透传AI,可以提高用户付费意愿度
一、效果比效率更重要——对应产品价值
1. 这也是我过去一年收获的最有价值的一句话,经历很多血泪教训才真正理解
2. 效果的关键是符合甚至超出用户预期,如果不符合预期,用户就不会完成创作,甚至没有留存。
3. 不要为了效率而牺牲效果,这是我很容易犯的错误,尤其在漏斗分析的大厂思维下。
4. AI大模型存在效果不稳定且不可控的问题,一方面通过「雕花」策略来优化给用户交付的结果,另一方面管理用户的预期,比如让用户理解这不是最终结果,而是一个可以继续编辑的草稿。雕花是应用层产品的宿命。
二、用户又懒又有惯性思维——对应推广方式
1. 最顺的是在老产品的已有主路径workflow,通过AI提效,用户甚至是无意识使用,渗透相对容易做起来
2. 但在老产品上独立的新AI workflow能力模块,单纯通过产品策略(强插、增加入口、红点)的导流有限,用户很难注意到,也不愿意为一个不确定的结果而付出额外的上手成本
3. 可能就需要运营和推广手段,做用户认知教育,甚至一个好的demo视频都比产品策略有效。好的内容有随机性,但也是最大的杠杆。
4. 在字节,最有效的是抖音锚点;在腾讯,最有效的手段是微信QQ红点;它们过于成功,也导致我们过于依赖。如果我们做的产品在这个路径增长逻辑不那么成立,那么我们的方法论,经验,甚至能力模型,都很难支撑我们去推广新产品
三、用户为刚需付费——对应付费模式
1. 工具类产品,用户的决策是理性的,所以更多为刚需付费,而较难为冲动付费
2. 服务偶发性刚需,比如母亲节这天,用户会为母亲节模板单次付费;
3. 服务持续性刚需,比如通过AI能力帮助制作创作者Tiktok/Ins账号的主营内容,例如美妆博主的美妆vlog,帮助他们持续涨粉赚钱,用户会更愿意订阅付费;
4. 目前AI创业更适合,服务少数人的持续性刚需,而不是服务大众的偶发性刚需
4. 用户已被市场教育AI需要付费,所以强化透传AI,可以提高用户付费意愿度
我以前以为,实现小学生作文里写的,让机器人买菜做饭,是需要机器人有类似人的自主意识才能实现,而让机器有自主意识,可能需要用到通用量子计算机。现在再看,随着技术发展,也许机器人不需要有自主意识也能执行复杂任务。
一般来说,发指令让机器人把桌上A点的一瓶水,拿起来并放到B点,是相对容易的,只需给机器人编程,设定好坐标、姿态和抓取指令即可。
但是如果你对机器人说,帮我去超市买两斤黄瓜回来,这个难度就相当大了,尽管这个任务只需要花5块钱就会有一个人类外卖员帮你实现。
让机器人去超市买两斤黄瓜,涉及到大量感知、决策和执行过程。
打个比方,怎么让机器人开门。
机器人开门实现起来就比较复杂,研究机器人开门的文章很多。
机器人得认识门把手,得知道门把手的精确位置,得学习从哪个姿态抓成功率更高,得有合适的控制方法避免把门把手或者把自己的手指拧断了。
得用到机器视觉,得研究机器人运动学、动力学,得上深度学习,还得研究各种信号滤波和控制优化方法。
我对机器人只了解一点皮毛,这是我能想到的,实际研究的人可能会遇到更多问题。
想象一下,你所在的团队花了几年时间,成功让机器人学会了拧开各种一字形门把手,并发了很多文章。但是机器人下楼后发现,楼下有个肯德基餐厅同款的门把手。见此情景,你领导心中窃喜,又可以搞到一笔经费,并发好几篇文章。
一般来说,发指令让机器人把桌上A点的一瓶水,拿起来并放到B点,是相对容易的,只需给机器人编程,设定好坐标、姿态和抓取指令即可。
但是如果你对机器人说,帮我去超市买两斤黄瓜回来,这个难度就相当大了,尽管这个任务只需要花5块钱就会有一个人类外卖员帮你实现。
让机器人去超市买两斤黄瓜,涉及到大量感知、决策和执行过程。
打个比方,怎么让机器人开门。
机器人开门实现起来就比较复杂,研究机器人开门的文章很多。
机器人得认识门把手,得知道门把手的精确位置,得学习从哪个姿态抓成功率更高,得有合适的控制方法避免把门把手或者把自己的手指拧断了。
得用到机器视觉,得研究机器人运动学、动力学,得上深度学习,还得研究各种信号滤波和控制优化方法。
我对机器人只了解一点皮毛,这是我能想到的,实际研究的人可能会遇到更多问题。
想象一下,你所在的团队花了几年时间,成功让机器人学会了拧开各种一字形门把手,并发了很多文章。但是机器人下楼后发现,楼下有个肯德基餐厅同款的门把手。见此情景,你领导心中窃喜,又可以搞到一笔经费,并发好几篇文章。
1. 快速撰写简单的提示并测试其效果。
2.根据结果的不足,逐步丰富和细化提示,这可能导致更长、更详细的提示,甚至是“大型提示”。
3. 如果效果仍不理想,可以考虑应用少样本或多样本学习策略(如果适用),或偶尔进行微调。
4. 如果问题仍未解决,可将任务拆分为子任务,采用智能体工作流程。
来源:https://www.deeplearning.ai/the-batch/issue-249/
对 agent 的一个暴论:现有 (multi) agent workflow 的模式没有太大价值。Agent 今年(在以吴恩达老师为首的各类大佬的吹捧下)热度很高,但现有的这些所谓的 (multi) agent workflow,本质上是把一个大任务拆分成很多个子任务,每个子任务都有明确的 input 和 output,自己定义一些变量和接口,把这些子任务串起来。这种方式很像是早期的自动驾驶,把感知和规控分开解,或者是上一代的语音助手,把语音转文字、LLM、语音合成这些工作流串起来。
终极的解决方案应该不是这个样子的。现有的 (multi) agent workflow,速度慢先不说,最大的问题还是在接口的地方把信息降维了。这些 input / output 的接口和变量,本质上都是把信息降维到人能理解的维度,这是以高维信息的损失为代价的。每多一层 workflow,损失的信息就多了一次。面对简单问题时, (multi) agent workflow 或许是可行的,但它注定无法解决复杂问题。就好比Waymo 用感知+规控的架构,搭配高精地图,能够在凤凰城和三藩市勉强把本地 L4 跑通,但很难 scale 成一个通用的解法。只有 Tesla 端到端的方案才是自动驾驶的未来。
因此,现有的 (multi) agent workflow方式注定只是一个中间状态,类似自动驾驶中感知+规控+高精地图的拼凑。而最终想要解决复杂问题,需要靠基础模型的进化。当模型能力足够强之后,应该是可以端到端的解决问题。你可以在 prompt 里提示它去使用某些工具,或者采用某些步骤,但应该不需要人为去把 workflow 拆出来。
Agent 的概念依旧重要,但应该回归它更加 native 的定义,即每一个 Agent 应该是独立的智能体,拥有自己的 memory, planning, tool use 等能力,能够端到端地解决问题,而不是需要人类按照自己的理解一口口地把饭喂到嘴里。一个 Agent 就应该是一辆独立的L5 Autopilot 的汽车,而不是一堆弱智 L2 Workflow 凑出来的所谓 multi agents 辅助驾驶杂牌军团。这听起来就很不优雅。
终极的解决方案应该不是这个样子的。现有的 (multi) agent workflow,速度慢先不说,最大的问题还是在接口的地方把信息降维了。这些 input / output 的接口和变量,本质上都是把信息降维到人能理解的维度,这是以高维信息的损失为代价的。每多一层 workflow,损失的信息就多了一次。面对简单问题时, (multi) agent workflow 或许是可行的,但它注定无法解决复杂问题。就好比Waymo 用感知+规控的架构,搭配高精地图,能够在凤凰城和三藩市勉强把本地 L4 跑通,但很难 scale 成一个通用的解法。只有 Tesla 端到端的方案才是自动驾驶的未来。
因此,现有的 (multi) agent workflow方式注定只是一个中间状态,类似自动驾驶中感知+规控+高精地图的拼凑。而最终想要解决复杂问题,需要靠基础模型的进化。当模型能力足够强之后,应该是可以端到端的解决问题。你可以在 prompt 里提示它去使用某些工具,或者采用某些步骤,但应该不需要人为去把 workflow 拆出来。
Agent 的概念依旧重要,但应该回归它更加 native 的定义,即每一个 Agent 应该是独立的智能体,拥有自己的 memory, planning, tool use 等能力,能够端到端地解决问题,而不是需要人类按照自己的理解一口口地把饭喂到嘴里。一个 Agent 就应该是一辆独立的L5 Autopilot 的汽车,而不是一堆弱智 L2 Workflow 凑出来的所谓 multi agents 辅助驾驶杂牌军团。这听起来就很不优雅。