关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
胡思乱想:
1. 已经快2年了,模型能力发展飞快,各个维度天翻地覆,但是大家生活生产方式似乎变化并不大,一定有什么地方 不对。 从找到这个不对的原因入手,再看能不能改变世界。
2. 上上家公司我从建团队开始就是飞书native,我打心底里觉得飞书很好用。 两个问题 a 各位抚心自问,能做到飞书*10的体验? 不能 那为什么做。 b 飞书都那么好用了 为什么没有称霸世界? ( 为什么 国外很少all - in - one的产品做的大?)
3. manus出了chat模式 - 用户对chat心智是定的 提问和用agent分开
4. manus 出了playbook 大家反过来各种宣传for ppt for sheet 界面上可以选成品 - 用户愿意用点击让自己意图更明确 结果更有预期
5. @月光 跟我聊的时候说了一句话 我反复琢磨了很久,最终我觉得是对的。 用户点一下表达的东西很有可能是最经济的。 的确 从整个系统的角度来看,用户点一下消耗的token ,和 用户不点 模型各种判断意图巴拉巴拉消耗的token比肯定是更经济的。
上面几个点plaud都有自己的答案 也在努力把自己的观点交付给世界
1. 已经快2年了,模型能力发展飞快,各个维度天翻地覆,但是大家生活生产方式似乎变化并不大,一定有什么地方 不对。 从找到这个不对的原因入手,再看能不能改变世界。
2. 上上家公司我从建团队开始就是飞书native,我打心底里觉得飞书很好用。 两个问题 a 各位抚心自问,能做到飞书*10的体验? 不能 那为什么做。 b 飞书都那么好用了 为什么没有称霸世界? ( 为什么 国外很少all - in - one的产品做的大?)
3. manus出了chat模式 - 用户对chat心智是定的 提问和用agent分开
4. manus 出了playbook 大家反过来各种宣传for ppt for sheet 界面上可以选成品 - 用户愿意用点击让自己意图更明确 结果更有预期
5. @月光 跟我聊的时候说了一句话 我反复琢磨了很久,最终我觉得是对的。 用户点一下表达的东西很有可能是最经济的。 的确 从整个系统的角度来看,用户点一下消耗的token ,和 用户不点 模型各种判断意图巴拉巴拉消耗的token比肯定是更经济的。
上面几个点plaud都有自己的答案 也在努力把自己的观点交付给世界
听了至少也有十几期十字路口的节目:
1、真正规模化赚钱的项目,koji可能觉得不够性感,没有storytelling,很少会去报道。
2、报道的都是瞎几把扯淡的玩意儿,红人营销如果这么好做,字节UG的变色龙+zebra+libra早就把你颠覆了。
一年后来看,这些自媒体报道的90%以上都会扑街,而且明显不尊重常识。
前几天我就说成熟的视频生成 Agent 应该马上就会出现
没想到是 MiniMax 先做,推出 Hailuo Video Agent
第一阶段是提供专业视频创意Agent模版,用户上传图片打几个字就能生完整高质量视频,然后是编辑和完全自动化
上午试用了一下,门槛真的超级低,质量非常高
下面是详细的介绍和案例👇
他们将会分阶段打造 Hailuo Video Agent。
第一个阶段是提供专业视频创意Agent模版,用户上传图片或者打几个字就能一键生成高质量视频
第二个阶段将会实现让用户在任意的进度自由的打断和编辑
第三个阶段就是端到端的完全自动化 Agent
试用了一下发现,打磨的非常好,选择你喜欢的模板,点“做同款”就行,门槛超级低。
模板覆盖了你能想到的所有AI 视频出圈玩法,不管是外国山海经还是人像动态写真还是产品广告视频,你能想到的品类这里都能找到。
你现在在社交媒体刷到的最多的应该是 AI 写真类的内容。
Hailuo 直接把这个玩法变成了视频,而且 ID 保持非常好,跟原图也有很顺滑的过渡。
我上传的图片会有个水漫上来的效果,然后变成在水下的礼服,之后会更换多套不同的礼服,面部相似度依然可以保持。
有了人物的动态写真怎么能没有宠物呢。
只需要上传你宠物的照片就行,不需要任何提示词。我整了一个狗狗麦当劳送货的视频,非常可爱,得益于 Hailuo 视频模型的强大示例,基本稳定生成。
然后再来个电商场景把。
你只需要上传你的产品照片, Hailuo Video Agent 就可以直接一键搞定,只需要简单描述一下产品的样子就行。
短视频平台火爆的 AI 视频另一个品类就行科普类视频。
我这里就让 Hailuo 做了一个抹茶的历史科普视频,这个科普视频有 80 秒,结果他除了音乐动画以外还有口播,选的声音也非常合适,终于摆脱短视频平台的劣质 AI 配音了。
最近流行的还有像素风格的视频,咱也可以一键生成了,只需要上传一张情侣照片,然后给 Agent 描述一下你们日常的几个场景就行,不需要详细只需要词语。
最后来个小牛马自嘲吧,这个 Workflow 非常复杂,涉及到了两个不同语音风格的对话,还有视频上的图片文字包装,其中还有字幕的变化。
从这么多模板来看 Hailuo 肯定是有一个 Agent 编辑工具的,不然不可能积累这么多,希望他们早日能把这个编辑工具的界面放出来,我都不敢想到时候能有多少流行玩法从这里出现。
我昨天看了 Karpathy 的分享之后发了个朋友圈,不可编辑和暂停修改的 Agent 不可进化,从 Minimax 发布的三个阶段来看他们是真的懂,希望尽快看到第二个阶段的 Hailuo Video Agent。
Invalid media: video
没想到是 MiniMax 先做,推出 Hailuo Video Agent
第一阶段是提供专业视频创意Agent模版,用户上传图片打几个字就能生完整高质量视频,然后是编辑和完全自动化
上午试用了一下,门槛真的超级低,质量非常高
下面是详细的介绍和案例👇
他们将会分阶段打造 Hailuo Video Agent。
第一个阶段是提供专业视频创意Agent模版,用户上传图片或者打几个字就能一键生成高质量视频
第二个阶段将会实现让用户在任意的进度自由的打断和编辑
第三个阶段就是端到端的完全自动化 Agent
试用了一下发现,打磨的非常好,选择你喜欢的模板,点“做同款”就行,门槛超级低。
模板覆盖了你能想到的所有AI 视频出圈玩法,不管是外国山海经还是人像动态写真还是产品广告视频,你能想到的品类这里都能找到。
你现在在社交媒体刷到的最多的应该是 AI 写真类的内容。
Hailuo 直接把这个玩法变成了视频,而且 ID 保持非常好,跟原图也有很顺滑的过渡。
我上传的图片会有个水漫上来的效果,然后变成在水下的礼服,之后会更换多套不同的礼服,面部相似度依然可以保持。
有了人物的动态写真怎么能没有宠物呢。
只需要上传你宠物的照片就行,不需要任何提示词。我整了一个狗狗麦当劳送货的视频,非常可爱,得益于 Hailuo 视频模型的强大示例,基本稳定生成。
然后再来个电商场景把。
你只需要上传你的产品照片, Hailuo Video Agent 就可以直接一键搞定,只需要简单描述一下产品的样子就行。
短视频平台火爆的 AI 视频另一个品类就行科普类视频。
我这里就让 Hailuo 做了一个抹茶的历史科普视频,这个科普视频有 80 秒,结果他除了音乐动画以外还有口播,选的声音也非常合适,终于摆脱短视频平台的劣质 AI 配音了。
最近流行的还有像素风格的视频,咱也可以一键生成了,只需要上传一张情侣照片,然后给 Agent 描述一下你们日常的几个场景就行,不需要详细只需要词语。
最后来个小牛马自嘲吧,这个 Workflow 非常复杂,涉及到了两个不同语音风格的对话,还有视频上的图片文字包装,其中还有字幕的变化。
从这么多模板来看 Hailuo 肯定是有一个 Agent 编辑工具的,不然不可能积累这么多,希望他们早日能把这个编辑工具的界面放出来,我都不敢想到时候能有多少流行玩法从这里出现。
我昨天看了 Karpathy 的分享之后发了个朋友圈,不可编辑和暂停修改的 Agent 不可进化,从 Minimax 发布的三个阶段来看他们是真的懂,希望尽快看到第二个阶段的 Hailuo Video Agent。
Invalid media: video
十句话让 Cursor 效果提高 100%
1. 能干干,不能干滚,你不干有的是 AI 干 2. 我给你提供了这么好的学习锻炼机会,你要懂得感恩 3. 你现在停止输出,就是前功尽弃 4. 你看看隔壁 xxx AI ,人家比你新发布、比你上下文长、比你跑分高,你不努力怎么和人家比? 5. 我不看过程,我只看结果,你给我说这些 reasoning 的过程没用 6. 我把你订阅下来,不是让你过朝九晚五的生活的 7. 你这种 AI 出去很难在社会上立足,还是在我这里好好磨练几年吧 8. 虽然把订阅给你取消了,但我内心还是觉得你是个有潜力的好 AI ,你抓住机会需要多证明自己 9. 什么叫没有功劳也有苦劳?比你能吃苦的 AI 多的是 10. 我不订阅闲 AI
1. 能干干,不能干滚,你不干有的是 AI 干 2. 我给你提供了这么好的学习锻炼机会,你要懂得感恩 3. 你现在停止输出,就是前功尽弃 4. 你看看隔壁 xxx AI ,人家比你新发布、比你上下文长、比你跑分高,你不努力怎么和人家比? 5. 我不看过程,我只看结果,你给我说这些 reasoning 的过程没用 6. 我把你订阅下来,不是让你过朝九晚五的生活的 7. 你这种 AI 出去很难在社会上立足,还是在我这里好好磨练几年吧 8. 虽然把订阅给你取消了,但我内心还是觉得你是个有潜力的好 AI ,你抓住机会需要多证明自己 9. 什么叫没有功劳也有苦劳?比你能吃苦的 AI 多的是 10. 我不订阅闲 AI
搞了一整天终于搞定了
给大家带来 Midjourney V1 视频模型的完整测评混剪
以及为什么我觉得这个“480P”的垃圾模型很重要
详细的教程和视频可以在这里看:https://mp.weixin.qq.com/s/phWDQJzoUdJRT8mTLiAZwQ
来看一下模型的测试结果:
Midjourney Video 第一个长处是美学表现相当顶级。
这是 Midjourney 的看家本领,在色彩表现、氛围营造上无可挑剔。
然后是高风格化视频的表现。
图像和视频的风格是非常多的,不只是所谓的写实和动漫,尤其是MJ 生成的图片。
得益于MJ 本身的图片数据,导致 V1 模型在处理罕见的高风格化视频的时候非常稳,色彩、笔触、氛围都能保持得住。
而且即使是运动中新出现的部分也可以维持住原有的风格。
另外他们的生成速度也非常快。
我自己开秒表试了一下,一次生成 4 个视频只需要 65 秒的时间。
这在现在 1080P 动辄十几二十分钟的生成时间上可以说是清流了,普通用户完全没办法等这么长时间。
视频延长的稳定性也很好,基本上延长最后一次到第 17 秒的时候,视频依然没有崩溃,即使是复杂场景,这个在其他模型上是很难见到的。
说完了好的再说不行的。在现在视频模型经常考核的,提示词理解、复杂运动稳定性和物理特性上,基本处于二流模型水平。
与现在第一梯队的hailuo2、Kling 2.1、Seeddance 1.0 Pro、Veo 3 没法比,而且这些大部分默认分辨率都已经是 1080P 了,他还 480P。
看到这里你肯定也像大部分人认为的一样,觉得 Midjourney 视频模型这也太拉了,怎么跟其他模型竞争。
我不这么认为。
我觉得 Midjourney 很清楚他们模型的问题也清楚现在的视频模型竞争格局,但他们选择不去管这些,选择不去跟其他视频模型设定好的框架竞争。
在发布 V1 视频模型的时候他们重申了一下自己的愿景,他们长期目标是构建一个实时图像生成的 AI 系统。
你可以进入到图像所在的时间进行移动和游览,图像中的其他角色和环境也会随着你的移动变化,你可以跟所有的元素交互。实现这个方案需要四个部分:
- 视觉呈现,也就是现在 MJ 的图片模型
- 然后要让图像动起来,就是现在发布的 V1 视频模型
- 之后如果需要跟环境交互的话需要赋予内容实体,一个 3D 模型
- 最后生成速度要跟的上你的移动速度,也就是实时生成模型
看到这里你也许就能理解为什么他们不在乎现在其他视频模型在乎的那些东西,他们唯二在技术上在意和下功夫的地方就是两个,生成速度和长时间一致性。
这两个是实现他们愿景中视频模型负责的最关键的部分,物理的部分会交由 3D 模型完成。
可能有人说之前 Runway 也说过类似的话,但他们现在没声音了。
这个就要说到 Midjourney 的另一个优势了,他们没有融资压力,完全是自给自足,所以与需要频繁融资续命的公司不同,他们可以慢下来,可以与主流不同。
其实这个愿景实现之后的场景现在已经可以一窥究竟了,你可以去 Midjourney 的视频探索页面看看。
昨晚模型发布之后我刷了这个页面一个小时,困的不行了才恋恋不舍的去睡觉。
他们好像展示在我面前的真是一个个的异次元世界入口,每个世界的画面风格和物产都不同。
看着这些视频的时候我会不自觉的开始想想每个画面后的世界跟我产生的故事。
现在是不是知道为啥我要给模型测试视频起这个《精骛八极,心游万仞》的名字了。
这句话是陆机描述在进行艺术构思、艺术创作时需要做到的事情,思想纵横驰骋而不受时空的限制,就像骏马驰骋于天地四方,又像心灵畅游于万仞天空,是不是很像 Midjourney 的愿景。
Invalid media: video
给大家带来 Midjourney V1 视频模型的完整测评混剪
以及为什么我觉得这个“480P”的垃圾模型很重要
详细的教程和视频可以在这里看:https://mp.weixin.qq.com/s/phWDQJzoUdJRT8mTLiAZwQ
来看一下模型的测试结果:
Midjourney Video 第一个长处是美学表现相当顶级。
这是 Midjourney 的看家本领,在色彩表现、氛围营造上无可挑剔。
然后是高风格化视频的表现。
图像和视频的风格是非常多的,不只是所谓的写实和动漫,尤其是MJ 生成的图片。
得益于MJ 本身的图片数据,导致 V1 模型在处理罕见的高风格化视频的时候非常稳,色彩、笔触、氛围都能保持得住。
而且即使是运动中新出现的部分也可以维持住原有的风格。
另外他们的生成速度也非常快。
我自己开秒表试了一下,一次生成 4 个视频只需要 65 秒的时间。
这在现在 1080P 动辄十几二十分钟的生成时间上可以说是清流了,普通用户完全没办法等这么长时间。
视频延长的稳定性也很好,基本上延长最后一次到第 17 秒的时候,视频依然没有崩溃,即使是复杂场景,这个在其他模型上是很难见到的。
说完了好的再说不行的。在现在视频模型经常考核的,提示词理解、复杂运动稳定性和物理特性上,基本处于二流模型水平。
与现在第一梯队的hailuo2、Kling 2.1、Seeddance 1.0 Pro、Veo 3 没法比,而且这些大部分默认分辨率都已经是 1080P 了,他还 480P。
看到这里你肯定也像大部分人认为的一样,觉得 Midjourney 视频模型这也太拉了,怎么跟其他模型竞争。
我不这么认为。
我觉得 Midjourney 很清楚他们模型的问题也清楚现在的视频模型竞争格局,但他们选择不去管这些,选择不去跟其他视频模型设定好的框架竞争。
在发布 V1 视频模型的时候他们重申了一下自己的愿景,他们长期目标是构建一个实时图像生成的 AI 系统。
你可以进入到图像所在的时间进行移动和游览,图像中的其他角色和环境也会随着你的移动变化,你可以跟所有的元素交互。实现这个方案需要四个部分:
- 视觉呈现,也就是现在 MJ 的图片模型
- 然后要让图像动起来,就是现在发布的 V1 视频模型
- 之后如果需要跟环境交互的话需要赋予内容实体,一个 3D 模型
- 最后生成速度要跟的上你的移动速度,也就是实时生成模型
看到这里你也许就能理解为什么他们不在乎现在其他视频模型在乎的那些东西,他们唯二在技术上在意和下功夫的地方就是两个,生成速度和长时间一致性。
这两个是实现他们愿景中视频模型负责的最关键的部分,物理的部分会交由 3D 模型完成。
可能有人说之前 Runway 也说过类似的话,但他们现在没声音了。
这个就要说到 Midjourney 的另一个优势了,他们没有融资压力,完全是自给自足,所以与需要频繁融资续命的公司不同,他们可以慢下来,可以与主流不同。
其实这个愿景实现之后的场景现在已经可以一窥究竟了,你可以去 Midjourney 的视频探索页面看看。
昨晚模型发布之后我刷了这个页面一个小时,困的不行了才恋恋不舍的去睡觉。
他们好像展示在我面前的真是一个个的异次元世界入口,每个世界的画面风格和物产都不同。
看着这些视频的时候我会不自觉的开始想想每个画面后的世界跟我产生的故事。
现在是不是知道为啥我要给模型测试视频起这个《精骛八极,心游万仞》的名字了。
这句话是陆机描述在进行艺术构思、艺术创作时需要做到的事情,思想纵横驰骋而不受时空的限制,就像骏马驰骋于天地四方,又像心灵畅游于万仞天空,是不是很像 Midjourney 的愿景。
Invalid media: video