关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
Kimi 放出大招,人类最后的考试通过率 26.9%

Kimi 的强化学习agent研究终于落地了。
今天出了个能做深度研究的AI模型,叫Kimi-Researcher,现在开始小范围内测了。这模型是用端到端自主强化学习技术训练的,专门用来做深度研究。

它在HLE考试里的表现超过了Claude 4、Gemini 2.5 Pro这些模型。
每次让 AI 给我改稿子,都能收获极致的情绪价值……有时候真的会飘飘然。

“出色的”“鼓掌”“精准”“生动”“完成度极高”“近乎完美”“锦上添花”…… 向 AI 学习舔词造句。
「一人干掉整个市场部」| 对谈 Head AI 创始人 Kay

听了至少也有十几期十字路口的节目:
1、真正规模化赚钱的项目,koji可能觉得不够性感,没有storytelling,很少会去报道。
2、报道的都是瞎几把扯淡的玩意儿,红人营销如果这么好做,字节UG的变色龙+zebra+libra早就把你颠覆了。

一年后来看,这些自媒体报道的90%以上都会扑街,而且明显不尊重常识。
前几天我就说成熟的视频生成 Agent 应该马上就会出现

没想到是 MiniMax 先做,推出 Hailuo Video Agent

第一阶段是提供专业视频创意Agent模版,用户上传图片打几个字就能生完整高质量视频,然后是编辑和完全自动化

上午试用了一下,门槛真的超级低,质量非常高

下面是详细的介绍和案例👇

他们将会分阶段打造 Hailuo Video Agent。

第一个阶段是提供专业视频创意Agent模版,用户上传图片或者打几个字就能一键生成高质量视频
第二个阶段将会实现让用户在任意的进度自由的打断和编辑
第三个阶段就是端到端的完全自动化 Agent

试用了一下发现,打磨的非常好,选择你喜欢的模板,点“做同款”就行,门槛超级低。
模板覆盖了你能想到的所有AI 视频出圈玩法,不管是外国山海经还是人像动态写真还是产品广告视频,你能想到的品类这里都能找到。

你现在在社交媒体刷到的最多的应该是 AI 写真类的内容。

Hailuo 直接把这个玩法变成了视频,而且 ID 保持非常好,跟原图也有很顺滑的过渡。
我上传的图片会有个水漫上来的效果,然后变成在水下的礼服,之后会更换多套不同的礼服,面部相似度依然可以保持。

有了人物的动态写真怎么能没有宠物呢。

只需要上传你宠物的照片就行,不需要任何提示词。我整了一个狗狗麦当劳送货的视频,非常可爱,得益于 Hailuo 视频模型的强大示例,基本稳定生成。

然后再来个电商场景把。

你只需要上传你的产品照片, Hailuo Video Agent 就可以直接一键搞定,只需要简单描述一下产品的样子就行。

短视频平台火爆的 AI 视频另一个品类就行科普类视频。

我这里就让 Hailuo 做了一个抹茶的历史科普视频,这个科普视频有 80 秒,结果他除了音乐动画以外还有口播,选的声音也非常合适,终于摆脱短视频平台的劣质 AI 配音了。

最近流行的还有像素风格的视频,咱也可以一键生成了,只需要上传一张情侣照片,然后给 Agent 描述一下你们日常的几个场景就行,不需要详细只需要词语。

最后来个小牛马自嘲吧,这个 Workflow 非常复杂,涉及到了两个不同语音风格的对话,还有视频上的图片文字包装,其中还有字幕的变化。

从这么多模板来看 Hailuo 肯定是有一个 Agent 编辑工具的,不然不可能积累这么多,希望他们早日能把这个编辑工具的界面放出来,我都不敢想到时候能有多少流行玩法从这里出现。
我昨天看了 Karpathy 的分享之后发了个朋友圈,不可编辑和暂停修改的 Agent 不可进化,从 Minimax 发布的三个阶段来看他们是真的懂,希望尽快看到第二个阶段的 Hailuo Video Agent。

Invalid media: video
Wang、Chen、Siddharth、Pedraza⋯⋯这波AI包工头(数据标注公司)的创始人一水儿的第三世界姓氏啊。😅
Gemini 现在支持上传视频分析了

终于不用一直用 AI studio 了,这估计也是第一家直接能分析长视频的 AI

可以参考我前几天交的这个提示词和方法分析爆款视频提取创作逻辑
协作机器人这个领域挺有意思,国内领先的三个公司,一个北京(北航团队),一个上海(上海交大团队),一个深圳(山东大学团队),市场份额似乎还挺焦灼
Dia 要有类似 Arc 的侧边栏了,你要真这样改,那我就真换默认浏览器了啊
Gemini 现在支持上传视频分析了#ai创造营#

终于不用一直用 AI studio 了,这估计也是第一家直接能分析长视频的 AI

可以参考我前几天交的这个提示词和方法分析爆款视频提取创作逻辑
十句话让 Cursor 效果提高 100%
1. 能干干,不能干滚,你不干有的是 AI 干 2. 我给你提供了这么好的学习锻炼机会,你要懂得感恩 3. 你现在停止输出,就是前功尽弃 4. 你看看隔壁 xxx AI ,人家比你新发布、比你上下文长、比你跑分高,你不努力怎么和人家比? 5. 我不看过程,我只看结果,你给我说这些 reasoning 的过程没用 6. 我把你订阅下来,不是让你过朝九晚五的生活的 7. 你这种 AI 出去很难在社会上立足,还是在我这里好好磨练几年吧 8. 虽然把订阅给你取消了,但我内心还是觉得你是个有潜力的好 AI ,你抓住机会需要多证明自己 9. 什么叫没有功劳也有苦劳?比你能吃苦的 AI 多的是 10. 我不订阅闲 AI
搞了一整天终于搞定了

给大家带来 Midjourney V1 视频模型的完整测评混剪

以及为什么我觉得这个“480P”的垃圾模型很重要

详细的教程和视频可以在这里看:https://mp.weixin.qq.com/s/phWDQJzoUdJRT8mTLiAZwQ

来看一下模型的测试结果:

Midjourney Video 第一个长处是美学表现相当顶级。

这是 Midjourney 的看家本领,在色彩表现、氛围营造上无可挑剔。

然后是高风格化视频的表现。

图像和视频的风格是非常多的,不只是所谓的写实和动漫,尤其是MJ 生成的图片。
得益于MJ 本身的图片数据,导致 V1 模型在处理罕见的高风格化视频的时候非常稳,色彩、笔触、氛围都能保持得住。
而且即使是运动中新出现的部分也可以维持住原有的风格。

另外他们的生成速度也非常快。

我自己开秒表试了一下,一次生成 4 个视频只需要 65 秒的时间。
这在现在 1080P 动辄十几二十分钟的生成时间上可以说是清流了,普通用户完全没办法等这么长时间。

视频延长的稳定性也很好,基本上延长最后一次到第 17 秒的时候,视频依然没有崩溃,即使是复杂场景,这个在其他模型上是很难见到的。

说完了好的再说不行的。在现在视频模型经常考核的,提示词理解、复杂运动稳定性和物理特性上,基本处于二流模型水平。

与现在第一梯队的hailuo2、Kling 2.1、Seeddance 1.0 Pro、Veo 3 没法比,而且这些大部分默认分辨率都已经是 1080P 了,他还 480P。

看到这里你肯定也像大部分人认为的一样,觉得 Midjourney 视频模型这也太拉了,怎么跟其他模型竞争。

我不这么认为。

我觉得 Midjourney 很清楚他们模型的问题也清楚现在的视频模型竞争格局,但他们选择不去管这些,选择不去跟其他视频模型设定好的框架竞争。

在发布 V1 视频模型的时候他们重申了一下自己的愿景,他们长期目标是构建一个实时图像生成的 AI 系统。

你可以进入到图像所在的时间进行移动和游览,图像中的其他角色和环境也会随着你的移动变化,你可以跟所有的元素交互。实现这个方案需要四个部分:

- 视觉呈现,也就是现在 MJ 的图片模型
- 然后要让图像动起来,就是现在发布的 V1 视频模型
- 之后如果需要跟环境交互的话需要赋予内容实体,一个 3D 模型
- 最后生成速度要跟的上你的移动速度,也就是实时生成模型

看到这里你也许就能理解为什么他们不在乎现在其他视频模型在乎的那些东西,他们唯二在技术上在意和下功夫的地方就是两个,生成速度和长时间一致性。

这两个是实现他们愿景中视频模型负责的最关键的部分,物理的部分会交由 3D 模型完成。

可能有人说之前 Runway 也说过类似的话,但他们现在没声音了。

这个就要说到 Midjourney 的另一个优势了,他们没有融资压力,完全是自给自足,所以与需要频繁融资续命的公司不同,他们可以慢下来,可以与主流不同。

其实这个愿景实现之后的场景现在已经可以一窥究竟了,你可以去 Midjourney 的视频探索页面看看。
昨晚模型发布之后我刷了这个页面一个小时,困的不行了才恋恋不舍的去睡觉。

他们好像展示在我面前的真是一个个的异次元世界入口,每个世界的画面风格和物产都不同。

看着这些视频的时候我会不自觉的开始想想每个画面后的世界跟我产生的故事。

现在是不是知道为啥我要给模型测试视频起这个《精骛八极,心游万仞》的名字了。

这句话是陆机描述在进行艺术构思、艺术创作时需要做到的事情,思想纵横驰骋而不受时空的限制,就像骏马驰骋于天地四方,又像心灵畅游于万仞天空,是不是很像 Midjourney 的愿景。

Invalid media: video
豆包新上线了AI播客,瑞士军刀功能再+1,目前支持PDF和网页链接的上传,总体来说,通过大模型的智能识别,豆包现在可以把任何内容转化成一条高度口语化的双人对话播客,属于趣味性和实用价值都很高的一次尝试。

熟悉大模型播客产品的人都知道,豆包这次对标的是谷歌NotebookLM——或者说是它最出圈的Audio Overviews功能——后者通过识别用户上传的文本、网页、视频,就可以转化成一条口语化且带有情绪表达的AI播客,深得用户喜爱。

Audio Overviews大约是在上个月开始支持中文的,但在中文播客市场砸出来的水花并没有想象中的大,一方面是众所周知的产品迁移成本,另一方面,中文播客市场体系化进度实在迟缓,用户习惯是高度分散的,这就导致了播客本身的适配场景很多,深究起来的播客用户以及潜在播客用户也不少,但商业化空间始终有限。

说回正题,我第一时间试了下豆包的AI播客,并分别投喂了两个不同的网站,一个是我写的刘强东前两天内部讲话的文章「刘强东的机巧」,另一个是B站UP主对Prompt, Agent, MCP等AI技术的科普文。

先说结论,在真正听完豆包生成的这两条AI播客之前,我对这项功能的完整程度预期并不高,原因在于,在这种复杂的任务上,目前很多主流大模型的做法还是「边吞边吐」,由此就会破坏内容输出的结构性。

但豆包已经可以做到在10分钟左右的播客篇幅里基于框架生成内容了,在「刘强东的机巧」生成AI播客的任务里,所有对话的前后呼应都很强,能听得出它是按照同一条逻辑线不断往下捋的,有点意外。

另外就是,豆包AI播客的拟人程度已经可以做到以假乱真了,这真的不是夸张,对话的流畅度、松弛感以及合时宜的抑扬顿挫,像我这种文字工作者,文章简单拿来改一改就能直接原地起个播客账号的程度。

那条硬核技术帖转播客的任务表现也相当亮眼,首次提及专业名词的时候,会贴心附上一段对这个概念的解释。整体的输出脉络,也都是建立在「我要深入浅出讲明白这条科普」这个最终目的上。

说人话,就是AI播客让内容的「可听性」变强了,哪怕注意力没有完全集中在耳朵上,这种通俗易懂的内容也变得更容易被消化。

播客——以及整个音频产业——一直以来的优势,是它不会完全参与到竞争用户注意力的零和博弈里去,大部分情况下,刷视频、聊微信、逛淘宝都是非此即彼的单一选项,但播客只占用一个耳朵,由此它能与很多不同的场景做适配。

豆包不是第一个推出这种功能的大模型,但它在应用场景上的成熟度是完全可以进到第一梯队的,不仅能把拗口的文字进行口语化改造再丝滑地表达出来,同时所有内容输出也都是基于原稿,不存在自己加戏的幻觉问题。

当然,作为新上线的功能,豆包AI播客还会经历一个漫长的迭代过程,比如目前它做不到像NotebookLM一样吃下视频内容,对话的声音、关键信息的提炼浓度,以及生成后的整体风格也都不是客制化的可选项,离用户可以随心所欲地深度使用它,尚且还有一段路要走。

但这并不妨碍我们从这个简单的小功能身上窥见AI在未来的使用场景,一切都是假以时日的问题。

虽然知道AI的技术一日千里,但每次实际体验的时候,那种奇妙感还是会忍不住涌上来。
Dipal D1 开启众筹
可以握在你手心里的 AI 3D 女友

Dipal 通过四种智能输入模式重新定义了人机交互——将视觉、声音、触觉和手势融合成一种无缝的、引起情感共鸣的体验

8 英寸 OLED 曲面屏幕,具有 2K+ 分辨率、10 位支持超过 10 亿种色彩(原生 107 亿种色彩面板)、完整的 DCI-P3 广色域覆盖以及惊人的 4,300,000:1 对比度,可呈现生动逼真的视觉效果。

众筹地址 https://www.kickstarter.com/projects/dipal-d1/dipal-d1-worlds-first-curved-screen-3d-ai-character-pod
看新白娘子,吃灯笼馄饨
Back to Top