关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
刚发现 MuleRun 发布 2.0 版本了,他们说上线一个月用户突破了 50 万,美国占比最高。

新版本可以帮用户配置专属的 Agent 团队,而且上线了非常多的垂直行业 Agent 专题。#ai创造营#

他们跟相关行业专业公司和团队合作创建 Agent 的方向也发展良好,创建了很多关于电商、数据分析和内容创作的专业 Agent。

现在进到官网会让你选择适合你职业的 Agent 团队,用户可以选择将多个 Agent 组合使用然后成体系的解决问题。

比如里面有阿里国际的 PicCopilot Agent ,封装了一堆适合电商的工具,比如 AI 商品展示图、风格克隆、虚拟试穿等。

可以帮助商家快速处理电商图片和视频素材,然后重新生成用于投放和宣传的内容。

另外还有 Quick BI 这个 AI 商业分析平台创建的数据和报表分析 Agent,可以快速对用户数据报表进行处理发现其中的机会或者异常。

我这手头没啥报表,拿前几天的健身数据表试了一下,居然也可以,而且他分析过程中会调用 Python 等编码工具所以不用担心 LLM 的幻觉问题。

我这里问了他对于下半身锻炼,使用负荷在10到30单位之间的练习的训练量分布(组数 × 次数)是多少?

他会先用工具分析和提取对应数据,然后 AI 才会介入分析提取出来的数据。

我还翻了一下其他的 Agent,现在基本你想到的 AI 能做的里面都有,甚至还有 sora 视频生成和去除 Sora 水印,哈哈

这种 Agent 市场一旦规模化对于用户还是非常方便的,啥功能都有,迭代速度也很快。
NotebookLM 的深度研究上了,但是他们这个交互非常有意思。

不是像之前一样给你出个报告。而是把所有收集到的上下文信息全部填充到左边的这个上下文列表里。

然后你愿意咋问咋问,你想让他输出啥就输出啥,包括输出音频概览和视频概览。

如果你想要研究一些东西的话,我感觉这种比较合适。#ai创造营#
推特和作品就是你最好的简历

原来在 Replicate 干的 fofr 加入了 DeepMind

很多人应该都会对这哥们有印象,在 Nano Banana 和 GPT-4o 图像发布的时候都持续产出了非常多好的案例和测试

估计 Deepmind 想用他补上自己在图像和视频上的宣传路径,哥们这下这结起飞了

当然,很荣幸老哥也关注了我#ai创造营#
真有你的 Sam!通过积分改革缩减 Sora2 配额,逼用户充钱

Open AI 除了会员体系以外又增加了新的付费点,昨晚更新,Sora 和 Codex 都可以在会员额度耗尽之后单独充值积分使用。

如果额度耗尽就会出现充值提示,Plus 会员不用为了某个模型单独买 200 美元的 Pro 了。

另外 Sora 终于显示每个人的免费额度了,免费和 Plus 用户每天 30 条,Pro 用户每天 100 条。

当我以为是好消息的时候,Vicky 提醒我那个余额是积分不是条数,我仔细一看还真是。

于是整理了一下现在具体的积分消耗和不同等级用户的生成限额。

即使 200 美元一个月的 Pro 会员一天也只能生成 5 条 Pro High 15 秒的视频,远低于之前的额度。

服了,我又当冤种了#ai创造营##ai视频#
终于有这么一本读物了,几个 AI 大佬研究员一起出了一个详细讲解扩散模型原理的论文

我翻译了一个双语版本,链接放下面了👇#ai创造营##ai画图#

可以非常全面的理解现在图像和视频模型的基石扩散模型,具体内容有:

第一章:概览生成模型的定义、重要性与谱系,为统一理解奠基。

第二章(VAE 视角):以变分推断连接到 DDPM,用潜变量与重构/去噪目标解释训练与采样。

第三章(EBM/Score 视角):从能量模型到 NCSN/Score SDE,以分数匹配和连续时间 SDE 描述生成动力学。

第四章:采样即沿时间反向求解 ODE/SDE,用扩散漂移向量场逐步逼近数据分布。

第五章(NF 视角):从正规化流到 Flow Matching,以可逆变换/流场学习统一“概率随时间运输”的思想。

第六章:以微积分的换元公式为统一底座,并以“条件化技巧”把难题化为回归,实现稳定可控的训练。

第八章:在 ODE 框架重审 DDIM、DPM-Solver,澄清与经典数值法的关系并解释快速采样原理。

第九章:系统化更优数值积分与误差控制,加速迭代采样同时保持保真度与稳定性。

第十章:提出一致性模型等“流映射”思路,直接学习任意时刻到任意时刻的解映射以少步生成。

第十一章:扩展一致性轨迹与 Mean Flow,以学习整条轨迹(积分)实现单步或极少步高质量生成。

双语 PDF:网页链接
Sora 2 还有一个新功能,可以直接从你抽卡随机的到的视频人物创建角色

这个很有用,比如你随机到一个很好的视频,你想要生产一条新的,就可以用这个功能保证角色一致性

对于构建连续长视频太有帮助了#ai创造营#
Mira 公司思维实验室的新文章:在线策略蒸馏,直接把强化学习和知识蒸馏的优点打包在一起了。#ai创造营#

让8B的小模型能达到32B大模型70%的性能,成本只要原来的1/10。

## 核心亮点

相比传统强化学习,在线策略蒸馏的计算效率提升了50-100倍。用Qwen3-8B在数学推理任务上,150步就能达到70%的AIME'24分数,而强化学习需要17920个GPU小时才能达到68%。

强化学习每个训练回合只教固定数量的比特,而蒸馏每个token都能给反馈。

训练新知识不会把原来的能力搞丢。他们做了个实验,用内部文档训练后,模型的指令跟随能力从85%掉到45%,用在线策略蒸馏一搞,直接恢复到83%,知识还保持在41%。

## 技术原理

在线策略蒸馏的核心思想很简单:让学生模型自己生成轨迹,然后老师模型给每个token打分。用的是反向KL散度作为损失函数,学生模型在老师模型的高概率行为上收敛。

具体实现就四步:
1. 初始化老师客户端
2. 从学生模型采样轨迹
3. 老师模型计算对数概率,算反向KL
4. 用强化学习的方式训练学生模型

感觉这会成为以后训练专用模型的标准套路,特别是那些对成本敏感但又想要性能的场景。就像Canva之于设计,HeyGen之于视频,在线策略蒸馏可能会成为AI模型定制的标配工具。

详情:thinkingmachines.ai/blog/on-policy-distillation/
最近随着 Veo 3.1 和 Sora 2 的发布,AI 内容产生爆款的频率越来越高了

最近刷到了好多个新的品类,比如这个 B 站 200 万播放的 AI 科比 Reaction Sora 2 AI 科比视频

整个的编排和左边的 AI 科比真实感做的太好了,我没快进看完了,虽然我不看 NBA#ai创造营##科比#
Hey Gen 用了不到两年半的时间,从 100 万美元到了一个亿,这个增长速度在 AI 行业也是相当猛的。#ai创造营#

他们 CEO 这次不只是分享里程碑数字,更重要的是他们把内部称为"圣经"的一套产品方法论公开出来了。

包含了团队内部无数次讨论、实验和踩坑之后总结出来的经验,总结一下做个笔记👇

HeyGen 把视频分成了两类:沟通类视频和电影类视频。

沟通类视频包括业务更新、教程、采访、播客、解释性视频,目的是说明、告知或传达信息,最适合基于脚本的编辑。电影类视频是高制作广告、电影、音乐视频、预告片这种,目的是打动、激发或娱乐观众,最适合时间线编辑。

HeyGen 的重点是让沟通类视频对所有人都可用。他们说的"所有人"是真正的所有人,从初学者到专业人士的每一种技能水平。产品足够简单,任何人都能在几分钟内制作出高质量的视频。

整个方法论的核心就一句话:
快速行动,成为绝对最佳。乘着 AI 浪潮,接受研究中的不确定性,押注未来六个月,构建随着模型改进而自我升级的灵活产品,同时不牺牲质量。

传统时代是在稳固基础上构建,为长久性优化,提前规划 12-18 个月,打磨好再发布,按序开发。AI 时代的 HeyGen Way 是乘着科技浪潮,为自动改进而构建,实际规划 2 个月周期(与模型升级周期一致),发布以学习,并行试验。

为什么是两个月?这个周期与模型升级周期一致,既能快速调整策略又能保持专注。

他们的节奏包括:两个月路线图规划,与 AI 进展周期同步,与领导层、技术负责人和产品经理深入回顾并制定策略。6-12 个月战略押注,预测并为下一次重大突破做准备。每两周承诺清单,产品和工程共同决定优先级。每日发布,改进、特性或实验每天上线。

实验流程很快:第 1 天定义假设和成功指标,第 2 天构建真正最小化的 MVP,第 3-5 天向部分用户发布,第 2 周分析学习并决定下一步。

好的实验要快(以天为单位不是周),科学化且数据驱动,提供明确信号(继续、转向或停止),做大动作而不是小修小补。大多数实验会失败,这是预期之内的。带着学习的失败等于胜利,没有学习的失败才是真正的失败。

## 提出五大运营原则
说一下 Sora 2 Pro 怎么生成 25 秒视频#ai创造营##sora2#

点击输入框的“故事板”按钮,进去以后右下角切换时间

普通用户 APP 更新之后创建视频的是可以选择时长:10 秒和 15 秒两个选项
即梦 4 用来做视频封面真是一绝!#ai创造营##ai画图#

用我昨天探索的动漫杂志风格提示词改了一个视频封面,点击率非常高,这里说一下制作步骤

步骤 1:
先用即梦 3.1 和这个提示词生成你喜欢的图片:将照片角色转换成动漫美女,美学风格非常现代且充满活力,像动态的杂志版面或波普艺术。将高对比度的人物剪影与半色调图案以及大量动感排版相结合,没有文字

步骤 2:
上传你选好的图片,输入提示词为它增加文字,这个时候模型要换成即梦 4:在图片在上方增加留白和优秀的艺术文字排版,替换原有的文字:“Sora2制作高质量动漫片头”“藏师傅教你”,文字跟图片融合的很好

步骤3:
上传你的真人照片和步骤 2 的结果图,替换原来的动漫角色,这时候是动漫风格的:图片的人物替代图 1 的动漫角色,为人物加上白色描边

步骤 4:
如果需要真人风格,上传步骤 2 结果图和你的真人照片,使用提示词:图片的人物替代图 1 的动漫角色,保证人物的写实风格,同时在人物后方增加一些网点和波普艺术排版元素,为人物加上白色描边

步骤 5:
如果需要更多比例的封面图片的话,重复步骤 4 切换生成图片的比例就行
提示词:

手机拍摄,全身视角图片中的女孩,黑色短发加小辫子,右边有奶油色迷你丝带,在衣服还没穿好场景在寝室里里,脸上带着羞涩的神情,空身感觉凸显构图略显混乱,现平庸日常快照风格。随机表情动作搭配组合。比例 9:16。 #AI
grok 新的视频生成模型可以生成完全漏点的视频,一点都不拦截,老马疯了
#ai创造营#
Sora 2 APP 已经可以下载,使用的话需要邀请码#ai创造营#

根据商店宣传页的内容支持的能力有:

支持文本生成视频;
支持在已有视频上追加元素,也就是 Remix;
支持把指定用户/人物作为片段角色置入视频;
支持展示个人主页,发布自己创作的视频。
阿里昨晚又疯狂输出了,开源了首个可以本地运行的端到端的全模态理解 LLM Qwen3-Omni #ai创造营#

可以处理文本、图像、音频和视频输出,支持输出文本和音频的流式输出。

提高音频和视频理解的同时,单模态的文本和图像没有退化。

基于 MoE 的 Thinker–Talker 设计,采用 AuT 预训练以获得强泛化表示,外加多码本设计以降低延迟。

还开源了一个对应的 Captioner 音频描述模型。

低延迟流式传输,具备自然的轮流对话和即时的文本或语音响应。

详情:github.com/QwenLM/Qwen3-Omni
前几天还在找邀请码的朋友可以不用找了,Mule Run 开放注册了!

他们管自己叫 AI 劳动力市场,每个 Agent 就是一个数字员工,你可以雇佣他们完成任务。

而且现在注册送 1000 积分,可以爽玩很久了。#ai创造营#

另外现在他们还推出了 Creator 支持计划,可以根据创作者为 MuleRun 带来的 GMV 直接获得现金奖励,最高会超过 10000 美元!

申请并且发布第一个 Agent,可以直接获得 100 美元等值积分补贴。

最近他们又增加了很多新的 Agent 玩法,覆盖了最近各种 AI 玩法和实用的工具。

比如有一个 AI 求职视频简历制作器,只需要输入你的想法以及环境描述,他就会根据你的信息帮你生成一个求职视频,你可以发在社交媒体等待算法发力。

还有就是他们还接入了 Nano Banana,发布了不少热门 Banana 玩法。

比如老照片修复器以及 3D 桌面手办照片生成,还有日常发布文章需要的插图生成,九宫格不同姿势照片生成等,操作门槛低了不少。

这个要是开放创建,藏师傅能把探索页面灌满。

甚至有 AI 推理游戏,里面每个嫌疑人对话都会根据你的选择发生变化,你可以在互动和探索中寻找线索,解锁隐藏区域,你还可以点击图片进行交互收集证据。

目前来看他们这种跟优质创作者合作,放宽使用门槛,提高创作门槛的策略确实不错。

可以确保大部分 C 端用户用到质量相对高的 Agent,而不会像其他类似平台那样一进来就被各种用户和产品团队作恶的劣质 Agent 劝退。

如果你是Agent 创建大牛可以去注册创作者,如果是普通用户也可以去玩玩这些你觉得好玩的 Agent。
Veo 3 API 更新,大幅降价接近 50%,而且支持生成 1080P 分辨率视频

另外终于支持竖屏 9:16 比例的视频生成了,太难了#ai创造营#
快手在视频上的布局越来越全面了啊,这几天开源了 Kwai Keye-VL-1.5-8B 模型

除了支持图像识别以外,视频理解能力也很强,加上 8B 的大小非常适合本地部署用来做视频标注和内容识别。#ai创造营#

我试了一下,给了一个是描述视频画面内容以及查找分镜时间和每个分镜的内容描述都做的不错。

模型主要优势有:

短视频理解:在Video-MME的短视频子集测试中,Keye-VL-1.5-8B获得81.2的高分,超过了GPT-4o及同类模型。

视频定位能力:能够在一个26秒的短视频中,将目标物(如包)出现的时间段精确定位到0.1秒级别

视觉推理能力:能够理解视频中相对复杂的行为动机比如论文案例里面可以从两只狗的行为推测动机。

模型核心创新主要有下面几个方面:

针对视频内容动态且信息密集的特点,Keye-VL-1.5 提出了一种新颖的“Slow-Fast”视频编码策略,以有效平衡空间分辨率和时间覆盖率。

慢速通路以高分辨率处理视觉变化显著的关键帧,而快速通路则以较低分辨率但更高的时间覆盖率处理相对静态的帧。

另外模型采用了精心设计的四阶段渐进式预训练流程,系统性地将模型的上下文长度从8K扩展到128K,可以理解更加复杂的视觉信息。

在后训练阶段为解决冷启动问题,模型设计了一个五步自动化流水线来生成高质量的长链思考数据,包括数据收集、问题重写、多路径推理生成、双层质量评估和人工指导改进。

引入了“渐进式提示采样”机制来处理困难样本,即当模型多次回答错误时,在提示中给予不同层级的提示,以提高训练效率和模型推理能力

项目地址:github.com/Kwai-Keye/Keye
这里尝试:huggingface.co/spaces/Kwai-Keye/Keye-VL-1_5-8B
论文:arxiv.org/pdf/2509.01563
Nano Banana 居然可以让角色摆出类似汉字的姿势?#ai创造营#

刚才看到一个 B 站 UP 自己自己摆出类似汉字的姿势跳舞

Nano Banana 姿势参考也很强,就拿视频里面的字符试了一下,没想到真行啊

提示词:将图 1 中的人物改为与图 2 字符相似的全身姿势,生成的图片不要有字符,必要时可以用配饰辅助
Deepmind 负责 Nano Banana 的模型研究员录了一期播客(youtube.com/watch?v=H6ZXujE1qBA),非常值得看一下,我整理了一下视频内容:#ai创造营#

新模型与原生图像生成的核心:
2.5 的核心变化,在于将图像生成、理解与编辑纳入同一多模态上下文里执行。“原生图像生成”意味着模型在一次对话流中逐步产出多张图,并且每一步都“看得到”之前生成的图像与文本,从而可以在风格、构图和语义上保持连续一致。
它更像是一条带状态的生成轨道,每一步的输出既是结果,也是下一步的条件。这一“交错式生成”范式,让复杂编辑自然拆分为多步序列,避免了在“单步巨复杂指令”中丢失细节。
当把“理解”和“生成”并置在同一训练与推理体内会有明显的“正向迁移”:图像理解能力的提升,会帮助生成学习到更多关于真实世界与视觉结构的知识;反之亦然。

文本渲染为何重要:
传统图像/视频模型优化,很依赖人类偏好作为评测信号,这类信号真实但成本高、滞后长、主观性强,难以高频爬坡。
团队因此寻找可以在训练过程中高频追踪的替代指标。文本渲染成为突破口:若模型能在图像中准确构造字形、排布与空间关系,说明其对“视觉结构”的掌握在增强。
这一代理指标的价值在于可持续追踪:无论是架构、数据、训练策略的实验,只要把文本渲染纳入固定监控,就能避免回归,并捕捉到意外有效的改动。
字是一种高度结构化的微任务。当模型学会了在复杂背景中稳定地“写字”,它也更有机会正确处理“平行线条”“规整网格”等同样结构化的视觉课题,让整体画面更可信。

多模态正向迁移:
团队把图像理解与生成称作姐妹。统一训练的目标,是在同一模型里学习多模态的理解/生成能力,并在两者之间产生“正向迁移”。
在生成中辅助理解”的路径:让模型在解题过程中画图打草稿,以更好地把抽象问题视觉化、结构化。一次会话里,模型既能接收用户图片、文本,又能生成中间图像,再用这些中间产物辅助下一步思考,形成自洽的多模态推理链。

展望,从更好看到更聪明与更靠谱:
对未来方向,团队强调两条主线:其一是聪明感”。他们希望当用户指令“不充分、甚至有误”时,模型能“越级发挥”,做出“比用户描述更好”的结果。
其二是事实性/严谨性。在图表、流程图、信息图等“既要好看又要准确”的任务里,模型需要严格遵循事实与排版约束,避免多余文本和逻辑错误,让视觉表达与内容正确双达标。
 
 
Back to Top