关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
不是像之前一样给你出个报告。而是把所有收集到的上下文信息全部填充到左边的这个上下文列表里。
然后你愿意咋问咋问,你想让他输出啥就输出啥,包括输出音频概览和视频概览。
如果你想要研究一些东西的话,我感觉这种比较合适。#ai创造营#
原来在 Replicate 干的 fofr 加入了 DeepMind
很多人应该都会对这哥们有印象,在 Nano Banana 和 GPT-4o 图像发布的时候都持续产出了非常多好的案例和测试
估计 Deepmind 想用他补上自己在图像和视频上的宣传路径,哥们这下这结起飞了
当然,很荣幸老哥也关注了我#ai创造营#
Open AI 除了会员体系以外又增加了新的付费点,昨晚更新,Sora 和 Codex 都可以在会员额度耗尽之后单独充值积分使用。
如果额度耗尽就会出现充值提示,Plus 会员不用为了某个模型单独买 200 美元的 Pro 了。
另外 Sora 终于显示每个人的免费额度了,免费和 Plus 用户每天 30 条,Pro 用户每天 100 条。
当我以为是好消息的时候,Vicky 提醒我那个余额是积分不是条数,我仔细一看还真是。
于是整理了一下现在具体的积分消耗和不同等级用户的生成限额。
即使 200 美元一个月的 Pro 会员一天也只能生成 5 条 Pro High 15 秒的视频,远低于之前的额度。
服了,我又当冤种了#ai创造营##ai视频#
我翻译了一个双语版本,链接放下面了👇#ai创造营##ai画图#
可以非常全面的理解现在图像和视频模型的基石扩散模型,具体内容有:
第一章:概览生成模型的定义、重要性与谱系,为统一理解奠基。
第二章(VAE 视角):以变分推断连接到 DDPM,用潜变量与重构/去噪目标解释训练与采样。
第三章(EBM/Score 视角):从能量模型到 NCSN/Score SDE,以分数匹配和连续时间 SDE 描述生成动力学。
第四章:采样即沿时间反向求解 ODE/SDE,用扩散漂移向量场逐步逼近数据分布。
第五章(NF 视角):从正规化流到 Flow Matching,以可逆变换/流场学习统一“概率随时间运输”的思想。
第六章:以微积分的换元公式为统一底座,并以“条件化技巧”把难题化为回归,实现稳定可控的训练。
第八章:在 ODE 框架重审 DDIM、DPM-Solver,澄清与经典数值法的关系并解释快速采样原理。
第九章:系统化更优数值积分与误差控制,加速迭代采样同时保持保真度与稳定性。
第十章:提出一致性模型等“流映射”思路,直接学习任意时刻到任意时刻的解映射以少步生成。
第十一章:扩展一致性轨迹与 Mean Flow,以学习整条轨迹(积分)实现单步或极少步高质量生成。
双语 PDF:网页链接
这个很有用,比如你随机到一个很好的视频,你想要生产一条新的,就可以用这个功能保证角色一致性
对于构建连续长视频太有帮助了#ai创造营#
让8B的小模型能达到32B大模型70%的性能,成本只要原来的1/10。
## 核心亮点
相比传统强化学习,在线策略蒸馏的计算效率提升了50-100倍。用Qwen3-8B在数学推理任务上,150步就能达到70%的AIME'24分数,而强化学习需要17920个GPU小时才能达到68%。
强化学习每个训练回合只教固定数量的比特,而蒸馏每个token都能给反馈。
训练新知识不会把原来的能力搞丢。他们做了个实验,用内部文档训练后,模型的指令跟随能力从85%掉到45%,用在线策略蒸馏一搞,直接恢复到83%,知识还保持在41%。
## 技术原理
在线策略蒸馏的核心思想很简单:让学生模型自己生成轨迹,然后老师模型给每个token打分。用的是反向KL散度作为损失函数,学生模型在老师模型的高概率行为上收敛。
具体实现就四步:
1. 初始化老师客户端
2. 从学生模型采样轨迹
3. 老师模型计算对数概率,算反向KL
4. 用强化学习的方式训练学生模型
感觉这会成为以后训练专用模型的标准套路,特别是那些对成本敏感但又想要性能的场景。就像Canva之于设计,HeyGen之于视频,在线策略蒸馏可能会成为AI模型定制的标配工具。
详情:thinkingmachines.ai/blog/on-policy-distillation/
他们 CEO 这次不只是分享里程碑数字,更重要的是他们把内部称为"圣经"的一套产品方法论公开出来了。
包含了团队内部无数次讨论、实验和踩坑之后总结出来的经验,总结一下做个笔记👇:
HeyGen 把视频分成了两类:沟通类视频和电影类视频。
沟通类视频包括业务更新、教程、采访、播客、解释性视频,目的是说明、告知或传达信息,最适合基于脚本的编辑。电影类视频是高制作广告、电影、音乐视频、预告片这种,目的是打动、激发或娱乐观众,最适合时间线编辑。
HeyGen 的重点是让沟通类视频对所有人都可用。他们说的"所有人"是真正的所有人,从初学者到专业人士的每一种技能水平。产品足够简单,任何人都能在几分钟内制作出高质量的视频。
整个方法论的核心就一句话:
快速行动,成为绝对最佳。乘着 AI 浪潮,接受研究中的不确定性,押注未来六个月,构建随着模型改进而自我升级的灵活产品,同时不牺牲质量。
传统时代是在稳固基础上构建,为长久性优化,提前规划 12-18 个月,打磨好再发布,按序开发。AI 时代的 HeyGen Way 是乘着科技浪潮,为自动改进而构建,实际规划 2 个月周期(与模型升级周期一致),发布以学习,并行试验。
为什么是两个月?这个周期与模型升级周期一致,既能快速调整策略又能保持专注。
他们的节奏包括:两个月路线图规划,与 AI 进展周期同步,与领导层、技术负责人和产品经理深入回顾并制定策略。6-12 个月战略押注,预测并为下一次重大突破做准备。每两周承诺清单,产品和工程共同决定优先级。每日发布,改进、特性或实验每天上线。
实验流程很快:第 1 天定义假设和成功指标,第 2 天构建真正最小化的 MVP,第 3-5 天向部分用户发布,第 2 周分析学习并决定下一步。
好的实验要快(以天为单位不是周),科学化且数据驱动,提供明确信号(继续、转向或停止),做大动作而不是小修小补。大多数实验会失败,这是预期之内的。带着学习的失败等于胜利,没有学习的失败才是真正的失败。
## 提出五大运营原则
提示词:
手机拍摄,全身视角图片中的女孩,黑色短发加小辫子,右边有奶油色迷你丝带,在衣服还没穿好场景在寝室里里,脸上带着羞涩的神情,空身感觉凸显构图略显混乱,现平庸日常快照风格。随机表情动作搭配组合。比例 9:16。 #AI
手机拍摄,全身视角图片中的女孩,黑色短发加小辫子,右边有奶油色迷你丝带,在衣服还没穿好场景在寝室里里,脸上带着羞涩的神情,空身感觉凸显构图略显混乱,现平庸日常快照风格。随机表情动作搭配组合。比例 9:16。 #AI
grok 新的视频生成模型可以生成完全漏点的视频,一点都不拦截,老马疯了
#ai创造营#
#ai创造营#
新模型与原生图像生成的核心:
2.5 的核心变化,在于将图像生成、理解与编辑纳入同一多模态上下文里执行。“原生图像生成”意味着模型在一次对话流中逐步产出多张图,并且每一步都“看得到”之前生成的图像与文本,从而可以在风格、构图和语义上保持连续一致。
它更像是一条带状态的生成轨道,每一步的输出既是结果,也是下一步的条件。这一“交错式生成”范式,让复杂编辑自然拆分为多步序列,避免了在“单步巨复杂指令”中丢失细节。
当把“理解”和“生成”并置在同一训练与推理体内会有明显的“正向迁移”:图像理解能力的提升,会帮助生成学习到更多关于真实世界与视觉结构的知识;反之亦然。
文本渲染为何重要:
传统图像/视频模型优化,很依赖人类偏好作为评测信号,这类信号真实但成本高、滞后长、主观性强,难以高频爬坡。
团队因此寻找可以在训练过程中高频追踪的替代指标。文本渲染成为突破口:若模型能在图像中准确构造字形、排布与空间关系,说明其对“视觉结构”的掌握在增强。
这一代理指标的价值在于可持续追踪:无论是架构、数据、训练策略的实验,只要把文本渲染纳入固定监控,就能避免回归,并捕捉到意外有效的改动。
字是一种高度结构化的微任务。当模型学会了在复杂背景中稳定地“写字”,它也更有机会正确处理“平行线条”“规整网格”等同样结构化的视觉课题,让整体画面更可信。
多模态正向迁移:
团队把图像理解与生成称作姐妹。统一训练的目标,是在同一模型里学习多模态的理解/生成能力,并在两者之间产生“正向迁移”。
在生成中辅助理解”的路径:让模型在解题过程中画图打草稿,以更好地把抽象问题视觉化、结构化。一次会话里,模型既能接收用户图片、文本,又能生成中间图像,再用这些中间产物辅助下一步思考,形成自洽的多模态推理链。
展望,从更好看到更聪明与更靠谱:
对未来方向,团队强调两条主线:其一是聪明感”。他们希望当用户指令“不充分、甚至有误”时,模型能“越级发挥”,做出“比用户描述更好”的结果。
其二是事实性/严谨性。在图表、流程图、信息图等“既要好看又要准确”的任务里,模型需要严格遵循事实与排版约束,避免多余文本和逻辑错误,让视觉表达与内容正确双达标。