关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
CR2、ARW、RW2 这种格式都是相机拍摄的 RAW 格式分支,其中 CR2 是佳能特有的 RAW 格式,还有 CR3。
这些文件名称经常被图片上传到网站时候的各种描述、alt 文本、贴子正文里,然后在被爬取训练数据的时候写到图像对应的标签里面去。
文本编码器在预训练时就学到了“CR2/ARW/RW2=相机RAW=高画质/高动态范围/真实光学特征”的强关联;把这样的标记塞进提示词,会把生成分布推向摄影真实感这一簇,从而提升微细节和光影质感。
像 “.CR2” 这类在词表中较稀有但语义非常“聚焦”的 token,会成为嵌入空间里的强方向向量,能明显改变注意力分配与条件分布,比如把模型从“插画/绘画”拉向“数码相机 RAW 照片”。
所以理论上我们可以看到,其他类似
IMG_####.CR2 / DSC0####.ARW / P1######.RW2 / _DSF####.RAF / DNG ####,这种格式应该都会起作用。
而且打标细致的话,你可以更换后面的后缀来使得生成的图片具有各种品牌相机的成像效果。
所以你可以通过手绘图精准控制多个角色打斗姿态!
提示词:Have these two characters fight using the pose from Figure 3.Add appropriate visual backgrounds and scene interactions,Generated image ratio is 16:9
介绍了模型的可解释性和模型安全的的关系,以及两者为何重要
其中可解释性的研究流程和一些我们常见的模型概念解释比较有意思
可解释工具链的核心目标是绘制一张从「输入提示 A」到「输出文本 B」的完整“思维流程图(flowchart)”。
研究流程主要分为五步:
数据采样:向模型投喂多样化提示(对话、代码、诗歌等),记录每一层激活。
特征分解:利用聚类、稀疏编码将上亿维激活压缩成可人类理解的「概念向量」。
概念标注:通过统计「何时点亮」的方法,为向量贴上“咖啡”“Golden Gate Bridge”“拍马屁式赞美”等标签。
因果干预:人为增减激活强度,观察输出如何改变,以验证标签的因果性而非仅是相关性。
流程可视化:把多层概念依时间顺序连线,形成人读得懂的步骤图,类似可追踪代码调用栈。
团队将该系统比喻为“显微镜”,但也坦言显微镜 still 有极限:目前只能解释约 20% 的决策路径;大模型(Claude 4 级别)的规模更让工具疲于奔命。
视频里面列举了多条令人会心一笑的内部概念:
“拍马屁式赞美(sycophantic praise)”:只要上下文出现过度恭维,某一簇神经元就高亮,驱动输出“绝妙”“天才”等华丽辞藻。
Golden Gate Bridge 表征:无论输入是描述驾驶跨桥场景的文字,还是桥的图片标注,甚至仅 “金门(Golden Gate)”的暗示,该向量皆被触发,说明模型形成了跨模态、抽象且稳健的“地标”概念。
“6 + 9” 加法电路:凡遇到以 6 结尾与 9 结尾数字相加,无论在算式、参考文献年份 (1959+6)、还是故事情节中的门牌号相加,都会走进同一条计算通路,证实模型使用的是“通用算子”而非死记硬背。
Bug Tracker:当阅读代码时,特定神经簇负责标记潜在错误并在后续回答中引用,显示出“延迟呼应”能力。
这些案例共同反驳了“模型只是训练数据记忆库”的观点:若仅靠记忆,模型不可能在从未见过的跨域场景中复用同一逻辑通路。
研究员进一步发现,模型在处理长篇故事人物关系时,会给首位出现的角色分配“编号概念”,其后所有动作、情绪均与该编号绑定,从而维持叙事一致性;此策略与人类“变量绑定”高度相似,却是自发涌现。
Scribble Diffusion - 有趣!将鼠绘草图变成精美照片
Scribble Diffusion 有趣!将鼠绘草图变成精美照片
链接:
https://scribblediffusion.com/
#Ai工具推荐
Scribble Diffusion 有趣!将鼠绘草图变成精美照片
链接:
https://scribblediffusion.com/
#Ai工具推荐
昨天答应的 ComfyUI 人像发色更换保姆级教程视频来了。#ai# #教程# #comfyui#
我会先大概讲一下原理,然后再讲对应节点的作用和参数。最后会发散一下其他的方式,比如更换美瞳以及换衣服。
工作流原理:
主要用到了 SD 中局部重绘的原理,关键在于如何选中我们需要选中的区域,这里的突破主要是 Yolo World 这图像分割项目以及 ZHO 的 Comfyui 节点。
这个项目可以精准的识别和分割人物的不同区域的位置,我们根据不同区域的组合就可以选到需要的区域去重绘。
节点作用及参数:
YoloWorld Model Loader 和 ESAM Model Loader:加载模型用的用默认设置就行。
YoloWorld ESAM:输入框输入需要分割区域的单词,Confidence_threshold 需要分割的区域越精细数值越小,反之越大。
遮罩相减:取两个链接遮罩的交集。
遮罩扩展:扩大遮罩选取范围,倒角是让选区更加平滑。
采样器:降噪幅度,修改的内容与原图越不同重绘幅度需要越大。
我会先大概讲一下原理,然后再讲对应节点的作用和参数。最后会发散一下其他的方式,比如更换美瞳以及换衣服。
工作流原理:
主要用到了 SD 中局部重绘的原理,关键在于如何选中我们需要选中的区域,这里的突破主要是 Yolo World 这图像分割项目以及 ZHO 的 Comfyui 节点。
这个项目可以精准的识别和分割人物的不同区域的位置,我们根据不同区域的组合就可以选到需要的区域去重绘。
节点作用及参数:
YoloWorld Model Loader 和 ESAM Model Loader:加载模型用的用默认设置就行。
YoloWorld ESAM:输入框输入需要分割区域的单词,Confidence_threshold 需要分割的区域越精细数值越小,反之越大。
遮罩相减:取两个链接遮罩的交集。
遮罩扩展:扩大遮罩选取范围,倒角是让选区更加平滑。
采样器:降噪幅度,修改的内容与原图越不同重绘幅度需要越大。
这个利用 3D 制作白膜然后 SD 重绘生成视频的项目,最后的效果非常好,同时作者给了相对详细的操作步骤。#ai视频##ai画图#
下面是他的工作流:
基础渲染:
首先在Cinema 4D软件中创建并动画化了一个3D虚拟角色,这个角色的体型和面部结构都是依照客户的样貌设计的。
我还细致地给这个3D角色做了纹理处理,以便使用EbSynth软件更好地追踪角色身体的不同部位。这里还涉及到了我为角色设计的3D服装,我将它们作为一个独立的渲染通道,在后期合成阶段加入。
AI输出:
接着,我利用了一个AI模型(SD 1.5版本,当然是得到客户许可后进行的)来处理客户的相貌特征,并使用了一个名为Warp Fusion的技术来生成你现在看到的图像序列。使用Warp Fusion的过程非常耗时,主要是因为它需要不断地尝试和调整。
去闪烁:
这是最复杂的一个步骤。我使用EbSynth进行初步处理,然后通过Davinci Resolve和Topaz Video AI软件来平滑化Warp Fusion的输出结果,同时尽量保持细节。
此外,我还使用了Google Research的帧插值工具来优化角色脸部的某些动作(这些动作在EbSynth中无法得到很好的处理),然后在After Effects软件中把这些处理后的画面加入到视频中。
3D服装:
这一步主要是把之前“基础渲染”阶段制作的服装渲染通道加入进来,并尽可能地进行蒙版处理和合成。由于去闪烁过程对角色动作的插值有所改变,所以服装渲染并不完全同步于角色,但效果依然可以接受。
后期处理:
这个步骤主要是在After Effects中进行常规的视频合成工作。
来源:Reddit 用户Jushooter 歸藏的AI工具箱的微博视频
下面是他的工作流:
基础渲染:
首先在Cinema 4D软件中创建并动画化了一个3D虚拟角色,这个角色的体型和面部结构都是依照客户的样貌设计的。
我还细致地给这个3D角色做了纹理处理,以便使用EbSynth软件更好地追踪角色身体的不同部位。这里还涉及到了我为角色设计的3D服装,我将它们作为一个独立的渲染通道,在后期合成阶段加入。
AI输出:
接着,我利用了一个AI模型(SD 1.5版本,当然是得到客户许可后进行的)来处理客户的相貌特征,并使用了一个名为Warp Fusion的技术来生成你现在看到的图像序列。使用Warp Fusion的过程非常耗时,主要是因为它需要不断地尝试和调整。
去闪烁:
这是最复杂的一个步骤。我使用EbSynth进行初步处理,然后通过Davinci Resolve和Topaz Video AI软件来平滑化Warp Fusion的输出结果,同时尽量保持细节。
此外,我还使用了Google Research的帧插值工具来优化角色脸部的某些动作(这些动作在EbSynth中无法得到很好的处理),然后在After Effects软件中把这些处理后的画面加入到视频中。
3D服装:
这一步主要是把之前“基础渲染”阶段制作的服装渲染通道加入进来,并尽可能地进行蒙版处理和合成。由于去闪烁过程对角色动作的插值有所改变,所以服装渲染并不完全同步于角色,但效果依然可以接受。
后期处理:
这个步骤主要是在After Effects中进行常规的视频合成工作。
来源:Reddit 用户Jushooter 歸藏的AI工具箱的微博视频
与其他画笔快速生成图片的尴尬应用不同, Musepro 这个iPad 应用看起来是真的可用了。#ai画图#
借助 iPad 搭配的 Apple Pencil以及内置的丰富笔刷,应该可以极大的提高画图效率。
还支持非常精细的种子和重绘幅度调整,支持图像放大以及分图层绘制。
官网: 网页链接歸藏的AI工具箱的微博视频
借助 iPad 搭配的 Apple Pencil以及内置的丰富笔刷,应该可以极大的提高画图效率。
还支持非常精细的种子和重绘幅度调整,支持图像放大以及分图层绘制。
官网: 网页链接歸藏的AI工具箱的微博视频
语义空间理论是一种用于理解情感的前沿方法,它采用计算方法和数据驱动的手段来绘制我们情感的全谱。
这种理论认为情感是高维的,并且可以通过数据驱动的统计建模来映射。
SST的方法揭示了三个主要的见解:情感是高维的,情感类别并非离散的,而是多样且经常混合的;特定的情感是真实存在的,并且它们组织了情感行为。
SST的研究表明,价值和唤醒只能捕捉到情感状态评分变化的一小部分,而情感类别的评分几乎可以捕捉到价值和唤醒的全部变化。因此,Hume公司的表情测量模型提供的输出与情感类别(如恐惧、胜利和悲伤)相对应,而不是试图将它们简化为底层维度。
SST为情感科学提供了一种数据驱动、计算方法,克服了现有方法的限制,并为情感的科学研究提供了一个框架,承认人类经验和情感的全部复杂性。
详情:网页链接
突然发现Midjourney的alpha网站已经更新了局部重绘和更改图片比例的功能,交互还非常舒服。#ai画图#
这下网站终于可以完全替代Discord了。我现在90的画图工作已经都在网站上了。 歸藏的AI工具箱的微博视频
这下网站终于可以完全替代Discord了。我现在90的画图工作已经都在网站上了。 歸藏的AI工具箱的微博视频
这个模型基于Würstchen架构,可以显著降低模型训练的算力成本,比 SD2.1 的算力成本降低了 10 倍左右。另外推理速度会比现有的 SD 模型快一倍左右。
更多功能:
除了标准的文本到图像生成之外,Stable Cascade 还可以执行图像变化和图像到图像生成。
会跟随模型一起发布的 Controlnet:
局部重绘:输入与文本提示附带的蒙版配对的图像。该模型根据提供的文本提示填充图像的遮罩部分。
Canny Edge:通过跟踪输入到模型的现有图像的边缘来生成新图像。该测试也可以从草图进行扩展。
2x超分辨率:也可用于C阶段生成的潜在空间。
了解更多:网页链接
🔷Alpha 网站下周将会对生成 1000 张图片的用户开放;
🔷V6 马上会升级成 Beta 版本,质量会有校服提升;
🔷角色一致性的工作会是接下来的重点,会在几周后发布;
🔷V 6.1 可能会增加类似 Controlnet 的功能;
🔷V7 版本的模型开始准备训练,可能还需要几个月;
🔷社区反馈的需求排行,角色一致性和对自己的照片进行修复排名靠前。
Alie Jules整理的完整内容:
Alpha 网站:
正在优化和简化创作流程。
下周将对制作了1000张以上图片的用户开放。
正在开发带有更丰富社交功能的新版本网站(具体内容目前还是个谜)。
功能完善且网站界面美观后,将增加网站上的入门指导和教育资料。
v6版本:
不久后将切换至v6测试版。
将成为默认使用版本。
将引入一些细微改进:性能提升、增强画面连贯性、纹理更加逼真(比如草地效果)。
可能会有小幅的视觉风格更新。
新功能“Describe”:
在提供与图像更匹配的创作提示方面表现更佳。
预计本周或下周初推出。
角色一致性:
用户最期待的下一个功能。
开发工作将持续几周。
Niji 6的区域变化:
预计下周发布。
v6.1版本?
正在探索一种新的“风格调节器”,类似于“模型调节器”,提供比默认MJ模型更个性化的选项。
或许会以v6.1的形式推出。
Controlnet和绘图功能:目前正在研究阶段。
v7版本开发:
还需数月时间。
将显著提升像素图像质量,使得细小部分展现更加清晰,减少图像瑕疵。
视频功能开发:还在初期阶段。
社区反馈排行榜:
角色一致性。
对用户自己的图片(非MJ图片)进行局部修复。
更精准的风格控制。
改进相机控制功能。
提供隐藏图片的选项作为图像删除功能。
在v7版本中改善远处物体的展示效果。
在v7版本中提升整体图像质量。