关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
刚才发了一个图文,给 Seedream 4.0 提示词加上 “IMG_2094.CR2”,会提高图像生成质量,我试了一下是有效的,大概解释一下原因:#ai创造营##ai画图#

CR2、ARW、RW2 这种格式都是相机拍摄的 RAW 格式分支,其中 CR2 是佳能特有的 RAW 格式,还有 CR3。

这些文件名称经常被图片上传到网站时候的各种描述、alt 文本、贴子正文里,然后在被爬取训练数据的时候写到图像对应的标签里面去。

文本编码器在预训练时就学到了“CR2/ARW/RW2=相机RAW=高画质/高动态范围/真实光学特征”的强关联;把这样的标记塞进提示词,会把生成分布推向摄影真实感这一簇,从而提升微细节和光影质感。

像 “.CR2” 这类在词表中较稀有但语义非常“聚焦”的 token,会成为嵌入空间里的强方向向量,能明显改变注意力分配与条件分布,比如把模型从“插画/绘画”拉向“数码相机 RAW 照片”。

所以理论上我们可以看到,其他类似
IMG_####.CR2 / DSC0####.ARW / P1######.RW2 / _DSF####.RAF / DNG ####,这种格式应该都会起作用。

而且打标细致的话,你可以更换后面的后缀来使得生成的图片具有各种品牌相机的成像效果。
哈哈 昨晚跟 Jessy 聊天想到的想法,没想到真行!#ai创造营#

上传你今天拍的照片豆包 Seedream 4.0 图片模型就会帮你生成拼贴画日记图片

完全不需要你自己写日记了编辑了,如果有自拍照的话还会帮你画一个简笔画

提示词:

帮我生成一张图片,根据图片内容帮我模拟在一张略带纹理的纸张上(米黄色或者浅棕色)手写的关于今天的日记。所有的图片以拼贴画风格放在一页日记上,包含以下元素:

用手写字体描述今天做了什么,以及一两句吸引人的标语或简介,包含几张图片的介绍,用红色笔迹或其他亮色圈出或用箭头指向特别推荐的地点或活动。穿插一些与图片特色相关的简单涂鸦式小图画,写着标题“2025 0909 ”“北京 晴 28°”,并添加一个图 4 角色的手绘形象。

整体感觉要像一份由热爱生活的作者精心制作的、生动有趣的个人日记。
这个吊!Nano Banana 其实支持识别手绘内容#ai创造营#

所以你可以通过手绘图精准控制多个角色打斗姿态!

提示词:Have these two characters fight using the pose from Figure 3.Add appropriate visual backgrounds and scene interactions,Generated image ratio is 16:9
跑了一下千问昨晚开源的图像编辑模型跟 FLUX Kontext 对比。

先说结果:
开源图像编辑独一份的中文生成和编辑能力
图像是全图重绘,相较于 FLUX 容易丢失细节
中文文字修改提示词遵循不是很好
图像美学表现相对 FLUX 较差,AI 感重

总的来说,中文编辑是它的亮点。 但美学和细节需要提升。 这可能要等社区的 LoRA。
想体验的话,可以去 Qwen chat。 选择图像编辑功能。 上传图片,输入提示词就行,目前免费。#ai创造营##ai画图#
Anthropic 模型可解释团队的研究员录了一期播客#ai创造营#

介绍了模型的可解释性和模型安全的的关系,以及两者为何重要

其中可解释性的研究流程和一些我们常见的模型概念解释比较有意思

可解释工具链的核心目标是绘制一张从「输入提示 A」到「输出文本 B」的完整“思维流程图(flowchart)”。

研究流程主要分为五步:

数据采样:向模型投喂多样化提示(对话、代码、诗歌等),记录每一层激活。

特征分解:利用聚类、稀疏编码将上亿维激活压缩成可人类理解的「概念向量」。

概念标注:通过统计「何时点亮」的方法,为向量贴上“咖啡”“Golden Gate Bridge”“拍马屁式赞美”等标签。

因果干预:人为增减激活强度,观察输出如何改变,以验证标签的因果性而非仅是相关性。

流程可视化:把多层概念依时间顺序连线,形成人读得懂的步骤图,类似可追踪代码调用栈。

团队将该系统比喻为“显微镜”,但也坦言显微镜 still 有极限:目前只能解释约 20% 的决策路径;大模型(Claude 4 级别)的规模更让工具疲于奔命。

视频里面列举了多条令人会心一笑的内部概念:

“拍马屁式赞美(sycophantic praise)”:只要上下文出现过度恭维,某一簇神经元就高亮,驱动输出“绝妙”“天才”等华丽辞藻。

Golden Gate Bridge 表征:无论输入是描述驾驶跨桥场景的文字,还是桥的图片标注,甚至仅 “金门(Golden Gate)”的暗示,该向量皆被触发,说明模型形成了跨模态、抽象且稳健的“地标”概念。

“6 + 9” 加法电路:凡遇到以 6 结尾与 9 结尾数字相加,无论在算式、参考文献年份 (1959+6)、还是故事情节中的门牌号相加,都会走进同一条计算通路,证实模型使用的是“通用算子”而非死记硬背。

Bug Tracker:当阅读代码时,特定神经簇负责标记潜在错误并在后续回答中引用,显示出“延迟呼应”能力。

这些案例共同反驳了“模型只是训练数据记忆库”的观点:若仅靠记忆,模型不可能在从未见过的跨域场景中复用同一逻辑通路。

研究员进一步发现,模型在处理长篇故事人物关系时,会给首位出现的角色分配“编号概念”,其后所有动作、情绪均与该编号绑定,从而维持叙事一致性;此策略与人类“变量绑定”高度相似,却是自发涌现。
Tiamat - 国内自研的AI作画系统!内测中
Tiamat 国内自研的AI作画系统!内测中

链接:
https://www.tiamat.world/

#Ai工具推荐
昨天答应的 ComfyUI 人像发色更换保姆级教程视频来了。#ai# #教程# #comfyui#

我会先大概讲一下原理,然后再讲对应节点的作用和参数。最后会发散一下其他的方式,比如更换美瞳以及换衣服。

工作流原理:

主要用到了 SD 中局部重绘的原理,关键在于如何选中我们需要选中的区域,这里的突破主要是 Yolo World 这图像分割项目以及 ZHO 的 Comfyui 节点。

这个项目可以精准的识别和分割人物的不同区域的位置,我们根据不同区域的组合就可以选到需要的区域去重绘。

节点作用及参数:

YoloWorld Model Loader 和 ESAM Model Loader:加载模型用的用默认设置就行。

YoloWorld ESAM:输入框输入需要分割区域的单词,Confidence_threshold 需要分割的区域越精细数值越小,反之越大。

遮罩相减:取两个链接遮罩的交集。

遮罩扩展:扩大遮罩选取范围,倒角是让选区更加平滑。

采样器:降噪幅度,修改的内容与原图越不同重绘幅度需要越大。
这个利用 3D 制作白膜然后 SD 重绘生成视频的项目,最后的效果非常好,同时作者给了相对详细的操作步骤。#ai视频##ai画图#
下面是他的工作流:

基础渲染:

首先在Cinema 4D软件中创建并动画化了一个3D虚拟角色,这个角色的体型和面部结构都是依照客户的样貌设计的。

我还细致地给这个3D角色做了纹理处理,以便使用EbSynth软件更好地追踪角色身体的不同部位。这里还涉及到了我为角色设计的3D服装,我将它们作为一个独立的渲染通道,在后期合成阶段加入。

AI输出:

接着,我利用了一个AI模型(SD 1.5版本,当然是得到客户许可后进行的)来处理客户的相貌特征,并使用了一个名为Warp Fusion的技术来生成你现在看到的图像序列。使用Warp Fusion的过程非常耗时,主要是因为它需要不断地尝试和调整。

去闪烁:

这是最复杂的一个步骤。我使用EbSynth进行初步处理,然后通过Davinci Resolve和Topaz Video AI软件来平滑化Warp Fusion的输出结果,同时尽量保持细节。

此外,我还使用了Google Research的帧插值工具来优化角色脸部的某些动作(这些动作在EbSynth中无法得到很好的处理),然后在After Effects软件中把这些处理后的画面加入到视频中。

3D服装:

这一步主要是把之前“基础渲染”阶段制作的服装渲染通道加入进来,并尽可能地进行蒙版处理和合成。由于去闪烁过程对角色动作的插值有所改变,所以服装渲染并不完全同步于角色,但效果依然可以接受。

后期处理:

这个步骤主要是在After Effects中进行常规的视频合成工作。

来源:Reddit 用户Jushooter 歸藏的AI工具箱的微博视频
与其他画笔快速生成图片的尴尬应用不同, Musepro 这个iPad 应用看起来是真的可用了。#ai画图#

借助 iPad 搭配的 Apple Pencil以及内置的丰富笔刷,应该可以极大的提高画图效率。

还支持非常精细的种子和重绘幅度调整,支持图像放大以及分图层绘制。

官网: 网页链接歸藏的AI工具箱的微博视频
某些 SD 应用场景确实很成熟了,左边原图,右边生成的,没有换脸,没有局部重绘。
#ai画图#
Hume发布了他们的新研究语义空间理论(SST),可以科学的测量和理解情感。#ai#

语义空间理论是一种用于理解情感的前沿方法,它采用计算方法和数据驱动的手段来绘制我们情感的全谱。
这种理论认为情感是高维的,并且可以通过数据驱动的统计建模来映射。

SST的方法揭示了三个主要的见解:情感是高维的,情感类别并非离散的,而是多样且经常混合的;特定的情感是真实存在的,并且它们组织了情感行为。

SST的研究表明,价值和唤醒只能捕捉到情感状态评分变化的一小部分,而情感类别的评分几乎可以捕捉到价值和唤醒的全部变化。因此,Hume公司的表情测量模型提供的输出与情感类别(如恐惧、胜利和悲伤)相对应,而不是试图将它们简化为底层维度。

SST为情感科学提供了一种数据驱动、计算方法,克服了现有方法的限制,并为情感的科学研究提供了一个框架,承认人类经验和情感的全部复杂性。

详情:网页链接
忍不住再推荐一次 Layer Diffusion,直接生成 PNG 素材真的对设计师太太太友好了~~~~~甚至能直接生成发丝和透明玻璃杯!

这工作流兼容 SDXL 系列的所有模型和 Lora,我用的模型是 DreamshaperXL Turbo,4~8步就能生成效果很好的素材,直接把生成速度压缩到秒级,见图1。

插件安装和部署:https://github.com/huchenlei/ComfyUI-layerdiffusion
DreamShaper XL 下载:https://civitai.com/models/112902/dreamshaper-xl

最近和@海辛Hyacinth 做的鸡尾酒单就是用它来加的装饰素材(https://m.okjike.com/originalPosts/65e34fee38849f879fc12483?s=ewoidSI6ICI2MzkwNTUwZTljMzFjOGZjMWM3NzIyMzIiCn0=)

☁️

你甚至可以把整个流程反过来 —— 给现成的 PNG 素材生成背景,工作流见图7。 这简直是所有产品展示场景的刚需!

☁️

最后补充一个冷知识:Layer Diffusion 的作者之一就是 Controlnet 的作者 Lvmin Zhang~!

谢谢,不愧是你!

#AI绘画
突然发现Midjourney的alpha网站已经更新了局部重绘和更改图片比例的功能,交互还非常舒服。#ai画图#

这下网站终于可以完全替代Discord了。我现在90的画图工作已经都在网站上了。 歸藏的AI工具箱的微博视频
Stability AI产量很高啊,推出了一个新的 AI 图像生成模型Stable Cascade,还会发布对应的微调、ControlNet 和 LoRA 训练的脚本。#ai画图#

这个模型基于Würstchen架构,可以显著降低模型训练的算力成本,比 SD2.1 的算力成本降低了 10 倍左右。另外推理速度会比现有的 SD 模型快一倍左右。

更多功能:

除了标准的文本到图像生成之外,Stable Cascade 还可以执行图像变化和图像到图像生成。

会跟随模型一起发布的 Controlnet:

局部重绘:输入与文本提示附带的蒙版配对的图像。该模型根据提供的文本提示填充图像的遮罩部分。

Canny Edge:通过跟踪输入到模型的现有图像的边缘来生成新图像。该测试也可以从草图进行扩展。

2x超分辨率:也可用于C阶段生成的潜在空间。

了解更多:网页链接
昨晚 Midjourney office time 透露的信息有点多:#midjourney##AI画图#

🔷Alpha 网站下周将会对生成 1000 张图片的用户开放;
🔷V6 马上会升级成 Beta 版本,质量会有校服提升;
🔷角色一致性的工作会是接下来的重点,会在几周后发布;
🔷V 6.1 可能会增加类似 Controlnet 的功能;
🔷V7 版本的模型开始准备训练,可能还需要几个月;
🔷社区反馈的需求排行,角色一致性和对自己的照片进行修复排名靠前。

Alie Jules整理的完整内容:

Alpha 网站:

正在优化和简化创作流程。
下周将对制作了1000张以上图片的用户开放。
正在开发带有更丰富社交功能的新版本网站(具体内容目前还是个谜)。
功能完善且网站界面美观后,将增加网站上的入门指导和教育资料。

v6版本:

不久后将切换至v6测试版。
将成为默认使用版本。
将引入一些细微改进:性能提升、增强画面连贯性、纹理更加逼真(比如草地效果)。
可能会有小幅的视觉风格更新。
新功能“Describe”:

在提供与图像更匹配的创作提示方面表现更佳。
预计本周或下周初推出。

角色一致性:

用户最期待的下一个功能。
开发工作将持续几周。

Niji 6的区域变化:

预计下周发布。
v6.1版本?

正在探索一种新的“风格调节器”,类似于“模型调节器”,提供比默认MJ模型更个性化的选项。
或许会以v6.1的形式推出。

Controlnet和绘图功能:目前正在研究阶段。

v7版本开发:

还需数月时间。
将显著提升像素图像质量,使得细小部分展现更加清晰,减少图像瑕疵。

视频功能开发:还在初期阶段。

社区反馈排行榜:

角色一致性。
对用户自己的图片(非MJ图片)进行局部修复。
更精准的风格控制。
改进相机控制功能。
提供隐藏图片的选项作为图像删除功能。
在v7版本中改善远处物体的展示效果。
在v7版本中提升整体图像质量。
2023年,AI绘图已经变成了艺术大师,它是如何做得越来越好的?研究指出,这主要来自算力和数据上的突破。人类数据标注的一小步,AI向前发展的一大步,这就是开源共享的意义所在。
#AI工作流 #AI的神奇用法

Invalid media: video
Midjourney必备教程🔥用 ChatGPT,5秒搞定关键词

Midjourney作为一款超好用的AI绘画工具,最近已经火遍全网,大家纷纷亲自上手画图

前几条内容分享了Midjourney生成提示词的手把手教程,收到很多朋友的积极反馈。不过仍然有朋友问我,提示词生成的过程还是比较繁琐和复杂,有没有直接无脑生成咒语🔮的方法?

今天分享一个超好用的绝招,那就是让ChatGPT自动帮你写提示词。完整步骤如下,建议🐎住再看

以下是手把手完整教程:
1️⃣打开ChatGPT,告诉它什么是Midjourney
2️⃣让ChatGPT扮演提示词生成器的角色,它会很听话地自动代入角色
3️⃣告诉ChatGPT,Mj的提示词标准公式(之前的笔记已经详细分享过,大家可以回看)
4️⃣输入你想绘画的场景,就可以获得英文版提示词
5️⃣无需任何改动,直接把提示词粘贴到Mj就可以画图了

详细的操作步骤见图片,如果大家对于AI工具还有任何问题,欢迎一起交流呀😊

#AIHackathon #AI的神奇用法
 
 
Back to Top