关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
即梦AI的图片3.0上线了智能参考

可以基于上传的图像,生成任何你想要生成的内容,这太爽了!

不管是海报、电商封面、小红书封面还是视频封面,甚至只是想给你的照片添加一些装饰,都能搞定

我还写了套提示词帮你复刻任何你喜欢的电商或者小红书封面的排版样式

这里是详细的提示词和介绍:https://mp.weixin.qq.com/s/_kt9OLylR95sG7U37wseSw

基本能力测试

首先是照片和人像的测试,我们分别从大面积到小细节分别对一个人像照片进行修改。
从更换背景到增加配饰再到更改姿势,都没啥问题,只改了需要改的地方,更改的位置跟原有的融合度不错,人眼看不出来更改过。
然后我还让他给照片加了滤镜,测试了在上面覆盖内容的这种修改,也很好。

再然后就是即梦的看家本事了,中文生成,这次还要加上修改。
我们先来看一下生成,这里我那一张原有的图片让即梦帮我给这个武器设计加上文字。
可以看到即梦对于文字样式和位置的响应非常精准。

然后是改字,我在社区找了一个非常复杂的文字效果,除了字体不是常规字体外,还有 3D Q 版挤压效果。
然后让他修改的时候也增加了难度,没有单独改某个字而是让他把原来上面的三个字变成五个字,没想到搞得还挺好,新增的文字基本上都有类似的立体效果和挤压效果。

日常应用场景

我们日常分享照片的时候一般就是几类需求:
- 给照片加滤镜
- 修改照片内容,改变照片比例
- 给照片增加装饰帮助表达
- 用 AI 给照片转换风格

前三种基本上都是之前美图、醒图这类图片软件最常见的需求,现在即梦全都可以搞定了。
比如最近很火的撕拉片风格照片,我们只需要上传你拍的照片加一点提示词就可以用即梦图片3.0直接生成。

即梦图片3.0 还可以自己分析图片内容给图片生成海报和装饰,你只需要在提示词输入海报两个字就行,这门槛够低了吧。
这里就是模型自己搞的,生成的字体和装饰都非常契合原来照片的风格和感觉。

如果你不喜欢他自己加的文字的话也可以自己在提示词里面写一下,这种方式可以极大的增加日常分享照片的表现力。
比如对于每天喝咖啡的人完全可以给自己每天喝的咖啡加上日期和咖啡种类的标记,当做打卡方式,当时我记得就单纯给照片加水印这个功能有些软件就活得很不错了,现在要啥水印你自己定义。

营销物料生成
之前在图片3.0 发布的时候即梦生成的封面就已经很强了,主要就剩下跟现实照片相关的内容没办法做。
AI探索指南
2025 年的 AI 协助编程观察 – Yachen's Blog 最近大家都在聊 AI 加持下的 vibe coding,我来聊聊作为资深开发者最近高强度使用 AI 的一些感受: 一句话总结,AI 让不会写代码的人具备了“直接造辆车”的能力,而让资深开发者一个人就有了“独立建造航母”的可能。 ### 项目重构 最近使用 claude-4 对我之前的一些代码进行了重构。原因是原来的实现中,为了降低编写时的心智负担,会使用一些性能偏低但是易于书写的代码。比方说自动锁管理、ARC、使用 array 数据结构代替…
比方说最近在实现 IPv6 ND 协议栈,一些特定的 RA 消息构造在某些操作系统上就是无法生效,原本这可能要耗费我几天的时间去研究,阅读各种文献甚至 kernel 源码实现,而现在只需请教 AI,就能非常准确地找到答案。

AI 的这种资深,在你对某个技术的表层足够了解,但是缺乏经验和细节信息时,能够极快的帮你补全。

### 极强的 debug 能力

我的项目里有一个藏了很久的问题,在特定情况下会出现 TCP 性能下降,由于并没有产生任何明确的报错,这让修正这个问题变得异常麻烦。

我原本是单纯向 AI 描述了我的使用场景和问题表现,AI 提出了几种猜想,大部分我看一眼就知道不靠谱,剩下几个试了下也并无效果。索性,我直接把 100MB 的抓包结果丢给了 o3 让他分析。它在几分钟内就精准指出了问题所在,甚至给出了改进建议。这种调试能力在人类团队中几乎无法复现。

如此庞大的数据量,人工分析非常困难。即使借助各种工具,仅学习用法、配置环境就已令人头大。(因为 TCP 流控分析的各种工具链基本都是上个世纪的项目)

现在我已经习惯了这种 vibe debug,遇到什么问题,直接把 verbose 日志和问题描述丢给 AI,大概率就能直接找到问题,这其实也是得益于 AI 的不怕苦不怕累的精神。

### Peer review

作为独立开发者,我的 code review 一直以来只能靠自己,但是自己写的 bug,很多时候自己是看不出来的🙈,现在我只需将 git diff 的结果交给 AI,就能请它帮我 review。

同样的,我也会 review AI 给出的结果,AI 当然也会犯错,高级低级的都有。但是比起人类同事来说,AI 没有 ego,能很好地接受反馈并立即调整;很多人类做不到,或至少过程很曲折。

### 职业影响

就目前 AI 的能力来看,无疑是对初级开发者就业市场产生了巨大的压力,对于资深工程师来说,反而是一种赋能。(我目前还是能为找到 AI 的错误并指导它而沾沾自喜,但也不知道还能持续多久。)

这比较让人担忧的是,这可能导致职业断层,因为初级开发者根本没有机会得到训练机会而成长。

不过这已经早已不仅仅是软件工程师所面临的问题,本质上来说,所有脑力工作者的职业都受到了巨大威胁。像咨询、律师等职业,还可以依靠私域信息门槛维持。而像医生这样完全依赖公域信息的职业,初级职位也同样完全可以被 AI 替代了,当然最终取决于患者的接受程度。

我最近一次体检后的报告喂给 o3 进行解读,他给出的信息量、准确性、建议,均远超全科医生给出的解读。不仅仅是因为 AI 的信息更全面,AI 可以为报告中每一项异常数据,检索最新研究与各国医疗指南,并整合后给出建议,甚至由于 GPT 已经了解我的生活习惯,能更优针对性的给出意见。而这种工作量对于人类医生来说是不可接受的(当然大多数情况下也确实没有必要)。

很多人对 AI 医疗的顾虑是:AI 犯错了怎么办?然而其实人类医生也会犯错,而且就现在的 AI 水平来看,AI 犯错的概率应该已经比一般人类医生低了。当然最优解还是兼听则明,把 AI 的意见告知医生,也把医生的反馈告知 AI,基本最后都会达成一致。对于一些不重要的小问题,仅 AI 意见完全足够。

### AI 的限制

当然 AI 也不是万能的,甚至可以说局限性相当明显。claude-4 虽然非常强,但是随着 context 的增长,注意力溃散的非常严重,后面基本就像喝多了一样。

当前的最佳实践是:尽量保持 context 精简,聚焦具体任务,依靠人力来拆解复杂目标。

比方说先用一个 context 确定具体需求,再开一个 context 将明确好了的需求转换为具体任务列表,再把任务单独交给一个个 context 去具体实现。这样效果会好很多。

仔细一看,这不就是人类的团队协作模式嘛 😂

这让我想起不久前由 GPT o1 和 DeepSeek R1 的思维链引发的 AI 能力巨幅提升。其实在思维链能力出来之前,就可以靠 prompt 指引 AI 一步步思考,取得类似的效果,甚至催生了 prompt 工程师职业。然而直接在模型层面将这种能力整合后,prompt 引导就非常多余了。

那么目前编程实践中,如今常用的 context 切分技巧,我认为在不久的将来也可能被模型层原生支持,即 AI 自主可以通过切换 context 的方式维持注意力,保持高效。这可能带来 AI 能力的又一次飞跃式进步。
2025 年的 AI 协助编程观察 – Yachen's Blog

最近大家都在聊 AI 加持下的 vibe coding,我来聊聊作为资深开发者最近高强度使用 AI 的一些感受:

一句话总结,AI 让不会写代码的人具备了“直接造辆车”的能力,而让资深开发者一个人就有了“独立建造航母”的可能。

### 项目重构

最近使用 claude-4 对我之前的一些代码进行了重构。原因是原来的实现中,为了降低编写时的心智负担,会使用一些性能偏低但是易于书写的代码。比方说自动锁管理、ARC、使用 array 数据结构代替 queue。

然而用 AI 实现就没了这些负担,我先让 AI 为原始实现编写完整测试用例,确保原代码行为明确,然后让 AI 对整个 class 进行重构,追求极致性能,写完新代码后再重新运行测试保证行为一致。

就这样,我轻松完成了部分核心数据结构的重构。尽管重构后的代码量几乎翻倍,但逻辑清晰、复杂度可控,换来的则是约 20% 的性能提升。

核心是,AI 编写代码不怕苦不怕累,没有必要为了简化代码而牺牲性能。人类工程师目前主流习惯是牺牲部分运行性能以换取开发效率。

### AI 编程语言

这牵扯出的另一个观察是,什么编程语言对 AI 更友好,我的观察是可读性越高、行为越明确的语言效果越好。语法糖等简化编码技术,反而不利于 AI 使用。(AI 在发现一些奇怪的行为是运算符重载导致的不知道会不会跟我一样跳脚骂街)

而像 SwiftUI 那些优势仅在开发效率上的技术,在 AI 时代更显得有些生不逢时。反正都是 AI 写,AI 用 UIKit/AppKit 实现不过是代码长一点而已,在可控性和行为明确性方面更适合 AI 自动化维护,性能也高的多。

### AI 的资深

虽然 AI 的编码技能,比起资深的工程师其实可能还是会有差距,但是要论知识丰富程度,则远非任何个体可比。

这个优势体现在当我要去实现一些技术盲区时,原本的流程大概是:先读几本书,再对照比较一系列 RFC,再请教下相关领域的朋友确认自己已经理解。或者先按照自己的想象做个最小工程实践,然后再根据各种问题一点点填坑。
目前最好的讲MCP的课程

Anthropic 和 Deeplearning 合作推出了MCP系列课程,希望系统了解mcp推荐看这个课程。

一样是一个小时左右,从概念讲到host,讲到 client 和 server,再讲到mcp内的各个组件 tools,prompts,resources,同时还分享了目前在逐渐支持的 stream http和正在发展的 roots sampling,mcp registry 等情况。

看完对整个mcp的当下、现在和未来的路线图一下就清晰了。

还有一个比较触动我的点是: 好的应用是实践"生长"出来的。

anthropic 说mcp,artifacts 都是由内部实践诞生出来的项目,自己用了好用,发现是刚需就打磨发布出来了,都成了口碑和价值俱佳的产品。

https://www.deeplearning.ai/short-courses/mcp-build-rich-context-ai-apps-with-anthropic/
终于有人做这个事情了,Jaaz – 开源的 AI 设计 Agent

只需要填写你的 LLM API 和图像生成 API 就可以调用 Agent 自动批量生成图片

看了一下目前只支持官方的 API,有点难受,图像模型 API 也不是很全

大家其实很需要一个类似的 Chatwise 的图像和视频生成套壳本地软件

支持市面上大部分视频和图像 API,再加上一个素材管理功能,加上买断制,肯定能卖爆,专业创作者和团队真的很需要

如果还有自己调教的 Agent 方案的话就更好了

希望有能力的大佬给点力,搞一个出来,我给你带货

这里尝试 jaaz:https://github.com/11cafe/jaaz
众所周知,医疗和教育是压在普通人头顶的两座大山,决策成本之高,催生了为那些迫不得已需要翻山越岭的人贩卖手杖的行当,搜索就是一个重灾区,搜索疾病症状,出来的必然是各种医药服务的小广告,搜索填报志愿,充斥眼前的也全都是教育机构的留资引导。

不是说广告不好,而是一个需求入口被贴满了牛皮癣,以致于用户要从无孔不入的商业推广里学会分辨客观信息,这实在不合理,至于「天下苦xx久矣」的说法用得多了,也就不剩下多少批判性了,反而更有「日哭夜哭能哭死董卓否」的抽象感。

套用俞军老师的著名公式——产品价值=(新体验-旧体验)-迁移成本——只有在体验差距足够大的时候,才会撼动传统搜索的商业模式,这也是AI被寄予厚望的经济预期,至少在针对那两座大山的「移山工程」里,夸克塞到用户手里的铲子,是真的有用。

几乎是在同一时间,夸克的健康大模型通过了副主任医师的职称考试,在12个主流门诊学科里都超过了合格线,另外还推出了面向高考场景的深度搜索服务,可以成为一个高度定制化的志愿规划师。

从原理上,这是夸克走上「工具箱化」这条道路的必然结果,基于通义千问基座模型的底层能力,为特定的痛点需求进行额外的数据采集和后训练,最后集成到框里去。

考虑到本来用户的使用习惯都已经在转移过程中了——每次评论区都有很多现身说法的,表示自己越来越依赖遇事不决问AI、不再选择在搜索结果里翻拣网页——趁势完善端到端的体验,是百利而无一害的。

我测试下来的感受是,要说取代医生和老师,可能为时尚早,但是取代搜索,已经完全可行了,而且不是平替,是更优解。

比如查完血常规后,拍照发给夸克,在排除疑难杂症的前提下,它所给出的答案和医生问诊的结果是没什么差别的,各种用药禁忌和症状分析,也都能给出纯粹干货的说明,不再需要担心夹带私货。

我看到前几天也有医生出来表态了,他个人并不介意患者拿着AI的答案和他掰扯,在医疗资源长期紧张的环境下,患者这么做的心理实际上是怕医生在百忙之中有所遗漏,希望受到重视。而在医生看来,不管怎么样,懂得使用AI总比轻信不明网站里的野鸡专家要好,AI至少不会胡说八道,它能让医患之间产生更加顺畅的交流。

填报志愿也是类似,张雪峰的火爆和定价足以说明,在东亚这个「年年都是人生最重要的一年」的做题氛围里,错一步误一生的焦虑始终困扰着学生和家长们,现在有了AI搭把手弥补信息差,总归是件好事。

另一方面,「深耕垂直模型突破」的行业判断可能也确实成立了。首先,通用模型的能力是最关键的,若是基础智能不能保持领先,就很难适应千人千面的大众需求,反过来说,通用模型却很容易把垂直模型整合到一个入口里,让不同领域的专家时刻待命,分给不同的场景上岗。

夸克也证明了只要通用模型足够领先——通义千问俨然已成全球开源旗舰——细分出的垂直模型会有更大的进步跨度,兼具通用模型里最专业的、垂直模型里最聪明的两大优势。

夸克这次的升级就是如此,框还是那个框,后面的模型又过了不知道多少遍的万重山,用户也不需要特意去选择模型版本,只需要输入意图,模型自己就能做出判断,然后调用对应的垂直模型出来「接客」。

根据Sam Altman的说法,他对用户抱怨ChatGPT的模型版本过于复杂深有同感,让用户每次输入前都要考虑是不是选对了模型也很多余,所以GPT-5将回归「All In One」的模式,一个模型解万事。

这么来看,夸克的含金量还在上升。
50秒看看100个。谁看谁知道,一看一个不吱声。
又想了一个血赚的创业点子,我真是天才
尝试用 FLUX Kontext 给 Labubu 换装,太可爱了!

可以只改变服装也可以连背景都改掉

提示词:

Dress it in a khaki adventure vest with multiple pockets, layered over a simple white T-shirt and brown cargo shorts. Top it off with a wide-brimmed sun hat and swap the shoes for a pair of durable mini hiking boots. For added detail, accessorize with a vintage-style miniature binocular or a small canvas backpack, as if it's filled with treasures from a journey.

A chunky, hand-knitted sweater in a cream or oatmeal color, paired with a classic plaid scarf. For the lower body, corduroy trousers would be perfect, with a pair of fluffy snow boots on its feet. If possible, add a miniature hand-warmer or a tiny cup of "hot cocoa" in its hand

A red beret, worn tilted to one side, is essential. Dress it in a classic blue and white striped shirt (Breton shirt), covered with an off-white canvas apron that has a few "accidental" paint splatters on it. Holding a miniature easel and a tiny paintbrush would complete the artistic temperament perfectly.
Back to Top