关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
一个让我觉得自己是用 ai 解决需求小天才的用法,最近最让我惊喜和疯狂玩的用法:把自己的性格测试丢给 kimi,让ta 读取内容之后,扮演我自己,然后各种余一问余一。
甚至在脑子没有想法之后,问ta 你有什么想问自己的,最后还是让 ai 扮演我回答。问的问题包括:
什么让我内耗,决策机制是什么?为什么会纠结?你在追求什么?xxx 对你有用吗?xxx 评价是准确的吗?……
回答都真的挺准确,真的是我。好好用,好好玩。
打算明儿写个简明教程,目标是让非技术出身的人,也可以在20分钟掌握最基础的Python+AI,并完成一个简单且实用的项目🤔
Suno 昨晚正式发布了他们的 V3 音乐生成模型,现在所有人都可以使用。

V3 改进的内容主要是:

◦ 音质更佳,带来更加清晰动听的音频体验

◦ 更丰富的音乐风格和流派选择

◦ 提高了对用户指令的精准响应,显著减少误解现象,并确保音乐结尾更加流畅自然

我尝试了一下新的 V3 模型,V3 我感觉起码我愿意在工作的时候循环听了。

更新公告:https://suno.ai/blog/v3
「Stable Diffusion 核心研究团队已集体辞职」。。。AI 圈比他们前端圈还精彩好玩啊。
自主人形机器人与其它人形机器人分道扬镳 | CyberDaily

这似乎就像当年智人与尼安德特人、直立人突然分道扬镳一样…
Chris 整理了一些 AI 生成 PPT 相关的工具,有需要的朋友可以自取。

1.Tome:https://mp.weixin.qq.com/s/7Pj_9cwJ0jA6XczrJ_hcVg
2.Gamma:https://mp.weixin.qq.com/s/uUxxA7cpHAb9uWxBpPIgUg
3.AiPPT:https://mp.weixin.qq.com/s/F29QGR9UWT1tn1DWwTMgMQ
4.美图AI PPT:https://mp.weixin.qq.com/s/VoyygfSAPc0P17elRMdixQ

5.讯飞智文 - AI在线生成PPT、Word https://zhiwen.xfyun.cn/home
6.MotionGo官网_原PPT动画插件口袋动画_免费商用PPT插件 http://motion.yoo-ai.com/
7.ChatPPT_AI一键对话生成PPT_智能排版美化 https://chat-ppt.com/specialrights
8.MindShow,让想法快速展示 https://www.mindshow.fun
9.iSlide推出的强大智能PPT制作辅助工具 https://www.islide.cc/
昨天答应的 ComfyUI 人像发色更换保姆级教程视频来了。#ai# #教程# #comfyui#

我会先大概讲一下原理,然后再讲对应节点的作用和参数。最后会发散一下其他的方式,比如更换美瞳以及换衣服。

工作流原理:

主要用到了 SD 中局部重绘的原理,关键在于如何选中我们需要选中的区域,这里的突破主要是 Yolo World 这图像分割项目以及 ZHO 的 Comfyui 节点。

这个项目可以精准的识别和分割人物的不同区域的位置,我们根据不同区域的组合就可以选到需要的区域去重绘。

节点作用及参数:

YoloWorld Model Loader 和 ESAM Model Loader:加载模型用的用默认设置就行。

YoloWorld ESAM:输入框输入需要分割区域的单词,Confidence_threshold 需要分割的区域越精细数值越小,反之越大。

遮罩相减:取两个链接遮罩的交集。

遮罩扩展:扩大遮罩选取范围,倒角是让选区更加平滑。

采样器:降噪幅度,修改的内容与原图越不同重绘幅度需要越大。
使用 Midjourney 生成的头像做成了微信表情包,MJ有了一致性之后生产力又提升了不少,喜欢的欢迎使用

https://w.url.cn/s/ATHQCyU#wechat_redirect
开源我每天自用工具:RepoChat-200k👾!
喂满整个GitHub Repo让大模型学习写最新框架代码!
GitHub: https://github.com/jw782cn/RepoChat-200k

GitHub这么多新框架在出现,学习成本不是极高?
如果把langchain / llamaindex / nextjs的github文档案例和代码仓
全部丢给Claude的200k上下文里,它能学会写这些新的框架吗……?
可以!非常可以!

使用很简单:Clone Repo -> 选择文件夹或者某个代码 -> 让它写!

一般我会把GitHub中接口说明书、README、优秀案例都给它,比如把langgraph / llamaindex pipeline / shadcn components选出来它就可以写了!

项目优点😊

👍随时切换模型!
Haiku用于日常使用够用了,复杂一点的代码生成换Opus继续问!上下文共享!

👍随时切换Repo!
前端Repo后端Repo都下载下来,快速点几下换你要用的文件。

👍自主决定,No RAG!
向量匹配找相似代码文件非常不准确,自己控制要的文件才是生产力。

比如下面展示的就是用Haiku直接根据Langchain官方文档写multi-agent!可以看到所有import、api调用、框架目标都是对的。有一次让它写Agent,它甚至可以自己把每个模块的Prompt都写完整了…

200k上下文推理是性能怪物,在这种长文中直接prompt进行few shot finetuning,非常可怕,我可以直接丢一整个前端组件库让它生成整个前端

不做复制粘贴的胶水程序员了,未来自然语言就是最强编程语言

给个转发点赞,之后继续更新。
昨天bioarxiv新发的论文,Bennett et al. 用一个AI模型,RFdiffusion network(类似于Midjourney和DALL·E),设计出了从未被发现过的抗体蛋白。研究者给这个模型喂了几千个已被发现的抗体,然后让它产生几百个全新的结构。目前只有一个抗体被实验证明有效,但可以算是个突破了!(也许会是个新的AlphaFold呢 拭目以待)
原文链接:https://www.biorxiv.org/content/10.1101/2024.03.14.585103v1
上周去参加卡兹克上海站的活动,其中闲人一坤(坤哥)的分享特别启发我,总结得很棒。

坤哥列了一条时间线,AI 可能可以逐步替代的影视类别是:广告、短视频、短片、短剧、长剧、电影。

这里面,目前 AI 在广告和短视频领域已经有了广泛的应用。

🔸 如果攻克了角色稳定性,则 AI 有望攻克短视频和短片。目前角色稳定性在闭源和开源生态都有一些进展,其中 Midjourney 出了 Character Ref,开源社区有 Instant-ID, IP Adapter 等解决方案。

🔸 如果攻克了场景稳定性,则 AI 有望攻克短剧和长剧。但场景稳定性要求高,可能得先攻克 AI 3D(但 AI 3D 这个显得很渺茫,目前全球数据少,据方汉老师分享目前 3D 数据差不多 1000 万条,其中高质量的不过 200 万条。)

🔸 如果攻克了角色表演,AI 能达到真人级别的演出,则 AI 有望攻克电影。虽然 talking head 一类的技术越来越成熟,但自然的表演却是一直很难实现的。

当然 Sora 一出来也许直接跃迁到短剧,但 Sora 真的会一直占据领先位吗?scaling law 在 AI 视频领域还占据着绝对的影响,但反观图片领域,scaling law 已经不能成为构建优势的主要因素了,审美(MJ)和自由度(SD社区)使得 DallE3 没有构建起绝对的优势。

在未来我还是更相信能兼容开源社区的 AI 视频模型,因为数据在用户手里。
Back to Top