关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
Suno 昨晚正式发布了他们的 V3 音乐生成模型,现在所有人都可以使用。
V3 改进的内容主要是:
◦ 音质更佳,带来更加清晰动听的音频体验
◦ 更丰富的音乐风格和流派选择
◦ 提高了对用户指令的精准响应,显著减少误解现象,并确保音乐结尾更加流畅自然
我尝试了一下新的 V3 模型,V3 我感觉起码我愿意在工作的时候循环听了。
更新公告:https://suno.ai/blog/v3
V3 改进的内容主要是:
◦ 音质更佳,带来更加清晰动听的音频体验
◦ 更丰富的音乐风格和流派选择
◦ 提高了对用户指令的精准响应,显著减少误解现象,并确保音乐结尾更加流畅自然
我尝试了一下新的 V3 模型,V3 我感觉起码我愿意在工作的时候循环听了。
更新公告:https://suno.ai/blog/v3
1.Tome:https://mp.weixin.qq.com/s/7Pj_9cwJ0jA6XczrJ_hcVg
2.Gamma:https://mp.weixin.qq.com/s/uUxxA7cpHAb9uWxBpPIgUg
3.AiPPT:https://mp.weixin.qq.com/s/F29QGR9UWT1tn1DWwTMgMQ
4.美图AI PPT:https://mp.weixin.qq.com/s/VoyygfSAPc0P17elRMdixQ
5.讯飞智文 - AI在线生成PPT、Word https://zhiwen.xfyun.cn/home
6.MotionGo官网_原PPT动画插件口袋动画_免费商用PPT插件 http://motion.yoo-ai.com/
7.ChatPPT_AI一键对话生成PPT_智能排版美化 https://chat-ppt.com/specialrights
8.MindShow,让想法快速展示 https://www.mindshow.fun
9.iSlide推出的强大智能PPT制作辅助工具 https://www.islide.cc/
昨天答应的 ComfyUI 人像发色更换保姆级教程视频来了。#ai# #教程# #comfyui#
我会先大概讲一下原理,然后再讲对应节点的作用和参数。最后会发散一下其他的方式,比如更换美瞳以及换衣服。
工作流原理:
主要用到了 SD 中局部重绘的原理,关键在于如何选中我们需要选中的区域,这里的突破主要是 Yolo World 这图像分割项目以及 ZHO 的 Comfyui 节点。
这个项目可以精准的识别和分割人物的不同区域的位置,我们根据不同区域的组合就可以选到需要的区域去重绘。
节点作用及参数:
YoloWorld Model Loader 和 ESAM Model Loader:加载模型用的用默认设置就行。
YoloWorld ESAM:输入框输入需要分割区域的单词,Confidence_threshold 需要分割的区域越精细数值越小,反之越大。
遮罩相减:取两个链接遮罩的交集。
遮罩扩展:扩大遮罩选取范围,倒角是让选区更加平滑。
采样器:降噪幅度,修改的内容与原图越不同重绘幅度需要越大。
我会先大概讲一下原理,然后再讲对应节点的作用和参数。最后会发散一下其他的方式,比如更换美瞳以及换衣服。
工作流原理:
主要用到了 SD 中局部重绘的原理,关键在于如何选中我们需要选中的区域,这里的突破主要是 Yolo World 这图像分割项目以及 ZHO 的 Comfyui 节点。
这个项目可以精准的识别和分割人物的不同区域的位置,我们根据不同区域的组合就可以选到需要的区域去重绘。
节点作用及参数:
YoloWorld Model Loader 和 ESAM Model Loader:加载模型用的用默认设置就行。
YoloWorld ESAM:输入框输入需要分割区域的单词,Confidence_threshold 需要分割的区域越精细数值越小,反之越大。
遮罩相减:取两个链接遮罩的交集。
遮罩扩展:扩大遮罩选取范围,倒角是让选区更加平滑。
采样器:降噪幅度,修改的内容与原图越不同重绘幅度需要越大。
开源我每天自用工具:RepoChat-200k👾!
喂满整个GitHub Repo让大模型学习写最新框架代码!
GitHub: https://github.com/jw782cn/RepoChat-200k
GitHub这么多新框架在出现,学习成本不是极高?
如果把langchain / llamaindex / nextjs的github文档案例和代码仓
全部丢给Claude的200k上下文里,它能学会写这些新的框架吗……?
可以!非常可以!
使用很简单:Clone Repo -> 选择文件夹或者某个代码 -> 让它写!
一般我会把GitHub中接口说明书、README、优秀案例都给它,比如把langgraph / llamaindex pipeline / shadcn components选出来它就可以写了!
项目优点😊
👍随时切换模型!
Haiku用于日常使用够用了,复杂一点的代码生成换Opus继续问!上下文共享!
👍随时切换Repo!
前端Repo后端Repo都下载下来,快速点几下换你要用的文件。
👍自主决定,No RAG!
向量匹配找相似代码文件非常不准确,自己控制要的文件才是生产力。
比如下面展示的就是用Haiku直接根据Langchain官方文档写multi-agent!可以看到所有import、api调用、框架目标都是对的。有一次让它写Agent,它甚至可以自己把每个模块的Prompt都写完整了…
200k上下文推理是性能怪物,在这种长文中直接prompt进行few shot finetuning,非常可怕,我可以直接丢一整个前端组件库让它生成整个前端
不做复制粘贴的胶水程序员了,未来自然语言就是最强编程语言
给个转发点赞,之后继续更新。
喂满整个GitHub Repo让大模型学习写最新框架代码!
GitHub: https://github.com/jw782cn/RepoChat-200k
GitHub这么多新框架在出现,学习成本不是极高?
如果把langchain / llamaindex / nextjs的github文档案例和代码仓
全部丢给Claude的200k上下文里,它能学会写这些新的框架吗……?
可以!非常可以!
使用很简单:Clone Repo -> 选择文件夹或者某个代码 -> 让它写!
一般我会把GitHub中接口说明书、README、优秀案例都给它,比如把langgraph / llamaindex pipeline / shadcn components选出来它就可以写了!
项目优点😊
👍随时切换模型!
Haiku用于日常使用够用了,复杂一点的代码生成换Opus继续问!上下文共享!
👍随时切换Repo!
前端Repo后端Repo都下载下来,快速点几下换你要用的文件。
👍自主决定,No RAG!
向量匹配找相似代码文件非常不准确,自己控制要的文件才是生产力。
比如下面展示的就是用Haiku直接根据Langchain官方文档写multi-agent!可以看到所有import、api调用、框架目标都是对的。有一次让它写Agent,它甚至可以自己把每个模块的Prompt都写完整了…
200k上下文推理是性能怪物,在这种长文中直接prompt进行few shot finetuning,非常可怕,我可以直接丢一整个前端组件库让它生成整个前端
不做复制粘贴的胶水程序员了,未来自然语言就是最强编程语言
给个转发点赞,之后继续更新。
原文链接:https://www.biorxiv.org/content/10.1101/2024.03.14.585103v1
上周去参加卡兹克上海站的活动,其中闲人一坤(坤哥)的分享特别启发我,总结得很棒。
坤哥列了一条时间线,AI 可能可以逐步替代的影视类别是:广告、短视频、短片、短剧、长剧、电影。
这里面,目前 AI 在广告和短视频领域已经有了广泛的应用。
🔸 如果攻克了角色稳定性,则 AI 有望攻克短视频和短片。目前角色稳定性在闭源和开源生态都有一些进展,其中 Midjourney 出了 Character Ref,开源社区有 Instant-ID, IP Adapter 等解决方案。
🔸 如果攻克了场景稳定性,则 AI 有望攻克短剧和长剧。但场景稳定性要求高,可能得先攻克 AI 3D(但 AI 3D 这个显得很渺茫,目前全球数据少,据方汉老师分享目前 3D 数据差不多 1000 万条,其中高质量的不过 200 万条。)
🔸 如果攻克了角色表演,AI 能达到真人级别的演出,则 AI 有望攻克电影。虽然 talking head 一类的技术越来越成熟,但自然的表演却是一直很难实现的。
当然 Sora 一出来也许直接跃迁到短剧,但 Sora 真的会一直占据领先位吗?scaling law 在 AI 视频领域还占据着绝对的影响,但反观图片领域,scaling law 已经不能成为构建优势的主要因素了,审美(MJ)和自由度(SD社区)使得 DallE3 没有构建起绝对的优势。
在未来我还是更相信能兼容开源社区的 AI 视频模型,因为数据在用户手里。
坤哥列了一条时间线,AI 可能可以逐步替代的影视类别是:广告、短视频、短片、短剧、长剧、电影。
这里面,目前 AI 在广告和短视频领域已经有了广泛的应用。
🔸 如果攻克了角色稳定性,则 AI 有望攻克短视频和短片。目前角色稳定性在闭源和开源生态都有一些进展,其中 Midjourney 出了 Character Ref,开源社区有 Instant-ID, IP Adapter 等解决方案。
🔸 如果攻克了场景稳定性,则 AI 有望攻克短剧和长剧。但场景稳定性要求高,可能得先攻克 AI 3D(但 AI 3D 这个显得很渺茫,目前全球数据少,据方汉老师分享目前 3D 数据差不多 1000 万条,其中高质量的不过 200 万条。)
🔸 如果攻克了角色表演,AI 能达到真人级别的演出,则 AI 有望攻克电影。虽然 talking head 一类的技术越来越成熟,但自然的表演却是一直很难实现的。
当然 Sora 一出来也许直接跃迁到短剧,但 Sora 真的会一直占据领先位吗?scaling law 在 AI 视频领域还占据着绝对的影响,但反观图片领域,scaling law 已经不能成为构建优势的主要因素了,审美(MJ)和自由度(SD社区)使得 DallE3 没有构建起绝对的优势。
在未来我还是更相信能兼容开源社区的 AI 视频模型,因为数据在用户手里。
关于Kimi:
Q:参数量是不是很大?
A:目前参数2000亿左右。
Q:kimi算力侧支持?
A:用的字节火山引擎,目前还是英伟达为主,无论A100、H100、H800,公司很难找英伟达大规模采购。国内云厂商买卡有优势,而且有储备。
公司不太可能私有化一个数据中心,供应链资源很难开拓,而且成本很高。预训练需要1万多张卡,公有云,分配多少显卡不会关注,是以A100作为标准去衡量。
训练的数据量大概4-5T,全是中文。
B端用户不能接入API其实更多是并发处理问题,和算力也有一定关系。云服务运维方面有一些跟不上了。
Q:国产芯片怎么样?
A:生态做的不好。训练卡,开发各种代码、函数调用、英伟达迭代12个版本,国内很难做出一个生态库去对标英伟达。
华为:性能对标A800,软件不好,完全不兼容CUDA。要找一个工程团队给我们改代码,工程成本太高了。
Q:同海外模型相比优劣势?
A:在中文处理能力上,公司kimi领先,语料采集、标注上的把握,我们有天然的优势。如果把语言扩大到其他语言,可能没有什么优势。
交互的拟人性,kimi整体上会比openAI落后10%左右。逻辑推理能力也会落后。
云计算资源如果匹配上的,0.5-1年公司可以追上去。但目前在GPU方面是卡脖子的,差距会越拉越大。
Q:参数量是不是很大?
A:目前参数2000亿左右。
Q:kimi算力侧支持?
A:用的字节火山引擎,目前还是英伟达为主,无论A100、H100、H800,公司很难找英伟达大规模采购。国内云厂商买卡有优势,而且有储备。
公司不太可能私有化一个数据中心,供应链资源很难开拓,而且成本很高。预训练需要1万多张卡,公有云,分配多少显卡不会关注,是以A100作为标准去衡量。
训练的数据量大概4-5T,全是中文。
B端用户不能接入API其实更多是并发处理问题,和算力也有一定关系。云服务运维方面有一些跟不上了。
Q:国产芯片怎么样?
A:生态做的不好。训练卡,开发各种代码、函数调用、英伟达迭代12个版本,国内很难做出一个生态库去对标英伟达。
华为:性能对标A800,软件不好,完全不兼容CUDA。要找一个工程团队给我们改代码,工程成本太高了。
Q:同海外模型相比优劣势?
A:在中文处理能力上,公司kimi领先,语料采集、标注上的把握,我们有天然的优势。如果把语言扩大到其他语言,可能没有什么优势。
交互的拟人性,kimi整体上会比openAI落后10%左右。逻辑推理能力也会落后。
云计算资源如果匹配上的,0.5-1年公司可以追上去。但目前在GPU方面是卡脖子的,差距会越拉越大。
星主:亦仁
新优惠券
最新赚钱机会看生财,生财最新机会看风向标。
如果你想培养商业嗅觉,请来刷风向标;
如果你想知道最新的趋势和热点,请来刷风向标;
如果你想寻找未被充分挖掘的蓝海赚钱机会,请来刷风向标;
一、生财有术第八期「唤新活动」正式开启。
二、3月20日万人航海开营。这也是第七期最后一次航海,站好最后一班岗。
三、3 月 23 日,航海家千人线下见面会。这是近几年来筹备最久的线下聚会,相信会给来的人带来不少收获。
四、3 月 28 日,生财有术第八期权益正式发布,续费也将同步开启。我们将给你带来非常有诚意的大额续费优惠券,可以小小期待一下。
五、4 月 8 日,《生财思维课》正式发布。这是生财团队花了很多精力打磨的思维认知课程,大家都可以免费领取一份。
六、4 月 10 日,「扬帆正当时」定制版手机壳和我的一封信寄出。
七、4 月 15 日,「2024 年十大潜力生财赛道」发布,包括小红书、视频号、抖音、AI、TikTok、出海、本地生活等热门赛道,一起来看看 2024 年值得深耕的机会有哪些。
八、4 月 18 日,生财有术七周年,优惠续费最后一天,第八期正式开启。
九、4 月 28 日,生财有术从 2465 元涨价为 2765 元。
十、5 月 28 日,新一期航海开启报名。
2024 年 3 月 20 日 - 2024 年 4 月 28 日,新朋友可以通过使用一张 ¥200 的优惠券,即 ¥2265 享受一个完整自然年的交付;同时,在 4 月 28 日晚上 20:00,这个价格会上调至 2765元。