关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
把 YC 这个 batch 的近 150 个项目扫了一遍,大部分项目都还非常早期,还没有找到 Product Market Fit。因此,相比具体的项目来说,或许更有意义的是整体的场景分布,从中或许能够看出哪些场景的需求足够强,且已经接近 Technology Product Fit 了。看下来的一些个人感受:

- 绝大部分都是 2B,2C 的项目只有不到 20 个(加上教育类的),占比也就 10%出头的样子;
- 2B 场景下,Sales, CCaaS, ITSM, DevOps(主要是自动化测试), RPA, Analytics 这几个细分赛道非常集中,加在一起有 50+ 个项目。光是用语音帮牙科诊所前台接电话都能有俩项目撞车;
- 垂直领域里,主要是医疗、金融、法律三个比较有钱的行业;
- 中间层里,面向模型的训练、评测、部署、加速、托管等服务相比之前少一些了,但整体占比也有 10%;
- 2C 场景下,有一些视频生成和创作工具,但更多的似乎是音频(音乐、播客等)的创作工具。

一些个人觉得有趣(未必优秀)的项目:

- Zoom 会议结束后,根据用户在会议中的(英文)发言给出即时反馈,来帮助用户提升商务英语口语水平的项目;
- 帮助用户更高效地申请联邦政府拨款的项目;
- 将工程师的3D设计图生成可用于制造的2D图纸的项目;
- 根据用户的兴趣直接生成播客的项目。

PS. 原本尝试用 Kimi / Claude / Perplexity 帮忙做研究,结果发现前 10 个链接还行,之后链接太多了还是搞不定...
一个让我觉得自己是用 ai 解决需求小天才的用法,最近最让我惊喜和疯狂玩的用法:把自己的性格测试丢给 kimi,让ta 读取内容之后,扮演我自己,然后各种余一问余一。
甚至在脑子没有想法之后,问ta 你有什么想问自己的,最后还是让 ai 扮演我回答。问的问题包括:
什么让我内耗,决策机制是什么?为什么会纠结?你在追求什么?xxx 对你有用吗?xxx 评价是准确的吗?……
回答都真的挺准确,真的是我。好好用,好好玩。
打算明儿写个简明教程,目标是让非技术出身的人,也可以在20分钟掌握最基础的Python+AI,并完成一个简单且实用的项目🤔
Suno 昨晚正式发布了他们的 V3 音乐生成模型,现在所有人都可以使用。

V3 改进的内容主要是:

◦ 音质更佳,带来更加清晰动听的音频体验

◦ 更丰富的音乐风格和流派选择

◦ 提高了对用户指令的精准响应,显著减少误解现象,并确保音乐结尾更加流畅自然

我尝试了一下新的 V3 模型,V3 我感觉起码我愿意在工作的时候循环听了。

更新公告:https://suno.ai/blog/v3
「Stable Diffusion 核心研究团队已集体辞职」。。。AI 圈比他们前端圈还精彩好玩啊。
自主人形机器人与其它人形机器人分道扬镳 | CyberDaily

这似乎就像当年智人与尼安德特人、直立人突然分道扬镳一样…
Chris 整理了一些 AI 生成 PPT 相关的工具,有需要的朋友可以自取。

1.Tome:https://mp.weixin.qq.com/s/7Pj_9cwJ0jA6XczrJ_hcVg
2.Gamma:https://mp.weixin.qq.com/s/uUxxA7cpHAb9uWxBpPIgUg
3.AiPPT:https://mp.weixin.qq.com/s/F29QGR9UWT1tn1DWwTMgMQ
4.美图AI PPT:https://mp.weixin.qq.com/s/VoyygfSAPc0P17elRMdixQ

5.讯飞智文 - AI在线生成PPT、Word https://zhiwen.xfyun.cn/home
6.MotionGo官网_原PPT动画插件口袋动画_免费商用PPT插件 http://motion.yoo-ai.com/
7.ChatPPT_AI一键对话生成PPT_智能排版美化 https://chat-ppt.com/specialrights
8.MindShow,让想法快速展示 https://www.mindshow.fun
9.iSlide推出的强大智能PPT制作辅助工具 https://www.islide.cc/
昨天答应的 ComfyUI 人像发色更换保姆级教程视频来了。#ai# #教程# #comfyui#

我会先大概讲一下原理,然后再讲对应节点的作用和参数。最后会发散一下其他的方式,比如更换美瞳以及换衣服。

工作流原理:

主要用到了 SD 中局部重绘的原理,关键在于如何选中我们需要选中的区域,这里的突破主要是 Yolo World 这图像分割项目以及 ZHO 的 Comfyui 节点。

这个项目可以精准的识别和分割人物的不同区域的位置,我们根据不同区域的组合就可以选到需要的区域去重绘。

节点作用及参数:

YoloWorld Model Loader 和 ESAM Model Loader:加载模型用的用默认设置就行。

YoloWorld ESAM:输入框输入需要分割区域的单词,Confidence_threshold 需要分割的区域越精细数值越小,反之越大。

遮罩相减:取两个链接遮罩的交集。

遮罩扩展:扩大遮罩选取范围,倒角是让选区更加平滑。

采样器:降噪幅度,修改的内容与原图越不同重绘幅度需要越大。
使用 Midjourney 生成的头像做成了微信表情包,MJ有了一致性之后生产力又提升了不少,喜欢的欢迎使用

https://w.url.cn/s/ATHQCyU#wechat_redirect
开源我每天自用工具:RepoChat-200k👾!
喂满整个GitHub Repo让大模型学习写最新框架代码!
GitHub: https://github.com/jw782cn/RepoChat-200k

GitHub这么多新框架在出现,学习成本不是极高?
如果把langchain / llamaindex / nextjs的github文档案例和代码仓
全部丢给Claude的200k上下文里,它能学会写这些新的框架吗……?
可以!非常可以!

使用很简单:Clone Repo -> 选择文件夹或者某个代码 -> 让它写!

一般我会把GitHub中接口说明书、README、优秀案例都给它,比如把langgraph / llamaindex pipeline / shadcn components选出来它就可以写了!

项目优点😊

👍随时切换模型!
Haiku用于日常使用够用了,复杂一点的代码生成换Opus继续问!上下文共享!

👍随时切换Repo!
前端Repo后端Repo都下载下来,快速点几下换你要用的文件。

👍自主决定,No RAG!
向量匹配找相似代码文件非常不准确,自己控制要的文件才是生产力。

比如下面展示的就是用Haiku直接根据Langchain官方文档写multi-agent!可以看到所有import、api调用、框架目标都是对的。有一次让它写Agent,它甚至可以自己把每个模块的Prompt都写完整了…

200k上下文推理是性能怪物,在这种长文中直接prompt进行few shot finetuning,非常可怕,我可以直接丢一整个前端组件库让它生成整个前端

不做复制粘贴的胶水程序员了,未来自然语言就是最强编程语言

给个转发点赞,之后继续更新。
Back to Top