关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
炸!很快就可以一键虚拟试穿线上任何服装了!

国外一位大佬正开发一款 Chrome 浏览器插件,让你可以在商城上一键虚拟试穿任何服装!

从演示视频来看,安装了此插件,并上传一张人物站立姿势图,然后在商城上的任何服装只需右键点击下即可完成虚拟试穿。

目前插件已提交审核,但还没有通过,我将持续留意,当放出时第一时间同步到星球。

插件背后使用的虚拟试穿技术正是之前推荐过的 IDM-VTON,能够生成高度真实的虚拟试穿图像。

据作者介绍,它是直接通过调用 IDM-VTON 在 Replicate 上的 API 实现插件使用的。

大家可以先到 Replicate 上体验,实测效果如下图,个人觉得已经很不错了。

链接:https://replicate.com/cuuupid/idm-vton
DeepSeek-V2 这个模型确实很强,尝试了一下我日常的任务都能胜任。

主要是太便宜了,开放平台送的十块钱总共有 500 万 Token 。冲个五十块钱估计够我用好几年。

模型为 MOE 架构总参数 236B 激活参数 21B,开源版本上下文 128K,API 上下文 32K 。

在8卡H800机器上,输出吞吐量超过每秒 5 万 Token。

模型权重下载:https://huggingface.co/deepseek-ai
每天早上就是玩Remini
还是黏土特效最好玩
对于创作女孩子我还是有一点审美自信的
吴恩达课程出的和母猪下仔一样,新课《深入了解量化》发布。

将从零开始学习实现线性量化的不同形式,包括非对称和对称模式。

课程还将指导如何在不同的维度(如单个张量、单个通道、单个组)上进行量化,以确保性能不受影响。

学习构建量化器,将任何开源深度学习模型的密集层压缩至8位精度。

通过将四个2位的权重打包进一个8位的整数中,实践如何将权重量化至2位。

课程地址:https://www.deeplearning.ai/short-courses/quantization-in-depth/
最近见到过最好的 Animatediff 作品,动作幅度很大,运动很流畅,而且画面表现也很强。

作者用 Blander 制作很简陋的动画,再用 Animatediff 转绘的。

制作过程视频在这里:https://www.instagram.com/p/C555jsDLlP_/
一个很简单的教程,教你用 GPT-4 实现一个自动的 RAG 项目,系统可以自动决定从本地数据中查找还是联网获取内容。

项目地址:https://github.com/phidatahq/phidata/tree/main/cookbook/examples/auto_rag
一晚上把 coze 的大部分插件都玩了一遍,下图记录了一些比较好玩的插件

把这些插件利用工作流串起来放到 bot 中,很多小想法都可以实现了

例如小宇宙链接分享至微信获取播客摘要:小宇宙链接提取工具 ➡️ 音频处理成文本工具 ➡️ 文本总结摘要工具 ➡️ 发布至微信客服

就可以达到分享至微信就获取摘要的目的

对于一些不复杂的产品,coze 把做产品变得像写 prd 一样简单
终于有人干这个了,之前很多在 Comfyui 中的 LLM 都得单独配置,一个插件一个玩法。

Comfyui-ollama 这个插件可以直接使用 Ollama 中的 LLM。

你可以使用带视觉能力的模型生成图片描述,也可以自定义提示词对你的图像提示进行润色生成。

插件地址:https://github.com/stavsap/comfyui-ollama
FgxE27z6KcW07ckN0Qs1_yQDYdyhv3.png
928.6 KB
今天候机的时候看到一款很特别的“AI 硬件”产品,给我留下了深刻印象。

先介绍一下这款产品,它叫诗歌相机(Poetry Camera),看着和一个拍立得相机并无二致,一切不同发生在用户按下快门之后。
完成拍摄后,相机吐出的不是相纸,而是一张印有一首诗歌的小纸条,就好像拍立得当场洗出了一张照片。诗歌纸条的内容,是 GPT-4V 基于用户拍摄的画面本身的元素/颜色/情绪等等信息,生成的一首小诗。

这款产品给我的冲击之处在于,最先进的前沿技术代表与老式的仪式感代表在这款产品上得到了融合,特别是还是借助的诗歌这个载体。

它不仅使用了拍立得这个具有特殊意义的相机形态作为载体(拍摄立刻出片,不可修图,不可保存电子档),并且在输出件上再做了一层减法——连图片都不保留,诗歌就是这一瞬间保存的唯一载体,连文字都以实体的纸条形态承载,不可被修改,不可被直接转发。
而这样一个略带复古和仪式感的流程,中间最核心的部分则是由最前沿的多模态大模型完成图像输入到诗歌生成输出的。

这个新旧的交融很打动我。
而且和给出的画面已有基本预期的拍立得比起来,生成诗歌结果的不确定性也许更让人期待。

这还是一个开源项目,开发者已经在 Github 上公开了详细的 DIY 教程(https://github.com/carolynz/poetry-camera-rpi),包含所需硬件清单和软件代码。使用树莓派作为主体,搞上热敏打印机,外加上一个纸壳子,接上大模型 API,你也可以打造一个属于自己的拍立得(写诗版)。

这里是官网链接:https://poetry.camera
Back to Top