关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AI 辅助画画,未来可期
无代码网站构建工具 WIX 推出了他们的人工智能建站工具,看起来比 Framer 的稍微好点。#ai#

它利用人工智能技术帮助用户在几分钟内创建网站。这个工具通过对话界面与用户互动,根据用户的需求快速生成高质量的网站。

用户可以灵活地调整网站的主题、布局、图片和文本,直到满意为止。

了解更多:网页链接
🟡机器人的发展前置条件已基本成熟,GPU的算力,高密度的电池储能、端到端的训练在未来几年都将逐步解决。如果是拼加班的话,真的没什么竞争力

Invalid media: video
最近很多朋友说找不到封面图片的时候就去 Catjourney 看看,这也是我们不强调提示词而是强调图片的原因.#ai画图#

不是每个人都有 MJ 账号的,很多时候就是找张好看的图片用就行,没必要自己去生成。

这几天 Catjourney 也在更新,下面是最近更新的图片,欢迎有需求就来看看。

这里访问:catjourney.life
006KpAl0ly1hng4kp0a6pj32ko29kb2g.jpg
8.3 MB
Stability AI 发布了他们最强的图片生成模型 Stable Diffusion 3 的技术报告,披露了 SD3 的更多细节。#ai##ai画图#

据他们所说,SD3 在排版质量、美学质量和提示词理解上超过了目前所有的开源模型和商业模型,是目前最强的图片生成模型。

技术报告要点如下:

◆根据人类偏好评估,SD3 在排版质量和对提示的理解程度上,均优于目前最先进的文本生成图像系统,例如 DALL·E 3、Midjourney v6 和 Ideogram v1。

◆提出了新的多模态扩散 Transformer (Multimodal Diffusion Transformer,简称 MMDiT) 架构,其使用独立的权重集分别表示图像和语言。与 SD3 的先前版本相比,该架构改善了系统对文本的理解能力和拼写能力。

◆SD3 8B 大小的模型可以在 GTX 4090 24G 显存上运行。

◆SD3 将发布多个参数规模不等的模型方便在消费级硬件上运行,参数规模从 800M 到 8B 。

◆SD3 架构以 Diffusion Transformer (简称"DiT",参见 Peebles & Xie,2023)为基础。鉴于文本嵌入和图像嵌入在概念上存在较大差异,我们为这两种模态使用了独立的权重集。

◆通过这种方法,信息得以在图像 Token 和文本 Token 之间流动,从而提高了模型生成结果的整体理解力和排版质量。我们在论文中还讨论了如何轻松地将这一架构扩展至视频等多模态场景。

◆SD3 采用了矫正流 (Rectified Flow,简称 RF) 的公式 (Liu et al.,2022;Albergo & Vanden-Eijnden,2022;Lipman et al.,2023),在训练过程中,数据和噪声被连接在一条线性轨迹上。这导致了更直的推理路径,从而可以使用更少的步骤进行采样。

◆扩展矫正流 Transformer 模型:使用重新加权的 RF 公式和 MMDiT 主干网络,对文本到图像的合成任务开展了模型扩展研究。我们训练了一系列模型,其规模从 15 个 。Transformer 块 (4.5 亿参数) 到 38 个块 (80 亿参数) 不等。
Anthropic 推出 Claude 3 ,包括 Claude 3 Haiku、Claude 3 Sonnet 和 Claude 3 Opus 3个版本,能力从小到大。

Opus 和 Sonnet 现可在 claude.ai 和 Claude API 中使用,Haiku 即将推出。

能力方面,见图2。

速度方面:

- Haiku 是市场上同类智能产品中速度最快、性价比最高的模型。它可以在三秒内读取 arXiv 上一篇信息和数据密集的研究论文(约 10k tokens),并附带图表和图形。

- Sonnet 的速度比 Claude 2 和 Claude 2.1 快 2 倍,而且智能水平更高。它擅长处理要求快速响应的任务,如知识检索或销售自动化。Opus 的速度与 Claude 2 和 2.1 类似,但智能水平更高。

vision 能力

- Claude 3 型号具有与其他领先模型同等的复杂 vision 功能。它们可以处理各种 vision 格式,包括照片、图表、图形和技术图表。(图3)

准确性:

- 与 Claude 2.1 相比,Opus 在这些具有挑战性的开放式问题上的准确率(或正确答案)提高了两倍,同时也减少了错误答案。(图4) 另外,Claude 3 模型还将很快启用引文。

上下文能力:

Claude 3 系列模型在推出之初将提供 20 万个上下文窗口。不过,所有三种模型都能接受超过 100 万个 tokens 的输入,Anthropic 会向特定用户提供。
开通了Claude Pro尝试了Claude 3 Opus,我拿他主要做了三个测试,确实很强。

首先用宝玉的翻译提示词尝试了一下复杂英文内容的翻译,Claude 比GPT-4做的好,他会主动对没有排版的内容进行分段和排版时其更加的易读。
之前GPT-4从来没有主动进行过这种操作。翻译结果也比GPT-4更加顺畅。

然后我用一个样式比较复杂的设计稿组件截图让他还原,在我强调了需要还原样式之后,他对样式细节处理的非常好,相当接近设计稿了,GPT-4之前一直搞不定设计稿细节。

最后是多模态,我找了一个论文的一部分让他解读,分析的也很清楚,不过给出的信息没有GPT-4丰富,感觉多模态还需要加油。
伴随 Claude 3 推出的还有一个提示词库,里面有Anthropic提供的非常多的示例提示词,方便开发者和用户尝试。#ai##claude3#

详情页还给出了对应提示词的示例回答和 API,可以去看看学一下 Claude 的提示词写法。

这里访问:网页链接
除了提示词库之外他们还更新了 Anthropic Cookbook 可以让你使用 Claude 3 新的能力的代码和提示词例子:#ai##claude3#

在Claude中使用图像:这本食谱提供了关于如何开始使用图像以及确保图像具有最高质量性能的最佳实践技巧。

自动评估:了解如何使用Claude来自动化提示评估过程。

启用 JSON 模式:通过这本快速简便的食谱,确保始终获得 JSON。

使用Claude创建内容审查过滤器:了解如何使用Claude为您的应用程序创建内容审查过滤器。

这里使用:网页链接
Stability AI 太惨了老是发消息被忽略,昨晚他们还跟Tripo AI 联合推出了 TripoSR 3D 生成模型,可以在不到 1 秒的时间里生成高质量的 3D 模型。#ai#

TripoSR的推理只需要极低的算力,甚至都不需要 GPU,极大的降低了生产成本。权重模型允许商业化使用。

性能:TripoSR可以在其他模型所需时间的一小部分时间内创建详细的3D模型。在Nvidia A100上进行测试时,它可以在大约0.5秒内生成初步质量的3D输出(纹理网格),表现优于其他开放的图像到3D模型,如OpenLRM。

技术细节:训练数据准备包括多种数据渲染技术,更贴近真实世界中图像的分布,显著提高了模型的泛化能力。精心策划了一个CC-BY,即Objaverse数据集的高质量子集,用于训练数据。在模型方面,还对基础LRM模型进行了多项技术改进,包括通道数优化、蒙版监督和更高效的裁剪渲染策略。

详细信息:网页链接歸藏的AI工具箱的微博视频
推理速度超级快的 Gorq API 现在所有人都可以申请,文档和 Playground 页面均已推出。#ai#

这里申请:网页链接
尝试了一下Dashtoon 这个 AI 漫画生成应用,发现做的挺成熟的,该有的功能都有,可以一次性生成也给了充分的编辑和自定义空间。

国内的很多小说视频还是手工用各种 AI 工具拼凑的阶段,可以借鉴一下这个产品的实现方式,是个机会。

他的人物一致性是通过内置的非常多人物 Lora 实现的,目前来看这确实是最稳定的方案。

具体的生成逻辑是你输入大概的故事描述,他会为你生成很多个场景描述,你修改确认之后就会根据文字场景描述生成图片和漫画的对话。

这里尝试:https://dashtoon.com
在 Claude 3 发布 AI 圈的狂欢中,Web 3 的朋友们也吃得饱饱的,BTC涨到了 67000。
开通了Claude Pro尝试了Claude 3 Opus,我拿他主要做了三个测试,确实很强。#claude3##ai#

首先用宝玉的翻译提示词尝试了一下复杂英文内容的翻译,Claude 比GPT-4做的好,他会主动对没有排版的内容进行分段和排版时其更加的易读。
之前GPT-4从来没有主动进行过这种操作。翻译结果也比GPT-4更加顺畅。

然后我用一个样式比较复杂的设计稿组件截图让他还原,在我强调了需要还原样式之后,他对样式细节处理的非常好,相当接近设计稿了,GPT-4之前一直搞不定设计稿细节。

最后是多模态,我找了一个论文的一部分让他解读,分析的也很清楚,不过给出的信息没有GPT-4丰富,感觉多模态还需要加油。
Back to Top