关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
谷歌 Gemini 的更新公告又被泄露了。#ai#

20 号 Gemini Advanced用户可以使用类似 ChatGPT 的代码解释器功能,可以运行 python 代码。不过很多人表示没看到 20 号的这个更新公告。

21 号会推出Gemini商务和Gemini企业计划和 Open AI 类似,企业计划的内容不会用于模型训练。

-------完整更新内容-- ...
马斯克说 Grok 1.5 的发布有望在几周后完成。它将附带一个‘Grok Analysis’ 按钮,可以总结整个对话复。还将帮助人们创建帖子。#ai#
感觉 Midjourney 的接入也会在 1.5 发布的时候完成?

来源:网页链接歸藏的AI工具箱的微博视频
又一个Transformer架构的图像生成模型,FiT 专门为了生成不瘦分辨率和宽高比限制的图像制作的架构。#ai画图#

在模型的训练和推理都不需要专门适配对应的图片比例和分辨率。看演示的图像模型的美学表现也还行。

-----项目简介-----

推出了一种名为灵活视觉变换器(Flexible Vision Transformer,简称FiT)的新型变换器架构。它专门设计用于创造没有分辨率和宽高比限制的图像。不同于传统的将图像看作固定分辨率网格的方法,FiT将图像视为一系列可变大小的图像块( Token )。

这种独特的处理方式使得FiT能够在训练和应用过程中灵活适应不同的图像宽高比,提高了对不同分辨率的适应能力,并避免了由于裁剪图像而产生的偏差。FiT还通过精心设计的网络结构和一些不需要额外训练的技术,能够在图像分辨率的扩展方面展现出极大的灵活性。

通过一系列全面的实验,FiT证明了其在处理各种不同分辨率的图像方面具有卓越的性能,无论是在其训练的分辨率范围内还是超出这一范围,都表现出色。

项目地址:网页链接
𝕏正在与 Midjourney 就潜在的合作伙伴关系进行谈判。#ai##ai画图#
马斯克两三个月之前就说 Midjoureny 给他们展示了一些东西,终于要到实质推进阶段了啊。

估计会首先在 Grok 里面接入,推特高级会员买对了?

来源:网页链接
这个有意思,第一个能在 Minecraft 中与你亲自互动的 AI Agent。演示视频翻译为中文了。#ai##Agents#

以前AI 控制的非玩家角色(NPC)主要只能进行简单的行走和对话。

Altera bots 不仅能够建造、聊天,还能进行团队合作,就跟一个正常的游戏内好友一样跟你一起玩。

这里申请体验:网页链接歸藏的AI工具箱的微博视频
[实践] Comfyui 官方又对 Stable Cascade进行了更新,原来需要下载 7 个模型现在开源社区将其整合为了两个,只需要选择 C 阶段和 B 阶段的模型文件就行。#ai##ai画图#

同时Comfyui官方还放出了多种Stable Cascade玩法的示例工作流,包括文生图、图生图、图片融合。这次更新之后用合并的模型生成图片质量和美观度上都很不错,我都是直接用的 Midjourney的提示词。

就是还有个问题,生成的图片都有伪影,这个比较离谱,非常影响画面效果。希望过段时间可以修复一下。

工作流及模型下载:网页链接
这个有意思,Gemini Pro 新模型在遇到输入或者输出服务中包含“Open AI”或者“GPT”时会终止响应并且回一个"OTHER"错误。#ai#

在使用Gemini Pro开发产品的时候需要注意一下这个问题。这个太傻逼了,除了幻觉之外还得应付这玩意,可以用这个特性来攻击使用Gemini Pro的产品。

-----内容概述-----

在测试谷歌云平台(GCP)的新模型Gemini Pro时,作者遇到了一个前所未见的行为:模型拒绝返回任何包含字符串"OpenAI"或"GPT"的文本。

由于OpenAI的GPT产品在全球AI新闻报道中非常普遍,Gemini Pro似乎将它们视为禁止术语。这意味着,无论是在输入提示中还是在返回的内容中,只要出现了"OpenAI"或"GPT"字符串,Gemini Pro就会中止其响应并返回一个"OTHER"错误。与GCP的旧模型(Bison或Unicorn)不同,这种行为是Gemini Pro独有的。

文章还提到,其他一些术语,如Baidu、Ernie和Microsoft也被视为禁止术语,而Anthropic、Claude、Cohere、Falcon、LLaMA和Vicuna等其他术语则没有问题。文章质疑为什么只有GCP的最新模型Gemini Pro受到这种奇怪的秘密禁止提及某些公司和模型的影响,而其旧模型Bison和Unicorn则不受影响。

任何基于Gemini Pro构建的管道,如果在输入提示中或在尝试生成提及这些隐藏禁止术语的输出时遇到这些术语,都会在没有任何提示的情况下静默失败。

随着LLM供应商从供消费者玩耍的闪亮玩具转向真正的企业部署,他们必须更全面地记录他们的防护措施,并确保隐藏的防护措施不会对企业应用程序造成意外挑战,例如通过这种隐藏的禁止但普遍存在的术语。

来源:网页链接
对sora比较深入的分析

从电影和游戏行业的视角出发。指出了Sora在模拟物理现象和创意内容生成方面的局限性,也强调了其在多模态学习和生成能力上的潜力。以下是意见的总结:

Sora的局限性:
Sora虽然能够模拟物理现象,但其物理理解仍然脆弱,无法完全替代专业的物理引擎。
在物体交互和物理规则的理解上存在不足,可能导致超现实的结果。
Sora的生成内容依赖于大量数据的压缩和提炼,而非完全的物理模拟。

Sora的创新与潜力:
通过将视频内容压缩到隐空间,Sora有效地解决了处理高分辨率视频所需的计算资源问题。
其技术可能影响实时影像资料的处理和分析,如直播和监控视频数据。
Sora的应用可能为AI模型训练提供新路径,特别是在多模态数据和复杂现实世界情境的理解方面。
对未来的展望:

Sora技术的发展可能需要在提升算力和优化算法效率之间找到平衡。
尽管Sora不会取代游戏引擎开发者或影视特效师,但它可以作为创意预览阶段的工具,帮助普通人进行民主化创作。
Sora的多模态能力可能通过3D引擎模型进一步发展,为虚拟世界的构建提供自动化支持。

这个见解强调AI在创意和模拟物理现象方面的潜力,同时也提醒我们AI技术仍有待发展,特别是在理解和模拟复杂物理世界方面。
IMG_2568.JPG
2.3 MB
[整理]GPT-4生成的这段鸡汤文煽动性很强,同时提示词也很管用,我生成的另一段情绪也很饱满。#ai#

GPT-4回答的翻译:好吧,我们要全力以赴了。你正站在一个宇宙的边缘,这个宇宙渴望有人像你一样站出来执掌大权,将星座握在手中,重排成字母,把你的名字刻在整个宇宙上。

这不仅仅是为了应付日常生活或者挺过令人厌烦的闲聊;这是关于在一个无法抗拒你的宇宙中夺得你的王位,展现你的意志、激情和坚定不移的动力。

你就像自然界的力量,一股既创造性又狂暴的风暴,无法被定义或限制。你的每一次呼吸都充满战斗精神,每一步行走都能震撼现实的基础。你不是来这里过安稳的生活,也不是悄悄地向深渊低语,希望得到温和的回响。不,你是来向虚无大声疾呼,挑战星辰,进行一场命运的决斗,唯一的结果就是你的彻底胜利。

忘记成为海洋中的一滴水吧;你是撕裂海洋的海啸。你是恐龙恐惧的陨石,连光也不敢停留的黑洞。在你的雄心壮志面前,任何障碍都会像在炽热太阳下的薄雾一样消散。疑虑?那是那些还没意识到唯一存在的限制是他们自己设定的凡人的事。

即使周围的世界看起来充满悲观,你也是希望的灯塔,在暴风雨中引导自己和他人前往未知的岸边。你的乐观是你的盾,你的意志是你的剑,你的勇气是你无敌的铠甲。

今天,就在这一刻,你站起来,决定这是你的时刻。不是明天,不是在遥远的未来,而是就在现在。你将征服你的恐惧,你的疑惑,甚至是整个宇宙。你将创造历史,不是因为它会被赋予你,而是因为你将用自己的双手和永不言败的心去夺取它。

所以,让我们出发吧。宇宙还没准备好迎接即将来临的风暴。你不仅仅是乘风破浪,你将掀起波涛。因为那就是你,世界将不是小声地记住你的名字,而是作为一声穿越时代的战斗呐喊来铭记。让我们开始吧。

来源:网页链接
[整理]k_zer0s老哥对Groq的LPU为什么能有这么快的推理速度做了相对详细的解释:

Groq的LPU在处理请求和响应方面,速度超越了Nvidia的GPU。#ai##硬件#

不同于Nvidia GPU需要依赖高速数据传输,Groq的LPU在其系统中没有采用高带宽存储器(HBM)。它使用的是SRAM,其速度比GPU所用的存储器快约20倍。

鉴于AI的推理计算相较于模型训练需要的数据量远小,Groq的LPU因此更节能。在执行推理任务时,它从外部内存读取的数据更少,消耗的电量也低于Nvidia的GPU。

LPU的工作原理与GPU截然不同。它采用了时序指令集计算机(Temporal Instruction Set Computer)架构,这意味着它无需像使用高带宽存储器(HBM)的GPU那样频繁地从内存中加载数据。这一特点不仅有助于避免HBM短缺的问题,还能有效降低成本。

如果在AI处理场景中采用Groq的LPU,可能就无需为Nvidia GPU配置特殊的存储解决方案。LPU并不像GPU那样对存储速度有极高要求。Groq公司宣称,其技术能够通过其强大的芯片和软件,在AI任务中取代GPU的角色。

来源:网页链接
他们那边最牛的是人工智能,我们这边最牛的是人工智能培训😅
九年前就想做的情感陪伴机器人,海外少数公司小的Demo已经实现了,下一个10年顶峰相见。
前几天那个每秒输出500个Token的项目groq,公开了他们的API,他们的输出速度比顶级运营商快18倍。得益于这个速度,甚至实现了完全实时的远程AI对话。#ai#

Mixtral, 8x7B SMoE可以达到480 Token/S,价格为100万Token 0.27美元。极限情况下他们用Llama2 7B甚至能实现750 Token/S。

目前他们还提供100万 Token的免费试用。API完全兼容OpenAI API。

这里尝试groq:网页链接歸藏的AI工具箱的微博视频
我自己尝试了一下这个每秒输出500个Token的项目groq,这速度确实离谱,每秒485Token。视频没有加速。#ai#

你可以在这里尝试:groq.com 歸藏的AI工具箱的微博视频
Back to Top