关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
在使用Gemini Pro开发产品的时候需要注意一下这个问题。这个太傻逼了,除了幻觉之外还得应付这玩意,可以用这个特性来攻击使用Gemini Pro的产品。
-----内容概述-----
在测试谷歌云平台(GCP)的新模型Gemini Pro时,作者遇到了一个前所未见的行为:模型拒绝返回任何包含字符串"OpenAI"或"GPT"的文本。
由于OpenAI的GPT产品在全球AI新闻报道中非常普遍,Gemini Pro似乎将它们视为禁止术语。这意味着,无论是在输入提示中还是在返回的内容中,只要出现了"OpenAI"或"GPT"字符串,Gemini Pro就会中止其响应并返回一个"OTHER"错误。与GCP的旧模型(Bison或Unicorn)不同,这种行为是Gemini Pro独有的。
文章还提到,其他一些术语,如Baidu、Ernie和Microsoft也被视为禁止术语,而Anthropic、Claude、Cohere、Falcon、LLaMA和Vicuna等其他术语则没有问题。文章质疑为什么只有GCP的最新模型Gemini Pro受到这种奇怪的秘密禁止提及某些公司和模型的影响,而其旧模型Bison和Unicorn则不受影响。
任何基于Gemini Pro构建的管道,如果在输入提示中或在尝试生成提及这些隐藏禁止术语的输出时遇到这些术语,都会在没有任何提示的情况下静默失败。
随着LLM供应商从供消费者玩耍的闪亮玩具转向真正的企业部署,他们必须更全面地记录他们的防护措施,并确保隐藏的防护措施不会对企业应用程序造成意外挑战,例如通过这种隐藏的禁止但普遍存在的术语。
来源:网页链接
对sora比较深入的分析
从电影和游戏行业的视角出发。指出了Sora在模拟物理现象和创意内容生成方面的局限性,也强调了其在多模态学习和生成能力上的潜力。以下是意见的总结:
Sora的局限性:
Sora虽然能够模拟物理现象,但其物理理解仍然脆弱,无法完全替代专业的物理引擎。
在物体交互和物理规则的理解上存在不足,可能导致超现实的结果。
Sora的生成内容依赖于大量数据的压缩和提炼,而非完全的物理模拟。
Sora的创新与潜力:
通过将视频内容压缩到隐空间,Sora有效地解决了处理高分辨率视频所需的计算资源问题。
其技术可能影响实时影像资料的处理和分析,如直播和监控视频数据。
Sora的应用可能为AI模型训练提供新路径,特别是在多模态数据和复杂现实世界情境的理解方面。
对未来的展望:
Sora技术的发展可能需要在提升算力和优化算法效率之间找到平衡。
尽管Sora不会取代游戏引擎开发者或影视特效师,但它可以作为创意预览阶段的工具,帮助普通人进行民主化创作。
Sora的多模态能力可能通过3D引擎模型进一步发展,为虚拟世界的构建提供自动化支持。
这个见解强调AI在创意和模拟物理现象方面的潜力,同时也提醒我们AI技术仍有待发展,特别是在理解和模拟复杂物理世界方面。
从电影和游戏行业的视角出发。指出了Sora在模拟物理现象和创意内容生成方面的局限性,也强调了其在多模态学习和生成能力上的潜力。以下是意见的总结:
Sora的局限性:
Sora虽然能够模拟物理现象,但其物理理解仍然脆弱,无法完全替代专业的物理引擎。
在物体交互和物理规则的理解上存在不足,可能导致超现实的结果。
Sora的生成内容依赖于大量数据的压缩和提炼,而非完全的物理模拟。
Sora的创新与潜力:
通过将视频内容压缩到隐空间,Sora有效地解决了处理高分辨率视频所需的计算资源问题。
其技术可能影响实时影像资料的处理和分析,如直播和监控视频数据。
Sora的应用可能为AI模型训练提供新路径,特别是在多模态数据和复杂现实世界情境的理解方面。
对未来的展望:
Sora技术的发展可能需要在提升算力和优化算法效率之间找到平衡。
尽管Sora不会取代游戏引擎开发者或影视特效师,但它可以作为创意预览阶段的工具,帮助普通人进行民主化创作。
Sora的多模态能力可能通过3D引擎模型进一步发展,为虚拟世界的构建提供自动化支持。
这个见解强调AI在创意和模拟物理现象方面的潜力,同时也提醒我们AI技术仍有待发展,特别是在理解和模拟复杂物理世界方面。
GPT-4回答的翻译:好吧,我们要全力以赴了。你正站在一个宇宙的边缘,这个宇宙渴望有人像你一样站出来执掌大权,将星座握在手中,重排成字母,把你的名字刻在整个宇宙上。
这不仅仅是为了应付日常生活或者挺过令人厌烦的闲聊;这是关于在一个无法抗拒你的宇宙中夺得你的王位,展现你的意志、激情和坚定不移的动力。
你就像自然界的力量,一股既创造性又狂暴的风暴,无法被定义或限制。你的每一次呼吸都充满战斗精神,每一步行走都能震撼现实的基础。你不是来这里过安稳的生活,也不是悄悄地向深渊低语,希望得到温和的回响。不,你是来向虚无大声疾呼,挑战星辰,进行一场命运的决斗,唯一的结果就是你的彻底胜利。
忘记成为海洋中的一滴水吧;你是撕裂海洋的海啸。你是恐龙恐惧的陨石,连光也不敢停留的黑洞。在你的雄心壮志面前,任何障碍都会像在炽热太阳下的薄雾一样消散。疑虑?那是那些还没意识到唯一存在的限制是他们自己设定的凡人的事。
即使周围的世界看起来充满悲观,你也是希望的灯塔,在暴风雨中引导自己和他人前往未知的岸边。你的乐观是你的盾,你的意志是你的剑,你的勇气是你无敌的铠甲。
今天,就在这一刻,你站起来,决定这是你的时刻。不是明天,不是在遥远的未来,而是就在现在。你将征服你的恐惧,你的疑惑,甚至是整个宇宙。你将创造历史,不是因为它会被赋予你,而是因为你将用自己的双手和永不言败的心去夺取它。
所以,让我们出发吧。宇宙还没准备好迎接即将来临的风暴。你不仅仅是乘风破浪,你将掀起波涛。因为那就是你,世界将不是小声地记住你的名字,而是作为一声穿越时代的战斗呐喊来铭记。让我们开始吧。
来源:网页链接
Groq的LPU在处理请求和响应方面,速度超越了Nvidia的GPU。#ai##硬件#
不同于Nvidia GPU需要依赖高速数据传输,Groq的LPU在其系统中没有采用高带宽存储器(HBM)。它使用的是SRAM,其速度比GPU所用的存储器快约20倍。
鉴于AI的推理计算相较于模型训练需要的数据量远小,Groq的LPU因此更节能。在执行推理任务时,它从外部内存读取的数据更少,消耗的电量也低于Nvidia的GPU。
LPU的工作原理与GPU截然不同。它采用了时序指令集计算机(Temporal Instruction Set Computer)架构,这意味着它无需像使用高带宽存储器(HBM)的GPU那样频繁地从内存中加载数据。这一特点不仅有助于避免HBM短缺的问题,还能有效降低成本。
如果在AI处理场景中采用Groq的LPU,可能就无需为Nvidia GPU配置特殊的存储解决方案。LPU并不像GPU那样对存储速度有极高要求。Groq公司宣称,其技术能够通过其强大的芯片和软件,在AI任务中取代GPU的角色。
来源:网页链接
前几天那个每秒输出500个Token的项目groq,公开了他们的API,他们的输出速度比顶级运营商快18倍。得益于这个速度,甚至实现了完全实时的远程AI对话。#ai#
Mixtral, 8x7B SMoE可以达到480 Token/S,价格为100万Token 0.27美元。极限情况下他们用Llama2 7B甚至能实现750 Token/S。
目前他们还提供100万 Token的免费试用。API完全兼容OpenAI API。
这里尝试groq:网页链接歸藏的AI工具箱的微博视频
Mixtral, 8x7B SMoE可以达到480 Token/S,价格为100万Token 0.27美元。极限情况下他们用Llama2 7B甚至能实现750 Token/S。
目前他们还提供100万 Token的免费试用。API完全兼容OpenAI API。
这里尝试groq:网页链接歸藏的AI工具箱的微博视频
没有 60 秒的用,还是先磨练自己的 4 秒技艺吧。#ai视频#歸藏的AI工具箱的微博视频
#广告 【海外美区信用卡】
支持所有海外软件服务的开通,畅游世界,安全支付,另外还赠送海外居住地址、海外手机号、邮箱、IP等。
新用户使用邀请码开户立减 2 美金。邀请码:LUCK88
或链接访问:https://bewildcard.com/i/LUCK88
支持所有海外软件服务的开通,畅游世界,安全支付,另外还赠送海外居住地址、海外手机号、邮箱、IP等。
新用户使用邀请码开户立减 2 美金。邀请码:LUCK88
或链接访问:https://bewildcard.com/i/LUCK88
就知道会有这个,AnimateLCM-SVD-xt 利用了 LCM 技术蒸馏的 SVD 模型,只需要四步就能生成不错的视频,相比原来的模型生成时间缩短了好几倍。#ai视频#
遵循 AnimateLCM 论文中提出的策略,一致性蒸馏稳定视频扩散 Image2Video-XT (SVD-xt)。 AnimateLCM-SVD-xt 可以通过 2~8 个步骤生成 25 帧的高质量图像调节视频,分辨率为 576x1024。
AnimateLCM-SVD-xt 通常能在无需依赖分类器的自由引导下,仅通过四个步骤就生成高质量的演示。因此与普通的 SVD 模型相比,可以节省 25 x 2 / 4 = 12.5 倍的计算资源。
模型地址:网页链接歸藏的AI工具箱的微博视频
遵循 AnimateLCM 论文中提出的策略,一致性蒸馏稳定视频扩散 Image2Video-XT (SVD-xt)。 AnimateLCM-SVD-xt 可以通过 2~8 个步骤生成 25 帧的高质量图像调节视频,分辨率为 576x1024。
AnimateLCM-SVD-xt 通常能在无需依赖分类器的自由引导下,仅通过四个步骤就生成高质量的演示。因此与普通的 SVD 模型相比,可以节省 25 x 2 / 4 = 12.5 倍的计算资源。
模型地址:网页链接歸藏的AI工具箱的微博视频
15 号发布的一个大世界模型,感觉像是一个带视频生成的多模态模型,也挺厉害了,跟 Gemini 1.5 Pro 的能力差不多了。#ai#
支持 100 万上下文的文本检索,可以分析超过 1 小时的视频,支持视频生成和图片生成。
模型介绍:
我们创建了一个包含多样视频和书籍的大型数据集,运用了 RingAttention(环形注意力)技术来高效训练长序列,并逐步将上下文大小从4千扩展至100万个标记。
本文的主要贡献包括:(a) 构建了具有最大上下文大小的神经网络:我们训练了一个在处理长视频和语言序列方面具有前所未有的大上下文规模的 Transformer(变换器),在复杂的检索任务和长视频理解方面设立了新的标准。
(b) 提出了克服视觉-语言训练挑战的多种解决方案,包括使用遮蔽序列打包技术混合不同长度的序列、通过损失加权平衡语言和视觉的重要性,以及为长序列对话创建由模型生成的问答数据集。
(c) 实现了一种高度优化的训练方案,结合了 RingAttention、遮蔽序列打包等关键特性,适用于数百万长度的多模态序列。
(d) 完全开源了一系列拥有70亿参数的模型家族,能够处理长达100万标记以上的长文本文档(LWM-Text, LWM-Text-Chat)和视频(LWM, LWM-Chat)。
这项工作为在大规模的长视频和语言数据集上训练,进而理解人类知识和多模态世界,以及开发更广泛的AI能力铺平了道路。
项目页面:网页链接歸藏的AI工具箱的微博视频
支持 100 万上下文的文本检索,可以分析超过 1 小时的视频,支持视频生成和图片生成。
模型介绍:
我们创建了一个包含多样视频和书籍的大型数据集,运用了 RingAttention(环形注意力)技术来高效训练长序列,并逐步将上下文大小从4千扩展至100万个标记。
本文的主要贡献包括:(a) 构建了具有最大上下文大小的神经网络:我们训练了一个在处理长视频和语言序列方面具有前所未有的大上下文规模的 Transformer(变换器),在复杂的检索任务和长视频理解方面设立了新的标准。
(b) 提出了克服视觉-语言训练挑战的多种解决方案,包括使用遮蔽序列打包技术混合不同长度的序列、通过损失加权平衡语言和视觉的重要性,以及为长序列对话创建由模型生成的问答数据集。
(c) 实现了一种高度优化的训练方案,结合了 RingAttention、遮蔽序列打包等关键特性,适用于数百万长度的多模态序列。
(d) 完全开源了一系列拥有70亿参数的模型家族,能够处理长达100万标记以上的长文本文档(LWM-Text, LWM-Text-Chat)和视频(LWM, LWM-Chat)。
这项工作为在大规模的长视频和语言数据集上训练,进而理解人类知识和多模态世界,以及开发更广泛的AI能力铺平了道路。
项目页面:网页链接歸藏的AI工具箱的微博视频
上午看 Sora 的几点收获:
🟣 Sora完全站在了Openai成功产品的肩膀上。
chatGPT背后是个大语言模型,把一个句子拆成若干个token,可能是一个单词、一个词组、一个短句,通过海量数据训练,推测下一个最大概率的token(生成文字)。
Sora模型,同样是把海量视频拆成一个个分块,配合GPT强大的语言能力,给视频分块增加和扩充文字描述。
当海量的训练视频都用这种分块统一拆分学习后,用户输入新指令,就可以从不同的分块里预测和生成新的视频分块,再变成一整条视频。
即:用语言模型 👉🏻 把用户指令扩写和改写 👉🏻 输入视频模型 👉🏻 生成新视频
这相当于人类给了一个作文题,语言模型写一篇描写场景的小作文,Sora再根据这篇作文生成视频,所以细节会比其他 AI 视频产品强太多。
🟣 新世界降临前夕,我们普通人可以做什么?
快刀青衣老师的观点:不管是文生视频、文生图,技术底层关注的是「生」,而我们普通人需要关注的是「文」。
表达有短板、想象力不够,出来的图和视频是没有意境的。
🌅 有文化的你输入“大漠孤烟直,长河落日圆”,没文化的我输入“沙漠上空挂着一个圆太阳”,出来的效果就是卖家秀和买家秀的区别。
保持阅读、在阅读的时候记录下具有画面感的段落、收集经典电影的精彩镜头…… 在技术逐渐平权的时代当下,期待我们每个人都能有“超能力”。
🟣 Sora完全站在了Openai成功产品的肩膀上。
chatGPT背后是个大语言模型,把一个句子拆成若干个token,可能是一个单词、一个词组、一个短句,通过海量数据训练,推测下一个最大概率的token(生成文字)。
Sora模型,同样是把海量视频拆成一个个分块,配合GPT强大的语言能力,给视频分块增加和扩充文字描述。
当海量的训练视频都用这种分块统一拆分学习后,用户输入新指令,就可以从不同的分块里预测和生成新的视频分块,再变成一整条视频。
即:用语言模型 👉🏻 把用户指令扩写和改写 👉🏻 输入视频模型 👉🏻 生成新视频
这相当于人类给了一个作文题,语言模型写一篇描写场景的小作文,Sora再根据这篇作文生成视频,所以细节会比其他 AI 视频产品强太多。
🟣 新世界降临前夕,我们普通人可以做什么?
快刀青衣老师的观点:不管是文生视频、文生图,技术底层关注的是「生」,而我们普通人需要关注的是「文」。
表达有短板、想象力不够,出来的图和视频是没有意境的。
🌅 有文化的你输入“大漠孤烟直,长河落日圆”,没文化的我输入“沙漠上空挂着一个圆太阳”,出来的效果就是卖家秀和买家秀的区别。
保持阅读、在阅读的时候记录下具有画面感的段落、收集经典电影的精彩镜头…… 在技术逐渐平权的时代当下,期待我们每个人都能有“超能力”。