关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AI 新知: 像大脑一样学习的多模态(极简版起源故事)

近日,微软放出了多模态大语言模型的重要论文《Language Is Not All You Need 》。预示着今年AI 的下一个重大突破。
那么,什么是多模态学习, 有没有一种人人皆可理解的方式,让更多人参与着技术民主化的浪潮呢? 答案是乐观和肯定的。

以下内容来自Jeff Dean 去年在TED 做的分享,面向所有人。无需担心技术理解力,更依赖你对大脑本身的好奇心。
原始链接🔗https://youtu.be/J-FzHIQ7SOs

Jeff Dean 二十多年前加入谷歌,领导着谷歌的人工智能研究与健康部门。

核心内容摘要如下:
(这是我的几点解读,供非专业人士参考)
🧠 神经网络的机器学习突破是来自科学界对大脑的运作规律的理解(它是自下而上的)
🧮 算力是重要且有效的,深度学习突破了识别猫咪、机器翻译到 AlphaGO 等单一任务
🙉 AI的单一任务导向的训练是极为低效的,可以请想象成我们从小失去听觉、嗅觉、味觉(去观看电影的感受)
👂 多模态的思想,是进一步模拟大脑运作,就像生物拥有多种感觉来整合认知世界
🎸像大脑一样多个区域进行超高效率的协作,是学习真正的「奥义」;AI的多模态即对大脑深度的模仿。

部分讲稿如下(适当删减,以便于文字阅读):

1/ 人工智能可以做什么?
在过去的十年间,AI 在帮助计算机识别物体、 理解语言和谈话方面 取得的巨大进步。 以往的天方夜谭 现在一一成为现实。计算机视觉来说, 在过去的十年中,电脑快速地发展出了‘看’的能力 。这在计算机运用上 具有变革性的影响。 还有一些了不起的实际应用。 可以通过机器学习预测洪水、翻译一百多种语言、预测和诊断疾病。

2/ 让我们来看看构成当代人工智能系统 基础的两个关键元素。 首先是神经网络,它是解决这些难题的一项重大突破。 第二个是运算能力。 驱动神经网络运作实际需要大量的运算能力, 在过去的十五年, 我们做到了使其减半,那也是整个人工智能得以发展至此的原因之一。Jeff Dean 认为我们做错了几件事~

3/ AI 小历史。 数十年前几乎从计算机科学最早出现, 人们就想建造可以识别语言及理解谈话的电脑。最初的方法一般是人们手动写下完成难题所需的算法, 但成效一般。 过去的十五年间, 一个方法出其不意地 一次性解决了所有难题: 神经网络。 神经网络并非一个新想法。 背后的理念出现于1960和70年代。 神经网络如同其字面意思一样, 是一连串互相连接的神经元。 它们大致上效仿了人体真正神经元的特性。

4/ 神经网络如何计算? 这种系统中的一个独立神经元, 拥有一组输入信息,每组输入信息有对应的比重,神经元的信息输出就等于那些输入信息乘以它们对应的比重。 其实挺简单的, 无数神经元协同运作,就可以学习复杂的东西。 我们如何在神经网络中学习的? 其实,在学习过程中, 比重在不断被微调, 增强一些东西的影响,削弱其他的影响。

5/ Jeff Dean对神经网络的兴趣, 始于1990年本科阶段时学到的一门相关课程。 那时,神经网络在精细问题的解决上取得了惊人的成果, 但还达不到完成真实世界中重要工作的程度。 他觉得我们可能只是需要更强的运算能力。 明尼苏达大学当时有一个32位处理器。Jeff Dean想:“如果有更强的运算能力, 我们真能用神经网络干点大事。” 所以决定以神经网络的并行训练 作为毕业论文的课题,理念是将电脑或电脑系统中 所有的处理器 运用到同一件任务上,用来训练神经网络。 32位处理器,哇, 我们肯定能用它做点大事。 但我错了。

6/ Jeff Dean 意识到如果想用神经网络做些引人注目的事情, 所需的算力大概是 90年代算力的一百万倍。但从大概2005年开始,多亏了摩尔定律, 我们真的开始拥有算力了,世界上一些大学里的研究员们开始成功用神经网络完成各种任务。和其他几个在谷歌的同事听闻了这些成功事例, 于是决定启动一个项目,训练大型神经网络。

7/ 用油管视频里随机截取的一千万帧照片对其进行训练。 这个系统发展出了能够识别所有不同种类物体的能力,然后因为是油管的关系, 所以它发展出了识别猫的能力。油管上全是猫。 😻 但让它如此引人注目的是从未有人告诉过这个系统猫到底是什么。 仅仅依靠数据的形态规律, 它就能自己琢磨出来猫究竟是什么。

8/ 在那个时候, 我们还对如何打造一个更适合神经网络运算所需的计算机硬件感兴趣。 神经网络运算有两个特性。 第一个是它们对精准度要求很低。 几个有效位就够了, 不需要六七个那么多。 第二个是所有算法都普遍由多个 不同的矩阵和向量的运算组成。 它会非常适用于神经网络运算, 虽然你无法用它做太多别的事,这是我们制作的第一个成品,TPU v1。 “TPU”是张量处理器的意思。 多年来,这一技术运用于谷歌搜索、翻译、以及AlphaGo围棋比赛, 所以李世石和柯洁可能没意识到,他们其实是在和TPU架构比赛。

9/ 我们仍然做错了很多事, 讲三件我们做错的事情, 以及如何修正他们。 第一个是,现如今的大部分神经网络 只被训练进行单一种类的任务。 你训练它去做一件你很关心的事情, 但这是一项非常繁重的工作。 你需要搜索数据组, 选择这个问题所需的网络架构, 接着随机分配起始比重, 然后为调整比重进行大量运算。 到最后,如果你幸运的话,可以得到一个非常适用于你关心的问题的模型。 但如果你一直这样做, 到最后会得到几千个独立的模型,每个可能都很有用,但都只针对某个单一类型的问题。

10/ 想一想人类是怎样学习的。 想象我们沉浸于钻研园艺, 尝试垂直水培园艺。 无需为此重新学习一遍,我已经掌握的有关植物的知识。 知道怎么把植物放进洞里,怎么浇水,以及植物需要光照, 我只需要整合这些知识用以学习新的技术。 (大脑整合了不同维度的知识和模型)

11/ 电脑也可以这样运作,但目前还未实现。为了避免每次学习新东西时忘记之前的知识,我们可以训练一个多任务处理模型,该模型的每个部分都有自己的专长,能够完成成千上万种不同的任务。假设我们有一个能完成一千种任务的模型,当第一千零一种任务出现时,我们可以整合已有的和新任务相关的知识,更快地完成这项新任务。就像你面临新的问题时,能够快速识别已知并能够帮助解决这些新问题的知识一样。

12/ 第二个问题是, 大部分现今的模型只能应对一种形态的数据, 图片、文字或语音, 但无法做到一网打尽。 但想一想人类如何在这世上生活。 你不断地动用你所有的感官去学习,去做出反应, 去搞清楚现在应该做什么。 这样显然更加合理, 我们也可以用同样的方式建造模型。

13/ 我们可以建造一个可以接收 所有不同种类数据的模型, 文字,图像,语音, 然后把它们融合在一起, 这样无论这个模型看到文字“豹子”, 看到豹子的视频,还是听到有人说出“豹子”这个词 它都会触发同样的反应: 一个豹子的概念 可以应对很多种不同的数据输入项, 甚至是非人工的输入项, 例如基因序列, 3D点云数据,当然也包括 图片、文字和影像。

14/ 第三个问题是现有人工智能模型过于稠密,这导致我们在执行某项任务时必须完全激活整个模型。与之相反,人脑的不同区块专注于不同的工作。我们可以制造一种激活反应较稀松的模型,训练时,模型可以学习哪个区块适用于哪个领域。此类模型高效,因为我们只使用完成任务所需的区块。解决这三个问题后,我们可以训练几个通用模型,能够应对成千上万件事情,并整合不同数据形态。我们已经制造了一种符合以上条件的模型,叫做“Pathways”。

15/ 我们的理念是这个模型可以完成成千上万种不同类型的任务, 然后我们可以逐步增加新的任务, 它也可以同时处理各种形态的数据, 然后逐步学习新技能, 并按需为不同任务启动不同区块。 我们对此感到非常兴奋, 我们认为这将是人工智能 系统建造迈出的重要一步。

16/ 浅谈一下什么是可信赖的AI。我们要确保强大的人工智能系统造福所有人,但也要考虑公平性、可解释性、私密性和安全性。为训练这些模型完成成千上万种任务,我们需要大量数据,并确保数据的采集代表不同的社群和情况。数据担忧只是可靠人工智能这个议题的一部分。2018年,谷歌发表了开发此类科技时应注意的人工智能守则。

17/ 这帮助指导了我们在研究领域和产品中使用人工智能。这对于思考复杂问题和在社会中应用人工智能非常有帮助和重要。我们不断更新这些准则,它们是现在研究的热点领域。从只能识别数据中的模式到通用智能系统,它们赋予我们解决人类面临的重大问题的能力。例如,我们可以诊断更多疾病,设计出更好的药品,优化教育系统,解决全球变暖等复杂问题。这些系统需要来自世界各地的多学科专家共同协作。

18/ 将人工智能和你所在的领域相结合, 从而推动产业的进程。 我看到了许多计算机科学的优势, 以及在过去的几十年中计算机科学 如何帮助几百万人更好地理解世界。 今天的人工智能拥有帮助数十亿人的潜力。

我们真的生活在一个振奋人心的时代。 谢谢。

Invalid media: video
为什么说现在还是Generative AI的黑莓时刻而还没到iPhone时刻?黑莓是把有限的技术进行优化整合,提供了让一个细分领域的Early Adopter足够激动的体验。而iPhone是在技术进一步成熟之后在更加广泛的需求上给Early Majority提供了又激动又好用的体验。

在历史上类似黑莓时刻的产品有Netscape Navigator,Wolfenstein 3D,Bitcoin等等。它们最重要的是打开世界对未来的想象力。
是 gpt-3.5-turbo API + Whisper API,两个API的同时发布,每个人都会有一个贾维斯。倒不是一种悲观,国内说要搞类ChatGPT的厂商,近几年是追不上的,或者这条赛道应该彻底打不过了。因为ChatGPT本身的迭代速度一定是很快速的,产品经理和开发者应该第一时间涌入ChatGPT API的各种开发者社区。

gpt-3.5-turbo API + Whisper API将彻底改变互联网产品的用户体验与产品设计,这意味着对业务流程与商业模式的重构,意味着中小开发者掌握了新世界的力量具备了向大厂发起降维打击的能力,新的市场逻辑已出现。

不要相信国内任何搞类ChatGPT产品的大厂,国内大厂从来就没有开发者生态的基因,而ChatGPT作用一种API接口能够形成一种覆盖全球范围的智能网络时,大厂封闭的生态与闭塞的数据,无法与全球智能网络形成对抗,ChatGPT将涌现创造力惊人的开发者生态,由此所构建的全球数据模型与全球数据网络,国内没有任何一个大厂能够为之匹敌。

ChatGPT API将基于全球互联网而涌现一个庞大的全球智能网络,你的AI助理能够访问各种AIGC模型,进而可以交流对话整个智能网络中的其他智能单元,这一次堪比2000年的互联网,堪比2009年的比特币。
今早的劲爆消息:ChatGPT 的 API 来了!

人人可用!接入门槛很低! 而这价格、这访问速度,太震撼了~
这无声的发布会, 会倒逼成千上万开发者、创作者疯狂涌入。

稍微对比思考了一番:
这已经不是 iOS +硬件缓慢迭代的时代了,新的创作者们会将App 这种载体视为一种高门槛、过去式的存在;而往日中心化流量的消逝,也许会带来更多生态的公平性。

一切都在暗涌之中,商业的演化之手开始自组织起来。少许人会谋定而后动,更多人加入这疯狂变革的浪潮,边探索边碰运气,新物种很快会层出不穷。
珊瑚礁横空出世了,生物的多样性和日新月异的景观,还会远吗,令人无比期待~

正如 Naval 说的, 「技术的民主化使任何人都可以成为创造者、企业家、科学家。未来更加光明。」
你的AI女友再次上线🥳
没有代码能力想试一下新的ChatGPT接口的可以来这里,每次限制五条对话,够用了。也可以复制他的代码把key改成自己的。https://huggingface.co/spaces/anzorq/chatgpt-demo
【BiliGPT】AI 自动总结 B站 视频内容,GPT-3 智能提取并总结字幕_哔哩哔哩_bilibili

【BiliGPT】AI 自动总结 B站 视频内容

1. 输入视频地址
2. 使用 GPT-3.5 智能提取&总结字幕 #OpenAI

两种快捷用法:
1. 将 http://bilibili.com 改成 http://bilibili.jimmylv.cn 快速跳转
2. 支持 iOS 快捷指令,通过分享菜单「一键总结」

🔗 http://b.jimmylv.cn
几行代码能够改变物理世界吗?

近日出行,注意到高铁站为网约车修建了专门的通道,景区或广场上都能见到拿着抖音直播的人们。更别提路上的外卖骑手了。

而这只是一阶的、肉眼可见的变化。人们的出行模式、生活方式,甚至人类选举和战争的法则,都被深刻改变。

自iPhone诞生至今十六年,世界的模样已大不相同。

ChatGPT开放API,比iPhone问世更值得惊叹。所有人类个体、组织以及人类文明的能力边界在骤然间扩张。

浪潮变为海啸。

iPhone不是一部手机,而是一个开发者平台。而这样的平台依然有着较高的门槛,开发者不得不在App Store里从轮子开始建造应用。ChatGPT的API提供了新的可能性——在更有通用性的人工智能平台上迅速迭代。

更重要的是,后者是一个正反馈循环——越多的调用,带来越强的能力和越低的成本。不断往复。

怀特海曾言,“文明的进步,就是人们在不假思索中可以做的事情越来越多。” ChatGPT的能力,将无声的浸润文明的底层,就像此刻我将思想通过5G信号跨越时空呈现在你的眼前。
openai这个价格,现有的app都值得被重写。
一个生产力工具
效果变得更好
速度提高5倍
价格便宜10倍
这几件事在同一天发生
整个世界将为之改变
ChatGPT 的 API 厉害的
RT yihong0618
做的过程中感叹,大部分我们熟悉的规则都变了,核心不到 50 行代码,就可以实现一个拍脑袋的想法。

yihong0618: 卧槽,我直接上了昨晚发布的 ChatGPT api...速度比 gpt-3 的 api 快了 5 倍不止,还更准确,消耗 token 更少。
DeepL 现在感觉没必要做了,优化也放到后面,一会儿写完就开源,xiaogpt 一会儿也会用上 api,可以直接流畅的和小爱对话了。。。
https://twitter.com/yihong0618/status/1630948132564631552
RT Jeff Li
马斯克这个鸟人🐦
不止于此,你的语言风格在一定程度上会影响AI的语言风格。

fox hsiao: 你爲什麼要對 ChatGPT 有禮貌?
实现同样水平的 Code 效果,开源模型需要生成100次,ChatGPT只需要生成1次。

Aman Sanger: There are times and places for training your own models... With the release OpenAI's chatGPT API - coding is looking less like one of them.

The human-eval pass@1 rate of ChatGPT is as good as the best Open Source model's pass@100 rate.

And this is still just GPT 3.5...
Whisper 也有 API 了,每分钟4分钱人民币,也很便宜,语音转文本,方便后续做翻译/总结等处理。
这几天在忙一个大的!或许是中文世界第一部AIGC连载漫画!已登录腾讯动漫!https://ac.qq.com/Comic/ComicInfo/id/653772
我是如何用 ChatGPT 打造出一套简易推荐系统的 - 少数派

在 chatGPT 的帮助下,给「写点啥」开发了个简易的推荐系统,这两天看了下数据,写的用户明显多了,真的是生产力工具!
AI探索指南
《 为什么 AI聊天机器人会说谎并表现得很奇怪?照照镜子。》 文章来自 Cade Metz ,他是nytimes 的资深记者,长期追踪人工智能和自动驾驶,也是《深度学习革命》的作者 原文地址: https://www.nytimes.com/2023/02/26/technology/ai-chatbot-information-truth.html 📇 摘要和预览: - 核心观点之一:AI 的言论和行为反映了人类的偏见、欲望和恐惧,而不是客观的真相或理性。 - 文章以New Bing为例,分析了…
- New Bing 似乎为了减少了最奇怪的行为,它限制了与Bing聊天机器人的讨论时间。这就像从汽车的测试驾驶员那里学到,太快太久会烧毁发动机。微软(OpenAI)和谷歌也在探索控制机器行为的方法。

- 这里有一个核心事实和警告: 由于AI 正在从众多的材料中学习将它们组合在一起,有关的研究者和制造者并不完全清楚ChatBot是如何产生最终结果的。他们也需要观察机器的行为,并学习限制这种行为。注意:通常是在它发生之后。
- 而微软(OpenAI)已经决定: 他们要想知道聊天机器人在现实世界中会做什么,唯一的办法就是让它们放任自流——当它们偏离时再把它们拉回来。他们相信,他们的大型公共实验值得冒险。

- Sejnowski 教授将 New Bing的行为与艾瑞泽之镜进行了比较,艾瑞泽之镜(Mirrow of Erized )是J.K.罗琳的《哈利波特》小说和基于她创造性的年轻巫师世界的一件神秘文物。
- "Erised "是 "欲望 "的逆向拼写。当人们发现这面镜子时,它似乎提供了真理和理解,但事实并非如此。它显示了任何盯着它看的人根深蒂固的欲望,有些人如果凝视的太久就会发疯。
- Sejnowski 教授解释道, "因为人类和L.L.M都在相互映照,随着时间的推移,他们将趋向于一个共同的概念状态。"

🦜 复杂性带来的未知困境

- 圣达菲研究所的人工智能研究员梅兰妮·米切尔(Melanie Mitchell),也表达类似的看法: 这些系统是人性的反映, 但这并不是聊天机器人产生有问题语言的唯一原因。
- 作为复杂科学领域专家梅兰妮·米切尔强调: 当它们生成文本时,这些系统不会逐字逐句地重复互联网上的内容。它们通过结合数十亿的模式,自己产生新的文本:

- 即使研究人员只用同行评议的科学文献来训练这些系统,它们仍然可能产生科学上荒谬的声明。即使他们只从真实的文本中学习,他们仍然可能产生不真实的内容;即使他们只从健康的文本中学习,他们仍然可能产生令人毛骨悚然的东西。
- "没有什么可以阻止它们这样做,它们只是试图产生一些听起来像人类语言的东西。"

- Sejnowski 博士相信从长远来看,新的ChatBot 有能力让人们更有效率,并提供更好、更快地完成工作的方法。但这对构建AI的公司和使用它们的人都发出了警告:它们也可以引导我们远离真相,进入一些黑暗的地方。

「这是未知领域,人类以前从未经历过这种情况。」
《 为什么 AI聊天机器人会说谎并表现得很奇怪?照照镜子。》

文章来自 Cade Metz ,他是nytimes 的资深记者,长期追踪人工智能和自动驾驶,也是《深度学习革命》的作者

原文地址: https://www.nytimes.com/2023/02/26/technology/ai-chatbot-information-truth.html

📇 摘要和预览:

- 核心观点之一:AI 的言论和行为反映了人类的偏见、欲望和恐惧,而不是客观的真相或理性。
- 文章以New Bing为例,分析了它为什么会说谎、胡言乱语或者散播错误信息。 这些现象并不是技术缺陷或恶意操纵的结果,而是因为AI 学习了人类在互联网上的行为模式,包括撒谎、夸张、模仿和娱乐等。 L.L.M. (大型语言模型)的复杂性使其难以剖析,Cade Metz邀请了多领域专业人士来站在科学、非商业的立场来讨论它。
- 神经科学家 Sejnowski 教授提出了一个精彩的隐喻: 将AI 的复杂性(不可解释性)和哈利波特中的神器 Mirror of Erised(艾瑞泽之镜)进行对比思考。
- 圣达菲研究所的科学家梅兰妮·米切尔也反复告诫大家,这些机器说话持续失控的根本原因在哪里。

🪞 镜子隐喻

- 索尔克生物研究所和加州大学圣地亚哥分校神经科学家、心理学家和计算机科学家 Terry Sejnowski 认为,像任何其他学生一样,AI 可以从不良来源学习不良信息, 这一部分代表了 ChatBot 对使用它的人的话语和意图的扭曲反映。

- L.L.M 这些系统通过分析从互联网上挑选的大量文本来学习,其中包括大量不真实、有偏见和其他有毒的材料。深度学习的文本也会过时,因为它们必须花费数月时间进行分析才能让公众使用。

- 无论它的输入文本是好的,还是和坏信息时,L.L.M.学会做一件特定的事情:[猜测一系列单词中的下一个单词] 。 如果给定序列“汤姆克鲁斯是____”,它可能会猜测“演员”。

- 对话时间越长,用户在不知不觉中对ChatGPT 所说内容的影响就越大。如果你想让它生气,它就会生气,Sejnowski 教授说,如果你哄骗它变得令人毛骨悚然,它就会变得令人毛骨悚然。
Back to Top