关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AI探索指南
论文,我认为就是写的比较专业的博客,它的格式非常八股,基本都是按照这样的结构来呈现的:标题 → 概要 → 导言 → 方法 → 实验 → 结论。 下文较长,主要提到了几个检索方法和阅读工具,强烈推荐下 PopAI, https://bit.ly/412xQbH,体验做的很不错。 很多朋友说论文读起来太晦涩且耗时,但事实上阅读论文是 ROI 比较高的一件事情,尤其是 AI 盛行的当下,大量科研人员都以论文的形式来呈现自己的研究成果,他们在写论文之前,会把行业最前沿的信息都研究个遍,然后自己动手实践,并提出…
这里推荐下 PopAI,https://bit.ly/412xQbH,最近看论文和读长篇 PDF 都用的非常多,它支持针对 arxiv 的论文转存后直接进行 AI Chat,省却了下载 PDF 文件的过程(如图二)。

第二类是精读工具,对大多数人来说,语言是第一阻碍,尤其是论文里铺天盖地的专业词汇,让人望而生畏;我用的比较多的是“沉浸式翻译”这个 Chrome 插件,它支持将 PDF 直接进行在线对照翻译,免费版的翻译质量有点一般,但也基本够用了(如图三)。

论文的实验结果基本都是以图表形式呈现的,因此精读的一个重要环节是读懂图表,这部分也可以借助 AI 的能力来理解得更透彻,PopAI 在这块做的也还不错,它背后接入了 GPT-4V 的 API,可以对论文里的图片进行详细解读,另外,还支持在聊天框内直接粘贴图片跟它交互,比较方便(如图四)。

如果论文正好是自己想要内容,还有一个非常实用的工具,叫做 Papers with code,paperswithcode.com,之前也推荐过,它可以根据论文帮你找到对应的 Github 代码实现,以及用到的数据集和测试方法,这也是我用的比较多的。

顺带提一嘴,涉及到 AI 的代码仓库,建议直接去 Google Colab 上跑,它的下载速度可以达到 200Mb/s,相比本地,会更加高效。

以上,是近几个月研究 AI 和论文的一点经验。如果你在学习过程中用到了其他好用的辅助工具或者方法,也欢迎推荐和分享!
论文,我认为就是写的比较专业的博客,它的格式非常八股,基本都是按照这样的结构来呈现的:标题 → 概要 → 导言 → 方法 → 实验 → 结论。

下文较长,主要提到了几个检索方法和阅读工具,强烈推荐下 PopAI, https://bit.ly/412xQbH,体验做的很不错。

很多朋友说论文读起来太晦涩且耗时,但事实上阅读论文是 ROI 比较高的一件事情,尤其是 AI 盛行的当下,大量科研人员都以论文的形式来呈现自己的研究成果,他们在写论文之前,会把行业最前沿的信息都研究个遍,然后自己动手实践,并提出更新、更好的解决方案。所以我认为学会读论文,以及挖掘对自己工作有帮助的论文是比较重要的一件事情。

检索论文,我的思路有两个。

一个是「有什么办法可以解决问题」,通过问题关键词去索引内容,例如检索“如何识别多人同时说话”,我找到了语音识别(ASR),然后找到了 Whisper,然后找到了《Robust Speech Recognition via Large-Scale Weak Supervision》这篇论文,过程中也找到了很多其他的论文。

另外一个是「为什么这个方法可以解决问题」,去研究技术背后的东西,例如检索“为什么 pyannote-audio 可以区分不同的人说话”,我找到了 Speaker Diarization,然后找到了《A Reinforcement Learning Framework for Online Speaker Diarization》这篇论文,从这篇论文又了解到了更多其他方法,回到思路一,继续研究。

检索工具上,之前推荐过 aminer.cn 这个网站,它有一个“必读论文”板块(如图一),放了很多精挑细选的专题模块,可能刚好跟你的研究方向是匹配的;但大部分情况下,你进到这个网站时,也不知道该搜什么关键词,所以刚开始还得去 Google 或社交媒体去检索行业先驱的博客或推文,去看看一些综述性的介绍,再去找更多更细节的关键词。

关于读论文,之前分享过一篇文章《如何阅读一篇论文》,它提到了“三遍阅读法”,我也是这么践行的;当然,也离不开工具上的辅助,主要包括两类。

第一类是 Summary 工具,如果每出一篇论文都去精读,那时间上肯定是不划算的,关键也没这个必要;Summary 的工具比较多,上面提到的 aminer 也自带了这个能力。
音乐生成软件Stable Audio最近更新了挺多东西的,越来越像一个正经工具而不是玩具了。

◆它现在可以根据你上传的音频来生成音乐。
◆更新了一系列详细的设置帮助控制生成的音乐内容比如种子、步数、提示强度等。
◆现在可以直接通过链接分享你生成的音乐。
◆还可以吧生成的音乐下载成视频。
◆还内置了提示词库帮助你书写提示词。

这里尝试:https://stableaudio.com/user-guide#model

Invalid media: video
🧧还有水,今天的红包可以领了,记得领用红包,水很大!!

阿里被赶超,年底放水冲业绩,红包很大,这次很持续!

支付宝!大放水!这次是真有水了!奖池刷新了,抓紧扫码!都是大红包🧧不要错过

支付宝无门槛红包,拼手气最高领99元!
使用之后就可以领新的。
【每天可领】
扫上面码,或⚡️👇点下面快速直达
https://b.btmcheck.com/s/Oz8jQ
图1是我在 2022.12.22 用 Midjourney 画的第一张图。一年过去了,图2是今天用完全相同的 prompt 的效果。图3-图6 是在 prompt 基础上增加了一些风格化的效果。

人间一年, AI 几年?
易用性有时候是值得损失部分准确性的

阅读 Ben Thompson 的文章 https://stratechery.com/2023/the-openai-keynote/,分析非常有意思,其中有一章节,论述为什么 OpenAI Dev Day 之后 ChatGPT 似乎淡化了 Plugin 的概念,而推出了新的产品交互形态,对比下前后两者的差别:
之前:用户如果需要使用某一插件(如PDF总结),必须搜索安装插件,并在对话前切换打开插件,然后对话;
之后:用户不再需要特意安装插件,直接点到侧边栏的 GPTs(为某一场景专门定制的GPT),对话即可;

这其中,虽然用户还是做了一次选择,但一开始插件就已经被集成到了 GPTs 中,这个整体操作和交互体验改变很大,它降低了用户的思考成本,只需要在合适的时候做一个简单的点击即可。

作者由此引出自己的观点:
1. 消费者关心事物的方式和你赋予他们的期望可能不同,他们优先考虑易用性,对于模块化解决方案的“接缝感”会表现出明显的不满(比如 ChatGPT 之前的 Plugin 使用方式就是一种模块化方案)。
2. 综合的解决方案最终能够获胜,因为没有什么是“足够好的”,综合的解决方案也许会有缺陷(比如 ChatGPT 有时欠缺准确性),但是,这种缺陷是可以接受的,易用性是值得损失部分准确性的。
3. 客户会说自己需要准确性和第三方工具,但是他们的行动会证明,方便和易用才是最重要的。

以上的观点启发很大,可见 OpenAI 正在从一家主要关注技术能力的公司,转变为同时关注产品能力和用户体验的公司。
一年前的今天,ChatGPT 上线发布。
Screenshot to Code 只需要一张截图,AI就能免费帮你快速把网页截图变成代码,非常神奇🐮

Github 霸榜第一,单日2500+ Star🌟

只需上传截图,就能轻松获得前端代码,包括HTML、Tailwind CSS 和 JavaScript,这极大地提高了开发效率和体验

该项目可借助 GPT-4 Vision 的能力,并利用 DALL-E 3 的图像生成能力,生成外观相似的图像

项目地址:https://github.com/abi/screenshot-to-code
Back to Top