关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
1. 人们常说GPT模型学习了整个互联网的数据,听上去只要能够把整个互联网爬下来就可以了,这个说法并不准确。训练的原始数据的确是来自互联网(CommonCrawl和私域的内容),但是实际拿来训练用的只是其中的子集——一个精心挑选的高质量子集。Sam Altman和Lex Friedman的访谈中说过,他们在数据上的大部分努力是去筛选信息,而不是堆积信息。原始数据需要经过大量的筛选、去重、格式化的处理,这个过程耗时耗力,也往往被忽视,但却是至关重要的。
2. 随着模型的参数上到百亿甚至千亿,很多新的能力开始涌现,而很多工程上的麻烦也随之而来。为了应对如此庞大的数据和模型体量,系统里几乎每个角落都需要优化,从数据处理、切分、训练时的样本和机器分布、梯度下降的稳定性、存储等等,各个方面都需要对应做提升,避免成为短板。一个成功的大模型背后离不开几十上百个细节的工程优化。
3. 一个还不成熟、有待考验的心得:现在想要做一个LLM,你并不需要一支庞大的团队。你只需要不到10个有经验、有行动力、能够高效合作的工程师就可以了。Meta、OpenAI、HuggingFace等团队都为这个生态提供了非常实用的轮子,只要使用得当,就可以获得明显的助力。当然,人数上可以精简,GPU计算资源还是得管够。
小小一段Prompt ,开启 AI 创造的一道门
如果你不会编程, 也想要写点软件,使用这个小小的Prompt 会给你相当炫酷的启发:
它是一种将代码转换为格式精美的 markdown 部分的简单方法,其中包含用自然语言解释发生了什么的代码块。
效果见视频,Enjoy!
©️ Wrigley
Invalid media: video
如果你不会编程, 也想要写点软件,使用这个小小的Prompt 会给你相当炫酷的启发:
它是一种将代码转换为格式精美的 markdown 部分的简单方法,其中包含用自然语言解释发生了什么的代码块。
效果见视频,Enjoy!
©️ Wrigley
Invalid media: video
之前有个基于电影 HER 里 Samantha 的声线和ChatGPT API 的语音聊天机器人 http://myshell.ai
号称世界排名第一的 AI 检测器,逃避用 AI 写文章可能被抓到的工具。
工作原理:它会扰乱每个句子,并完全掩盖了任何文本(最多 5000 个单词),同时保留原意,直到所有 LLM 的痕迹都消失。
它结合使用了 NLP 技术,包括使用 GPT4 进行释义和谷歌 T5 模型的微调版本。
PS:这是写论文的利器
Web:https://gptzero.me/
工作原理:它会扰乱每个句子,并完全掩盖了任何文本(最多 5000 个单词),同时保留原意,直到所有 LLM 的痕迹都消失。
它结合使用了 NLP 技术,包括使用 GPT4 进行释义和谷歌 T5 模型的微调版本。
PS:这是写论文的利器
Web:https://gptzero.me/
关于 LLM 有没有逻辑和推理,其实就是个哲学问题,如果你看到了。你能说没有吗?如果这都不算,那标准应该是什么? https://www.xiaoyuzhoufm.com/episode/64244f5e8aca9099d7a5e51b
只要填入公司名称、类型、业务的关键词,在20秒内就能生成一个图像和内容跟关键词靠近的可编辑的网站。
还内置搜索引擎优化,确保在 Google 搜索中名列前茅。
PS:网站功能亲测可用,只是模板太少,应该会不断加多。
Web:https://butternut.ai/