关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
如果RLHF训练不考虑有害性的话,模型的能力甚至会超过专业写作者。所以自己炼丹开源模型的效果是可以很快上升的,尽管有害的模型无法商用。
最近一周的强烈感受:

之前觉得AI产品虽然很高效,但是很容易同质化,做不出差异化也比较难有壁垒。

但是最近一周看到很多产品开始在AI的基础上做更深的更广的多样性探索,每个人每个公司的气质是不同的,对行业和用户的理解是不同的,能做出来的产品和切到的用户也是不同的。

产品经理依然大有可为
RT Tinyfool
最近去上海,跟多个朋友讲了我要用ChatGPT干什么。做一个客户端?像八爷那样,我没想过。做一堆插件,像很多朋友那样,我也不是很有兴趣。我第一步做的事情,大多数人可能还没想明白。… https://twitter.com/i/web/status/1644360358361174016
🧭 Midjourney 学习导航 | Learning Prompt

之前立了个 flag,500 star 就肝 Midjourney 教程,想不到那么快就达到了,刚看了下已经 2.5k 了。感谢各位的支持。今天,终于肝完 Midjourney 的教程了,这产品水太深了,而且还费钱😂 ,感觉起码生成了过千张图。肝完这个教程,要开始开发产品了。
确实扮演了,但到底说法风格还是那个语言模型味儿 🤣
☁️去了趟迪士尼
最近因为一个契机,我从头开始参与基础大模型的训练开发。亲身经历去实践这个过程令我兴奋,也让我学到很多。有一些心得体会可以分享:

1. 人们常说GPT模型学习了整个互联网的数据,听上去只要能够把整个互联网爬下来就可以了,这个说法并不准确。训练的原始数据的确是来自互联网(CommonCrawl和私域的内容),但是实际拿来训练用的只是其中的子集——一个精心挑选的高质量子集。Sam Altman和Lex Friedman的访谈中说过,他们在数据上的大部分努力是去筛选信息,而不是堆积信息。原始数据需要经过大量的筛选、去重、格式化的处理,这个过程耗时耗力,也往往被忽视,但却是至关重要的。

2. 随着模型的参数上到百亿甚至千亿,很多新的能力开始涌现,而很多工程上的麻烦也随之而来。为了应对如此庞大的数据和模型体量,系统里几乎每个角落都需要优化,从数据处理、切分、训练时的样本和机器分布、梯度下降的稳定性、存储等等,各个方面都需要对应做提升,避免成为短板。一个成功的大模型背后离不开几十上百个细节的工程优化。

3. 一个还不成熟、有待考验的心得:现在想要做一个LLM,你并不需要一支庞大的团队。你只需要不到10个有经验、有行动力、能够高效合作的工程师就可以了。Meta、OpenAI、HuggingFace等团队都为这个生态提供了非常实用的轮子,只要使用得当,就可以获得明显的助力。当然,人数上可以精简,GPU计算资源还是得管够。
本以为只是个标题党
没想到不是
认知局限了还出来教别人
可怕
Mac 连接 iPhone 热点非常不靠谱
用了半小时后无论怎么都连不上了
这辆从北京到北海的列车非常有趣,从郑州开始全都是没去过但想去的城市,还直观地显示了时间间隔,
小小一段Prompt ,开启 AI 创造的一道门

如果你不会编程, 也想要写点软件,使用这个小小的Prompt 会给你相当炫酷的启发:
它是一种将代码转换为格式精美的 markdown 部分的简单方法,其中包含用自然语言解释发生了什么的代码块。

效果见视频,Enjoy!

©️ Wrigley

Invalid media: video
这几天 iPhone 一到中午就没电了..
今天发现了罪魁祸首
它每天8点30才会充满
我每天6点就起床了
Apple 的机器学习行不行…
之前有个基于电影 HER 里 Samantha 的声线和ChatGPT API 的语音聊天机器人 http://myshell.ai
灵活的机械臂
“摇身”一变
成为你的专属按摩技师
来自CAPSIX机器人公司的「IYU」机器人
现在是一个敬业的「推拿按摩师」
帮久坐的人们缓解背部拉伤、精神疲劳🤖🤖

Invalid media: video
Back to Top