关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
继续发一则和国内 model researcher 交流的 memo。今天和某模型厂的一位 post-train researcher 聊了聊。Ta 对「国内在 Pre-training 上更有优势、Post-training 相对落后」这件事,补充了一个视角:
国内基本已经「会做」Pre-training 了,但 Post-training 可能还处在一个比较混沌的阶段。
一个核心原因是,两者的 reward 清晰程度很不一样。
Pre-training 的反馈很明确,比如可能就是在单位时间内,把 Next Token Loss 降得越低越好,同时尽可能降低训练成本。
Post-training 要解决的,则是怎么让模型在下游应用中表现得更好。但怎么定义和评估这个「更好」,以及怎么确认模型是真的变强了、而不是在 hacking 某个指标,都非常 tricky。
此外,Pre-training 的创新也更容易被外界看到。
模型架构没有那么强的机密性,一开源大家就能看到,也可以写成 Paper、拿去做 PR。但一家模型公司的数据是怎么清洗的、具体用了什么训练 Recipe,通常不会拿出来讲。
再加上众所周知的缺卡问,而模型的绝对能力又是模型厂的生死线,大家自然会把更多资源投入反馈更明确、也更容易获得声量的 Pre-training。
Post-training 因此陷入了一个有点尴尬的循环:因为混沌,所以拿不到足够多的资源;又因为资源不够,这种混沌迟迟无法被解决。
除了这个,我们还聊到了几个挺有意思的点:
1/ 「大厂最终一定会赢」是一种偷懒的推论。
模型竞争不是比身价。拥有更多钱、卡和人,不等于一定能训出最好的模型。
在这位 researcher 看来,真正起决定性作用的,可能是组织里到底有多少人发自内心想把模型训好,以及组织摩擦会不会消耗掉这些人的热情。(没有说加入创业公司的人会更有梦想的意思。)
2/ Agent 确实已经在替代 AI Lab 里的一部分工作。(所以我们最近和一些 researchers 交流,感觉有些人确实已经有失业焦虑了。)
拿 Infra 举例,现在可以直接告诉 Agent:「每秒只能输出 50 个 Token,请优化到 60 个」,然后让它自己检查 Kernel 和整条链路。
所以一些 Infra 工程师开始自己给自己找事干,比如跑去研究算法、理解训练需求。
(从这里再往外延伸一步:如果说 AI Coding 模糊了产品、研发和设计之间的边界,那么 AI for AI / RSI 似乎也在逐渐模糊数据、算法和 Infra 之间的边界。
3/ Model Research 本身,可能就是最 Science 的 AI for Science。
我们还探讨了两个没有答案的问,也列在这里吧,欢迎有想法的朋友分享你的见解~
Q1/ 怎么让模型拥有时间概念?
这个之所以会是个问,是因为如果模型不交卷,它就可以一直保持「我没错」的状态。反正模型不老不死,所以从它自己的视角看,磨洋工可能并不是什么坏事。(GPT-5.6 一直写测试,是不是就是深刻践行了这一点啊 doge.jpg)
就像《葬送的芙莉莲》里,对于一个能活几千年的精灵来说,花十年寻找一枚戒指完全合理。
但我们这些凡胎肉体,根本等不起…(除非 AI 医疗让人类永生哈哈
Q2/ OpenAI 是怎么持续相信 RL 这个方向,并最终把 o1 做出来的?
我们好奇的不是具体的 Recipe,而是背后的组织问。
想起之前请清华大学叉院的助理教授
录过一期播客,他在节目里提到,OpenAI 很早就在做 RL,但之前做了很久都没有得到结果。
那么,在一个方向连续失败很多年以后,他们的团队为什么还能继续相信它,招到人、说服老板、拿到资源,然后真的把事情做出来呢🤔
这个问可能需要更了解 OpenAI 的朋友来回答了。
最后,其实跟很多 researchers 交流,尤其是问他们觉得哪家模型更有希望时,大家最后都会强调组织文化。
在一个快速变化、资源永远不够的行业里,怎么把人和算力分给那些还没有答案的创新,以及愿意等这些创新多久,可能和技术判断本身一样重要吧。
@aigc1024
国内基本已经「会做」Pre-training 了,但 Post-training 可能还处在一个比较混沌的阶段。
一个核心原因是,两者的 reward 清晰程度很不一样。
Pre-training 的反馈很明确,比如可能就是在单位时间内,把 Next Token Loss 降得越低越好,同时尽可能降低训练成本。
Post-training 要解决的,则是怎么让模型在下游应用中表现得更好。但怎么定义和评估这个「更好」,以及怎么确认模型是真的变强了、而不是在 hacking 某个指标,都非常 tricky。
此外,Pre-training 的创新也更容易被外界看到。
模型架构没有那么强的机密性,一开源大家就能看到,也可以写成 Paper、拿去做 PR。但一家模型公司的数据是怎么清洗的、具体用了什么训练 Recipe,通常不会拿出来讲。
再加上众所周知的缺卡问,而模型的绝对能力又是模型厂的生死线,大家自然会把更多资源投入反馈更明确、也更容易获得声量的 Pre-training。
Post-training 因此陷入了一个有点尴尬的循环:因为混沌,所以拿不到足够多的资源;又因为资源不够,这种混沌迟迟无法被解决。
除了这个,我们还聊到了几个挺有意思的点:
1/ 「大厂最终一定会赢」是一种偷懒的推论。
模型竞争不是比身价。拥有更多钱、卡和人,不等于一定能训出最好的模型。
在这位 researcher 看来,真正起决定性作用的,可能是组织里到底有多少人发自内心想把模型训好,以及组织摩擦会不会消耗掉这些人的热情。(没有说加入创业公司的人会更有梦想的意思。)
2/ Agent 确实已经在替代 AI Lab 里的一部分工作。(所以我们最近和一些 researchers 交流,感觉有些人确实已经有失业焦虑了。)
拿 Infra 举例,现在可以直接告诉 Agent:「每秒只能输出 50 个 Token,请优化到 60 个」,然后让它自己检查 Kernel 和整条链路。
所以一些 Infra 工程师开始自己给自己找事干,比如跑去研究算法、理解训练需求。
(从这里再往外延伸一步:如果说 AI Coding 模糊了产品、研发和设计之间的边界,那么 AI for AI / RSI 似乎也在逐渐模糊数据、算法和 Infra 之间的边界。
3/ Model Research 本身,可能就是最 Science 的 AI for Science。
我们还探讨了两个没有答案的问,也列在这里吧,欢迎有想法的朋友分享你的见解~
Q1/ 怎么让模型拥有时间概念?
这个之所以会是个问,是因为如果模型不交卷,它就可以一直保持「我没错」的状态。反正模型不老不死,所以从它自己的视角看,磨洋工可能并不是什么坏事。(GPT-5.6 一直写测试,是不是就是深刻践行了这一点啊 doge.jpg)
就像《葬送的芙莉莲》里,对于一个能活几千年的精灵来说,花十年寻找一枚戒指完全合理。
但我们这些凡胎肉体,根本等不起…(除非 AI 医疗让人类永生哈哈
Q2/ OpenAI 是怎么持续相信 RL 这个方向,并最终把 o1 做出来的?
我们好奇的不是具体的 Recipe,而是背后的组织问。
想起之前请清华大学叉院的助理教授
录过一期播客,他在节目里提到,OpenAI 很早就在做 RL,但之前做了很久都没有得到结果。
那么,在一个方向连续失败很多年以后,他们的团队为什么还能继续相信它,招到人、说服老板、拿到资源,然后真的把事情做出来呢🤔
这个问可能需要更了解 OpenAI 的朋友来回答了。
最后,其实跟很多 researchers 交流,尤其是问他们觉得哪家模型更有希望时,大家最后都会强调组织文化。
在一个快速变化、资源永远不够的行业里,怎么把人和算力分给那些还没有答案的创新,以及愿意等这些创新多久,可能和技术判断本身一样重要吧。
@aigc1024
一个人,也能组建一支 7×24 小时在线的 AI 团队。
LobeHub 正在从 AI 聊天工具,升级成一套开源的 Agent 协作平台,目前 GitHub 已拿下 80.6k Star。
你可以创建不同分工的 Agent,让系统根据任务自动组队、并行执行和互相完善结果;还支持定时任务、项目空间、长期记忆,以及多模型统一调度。
它更像一个 AI 团队操作系统:你负责目标和决策,Agent 负责研究、写作、开发与交付,还能随使用不断积累对你的理解。
支持 Docker 私有部署。想把零散的 AI 工具,真正变成一套长期工作的执行系统,可以试试
AI探索 | Hermes/OpenClaw|优质资源|优质信息
LobeHub 正在从 AI 聊天工具,升级成一套开源的 Agent 协作平台,目前 GitHub 已拿下 80.6k Star。
你可以创建不同分工的 Agent,让系统根据任务自动组队、并行执行和互相完善结果;还支持定时任务、项目空间、长期记忆,以及多模型统一调度。
它更像一个 AI 团队操作系统:你负责目标和决策,Agent 负责研究、写作、开发与交付,还能随使用不断积累对你的理解。
支持 Docker 私有部署。想把零散的 AI 工具,真正变成一套长期工作的执行系统,可以试试
AI探索 | Hermes/OpenClaw|优质资源|优质信息
✨ Zuck :未来属于每一个人
这篇充满代表去中心化哲学的重磅好文,不仅有着代表着 Meta 理性乐观的开源精神,还提出大量真知灼见;对于安全和智能边界,甚至超越不少自诩以 AGI 为使命的团队。因为没有什么技术,比赋权个体的力量更有意义。
🔢 部分要点:
·超级智能最大的贡献,不是自动化,而是发明。
·每个人都会有一个真正懂你的个人 Agent,24/7 代表你工作。
·这个时代的决定性问是:谁能获得超级智能,我们又把它用向哪里?
·没有任何定律规定,AI 的自动化速度一定会超过人的能力增长。
·安全的基础,是权力平衡。不存在一个唯一而仁慈的超级智能。
🔗 原文链接: https://www.meta.com/thefutureisforeveryone/
@aigc1024
这篇充满代表去中心化哲学的重磅好文,不仅有着代表着 Meta 理性乐观的开源精神,还提出大量真知灼见;对于安全和智能边界,甚至超越不少自诩以 AGI 为使命的团队。因为没有什么技术,比赋权个体的力量更有意义。
🔢 部分要点:
·超级智能最大的贡献,不是自动化,而是发明。
·每个人都会有一个真正懂你的个人 Agent,24/7 代表你工作。
·这个时代的决定性问是:谁能获得超级智能,我们又把它用向哪里?
·没有任何定律规定,AI 的自动化速度一定会超过人的能力增长。
·安全的基础,是权力平衡。不存在一个唯一而仁慈的超级智能。
🔗 原文链接: https://www.meta.com/thefutureisforeveryone/
@aigc1024
Bitwize 出品的 macOS 原生应用,把实时录音转文字、说人分离、会议纪要和写作编辑器都集成在一个本地 App 里。AI 推理用 MLX 框架,跑在 Apple Silicon 上,默认不联网,数据用 AES-256-GCM 加密存本地。
https://github.com/bitwize-ai/Logue
AI探索 | Hermes/OpenClaw|优质资源|优质信息
Stanford CS329A 这门 Self-Improving AI Agents 公开课,把 test-time compute、verifier、工具调用、代码、记忆、多步规划和 agentic evaluation 放进了同一套课程里。
我感觉这比零散追框架名词更适合补体系。做 Agent 很容易只盯 demo 和工具名,但这门课一直在讲模型怎么从反馈、验证和失败轨迹里继续变好,这个视角挺值得看。
相关链接:https://cs329a.stanford.edu/
@aigc1024
我感觉这比零散追框架名词更适合补体系。做 Agent 很容易只盯 demo 和工具名,但这门课一直在讲模型怎么从反馈、验证和失败轨迹里继续变好,这个视角挺值得看。
相关链接:https://cs329a.stanford.edu/
@aigc1024