关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
回到老家,部分亲友知道我在创业。很关心的一个问题是:效益怎么样。

突然发现,效益这个词,远远好过 PMF。效益直指内核:产品效果如何 + 公司收益如何。比云山雾罩的 PMF 好太多。

最后:要小心按他人定义或关心的指标去活,无论是日常生活,还是创业。
Fk9CrsLj9ALrsnZBuj50ei2tQpxIv3.jpg
438.9 KB
AI 的 IMO 2025 成绩这事已经进入叠加态了。

先是 MathArena(一个苏黎世的研究机构)发布了一个结果,说各大 AI 成绩都不怎么样,最好的 Gemini Pro 2.5 也只做出来三分之一。这个结果被广泛引用(了几天)。——这其实和我对 AI 能力的认知是相符的。

然后 OpenAI 搞了个大新闻,说他们的一个内部模型获得了 IMO 金牌。这个模型(他们自称为 IMO gold LLM)并不会向公众发布,只是内部试验用。

这条消息立刻引起很大争议。陶哲轩估计是被问烦了,在他自己的社交媒体上不冷不热地说:我不会就不公开方法的自我宣称金牌做出任何评论。

然后 DeepMind 宣布自己的模型 Gemini Deep Think 也获得了金牌(做出六道题中的前五道)。但为了和 OpenAI 区隔,DeepMind 特意强调,自己的结果得到了 IMO 主办方的官方认证。CEO Demis Hassabis 不忘阴阳怪气,在社交媒体上说:「我们没有在周五宣布,是因为我们尊重 IMO 委员会的原始要求,即所有 AI 实验室都应该在官方结果得到独立专家验证且学生们理应获得应有的赞誉之后才分享他们的结果。」——但他们用的也是没有公开的模型,所以陶哲轩也没有公开评论。

然后就在昨天,一篇新的报告出笼,宣称只用市面上公开的 Gemini Pro 2.5,配合上精心设计的 prompt pipeline(但不包含作弊性的提示),就能在 IMO 上拿到金牌。报告里详述了他们的做法。Google 对此尚未作出评论,我怀疑他们对此略有点尴尬(?)

说实话,上面这四条新闻里我最诧异的是最后一条。如果可复现,这意味着当下市面上的模型的潜力远远超出它们纸面上的能力。

但总之,现状是AI正好落在一个好像过线了又好像还没有的薛定谔状态里。看这个意思,至多明年肯定就过了。
早晨起来,意外发现 Qwen3 Coder 发布了。

Qwen3 Coder 一个具备 Agent 能力的代码模型。
这个模型在 Agentic Coding、Agentic Browser-Use 和 Agentic Tool-Use 上取得了开源模型的 SOTA。
简单说,代码和 Agent 能力,可以和 Claude Sonnet4 相媲美。

模型总参数量只有 480B,激活参数 35B。
模型原生支持 256k 并可通过 yarn 等方式扩展至 1M。
我用下来,这个模型的推理速度真的太快了,特别是习惯了 R1 和 K2 的慢速,你会感觉瞬间起飞。

模型实测和价格信息详见文章

https://mp.weixin.qq.com/s/feoAQV5qJoJ5xfZIEDinKw
Claude Code 的国产平替终于来了朋友们
早晨看到后立刻安装体验
配置简单,速度飞快,不会封号,爽起来了。

Qwen Code 虽然是基于 Gemini CLI 进行二次开发,但进行了 prompt 和工具调用协议适配 ,能最大程度激发 Qwen3-Coder 在 Agentic Coding 任务上的表现。

安装非常简单,详见公众号文章
https://mp.weixin.qq.com/s/feoAQV5qJoJ5xfZIEDinKw
Kimi 的深度研究
用来分析国内的政策变化影响
实在是比 GPT/Gemini 要有用的多
ChatGPT Plus 用户也开始推送 Agent 模式了#ai创造营#

想尝试的朋友可以看看你的账号是不是也有了
Vibe Coding 产品的时代变了朋友们

MiniMax Agent 获得大幅更新,现在支持前端和后端服务一起生产了

我一句话就搞定了一个完整的 AI 算命产品。

支持登录注册、两种算命方式、还能预约真人大师和购买会员,算的结果不要当真,图一乐就行

如果对 AI 算命感兴趣的话可以来试试,每个用户会有 3 次试用机会,3 次试用结束会要求登录。

另外支付逻辑是写好的,但是我没有申请自己的 Stripe 账户,所以会支付失败。

你可以在这里尝试天机神算:https://9f6jzycxnkop.space.minimax.io

下面是具体的创建过程介绍:

刚开始他很清楚自己不会算八字和六爻,所以非常谦虚的开始了学习,这要是其他类似的 Agent 估计就开始瞎编了。

八字这里他直接找了一个开源项目学习他的算法,六爻因为比较简单,本质是随机数,他就直接写了。

完成了核心算法之后,他开始最难的两部分了,如何存储用户信息以及如何加入支付逻辑和支付系统。

这时候数据库 MiniMax Agent 用的是常见的 Supabase ,但是整个数据库创建和连接过程及其优雅.

直接在新建页面登录账号后点击授权按钮,就结束了不需要你寻找各种 API 和翻看后台。

Stripe 也是类似,只需要你填写你的 Stripe API Token 就行,完全不需要跳出页面就可以搞定。

在做好左右准备之后他就直接开始设置数据库和构建对应的算法和项目了,这部分没什么好说的。

然后在完成项目之后他会主动进行代码测试和利用 Browser use 进行可视化测试,去点击每个网页的按钮查看实现效果和逻辑完整性。

最后的结果非常令人惊喜,他几乎一次性完成了所有主要的核心流程,包括八字和六爻的计算,试用逻辑、支付弹窗以及登录注册逻辑。

我刚开始测试的时候基本没有管真人预约这部分,我就没想他能做,结果没想到,他这都做好了,在填写完信息之后他会告诉你预约成功了,工作人员会跟你联系。
钱是最好的 A/B 测试:做投放管过上亿预算的人,对增长的感知完全不同。AI 也需要类似的“上亿元 token 学费”,没有大量token的实战经验,谈架构、产品设计往往会缺少一些关键的洞察。
谷歌也宣布自己得了 IMO 2025 的金牌#ai创造营#

他们这个是 IMO 委员会评估认证过的,没有像 Open AI 那样抢跑

委员会的评价是:“可以确认,Google DeepMind 达到了备受期待的里程碑,获得了 42 分中的 35 分——金牌分数。他们的解答在许多方面令人惊叹。IMO 评分员认为这些解答清晰、准确,大多数易于理解。”
Pika 也开始走 C 端路线了,上线了一个视频特效 APP#ai创造营##ai视频#

上传一张自拍照,AI 就能快速将其转化为各种风格的视频
选择任意音频,Pika 会让“AI 版的你”与之同步表演
以尝试不同发色、服装、场景和灯光,甚至改变周围环境
可以用自己的自拍和喜欢的片段进行混剪
只需输入主题,AI 就能帮你生成视频脚本
K2 的技术报告也发布了#ai创造营#

专家数量:384个专家,每次前向激活8个,提升了稀疏性和性能。

注意力机制:采用多头潜在注意力(MLA),隐藏维度7168,注意力头数64(相比同类模型减少一半,提升长文本推理效率)。

优化器:创新性地提出了MuonClip优化器,将高效的Muon算法与QK-Clip权重裁剪机制结合,解决了大规模训练中的不稳定问题,防止注意力logit爆炸。

数据处理:预训练数据覆盖Web文本、代码、数学和知识四大领域,采用合成重写(rephrasing)技术提升token利用率,尤其在知识和数学领域通过多样化重写增强泛化能力。

训练规模:预训练总计15.5万亿高质量token,采用4096-token上下文窗口,后期通过YaRN方法扩展到128k上下文。

稀疏性Scaling Law:实验表明,在激活参数数固定的情况下,增加专家总数(提升稀疏性)能显著降低训练和验证损失,提升模型表现。

推理优化:减少注意力头数,降低长文本推理的计算开销,提升实际应用效率。

硬件:基于NVIDIA H800 GPU集群,采用多级并行策略和高效的激活存储与重计算技术,保证大模型训练的可扩展性和稳定性。

这里查看:github.com/MoonshotAI/Kimi-K2/blob/main/tech_report.pdf
通义发布了 Qwen 3 235B 的升级版本 Qwen3-235B-A22B-2507

去掉了混合思维模式,将推理模型和非推理模型进行区分,看起来混合思维模式有些问题。#ai创造营#

虽然是小升级但是测试分数提升非常大,一会去试试。
王小川还不如去造机器人。
乐观估计,两年之内通用人工智能会降临。

谷歌拿下IMO金牌了,新模型用到了并行思维,离理想中的AGI越来越接近了。世界上聪明人真多啊
六小虎还剩仨
一家模型做的很好
一家Agent做的很好
一家产品做的很好
🚚✈️ 智能物流前线 · 机场作业实录 📦🤖
Back to Top