关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
继上次不少媒体拿大模型做了高考数学题以后,今年的高考全科真题测评结果也出来了,不过这次进行测评的是字节Seed团队,很明显能看出,他们对上次豆包的高考数学成绩是充满意外和惊喜的,也在摩拳擦掌想试试看它在全科试题里会表现如何。
老规矩,这次参战的5个大模型,仍然是市面上各种跑分都名列前茅的选手:Gemini 2.5Pro、DeepSeek R1、Claude 4、OpenAI o3,以及Seed1.6-Thinking。
高考其实是一种非常典型的测试场景,既能达到测试大模型泛化能力的目的,同时又兼具很高的实用性,也不难想象类似的使用场景,应该可以在教学、科研等方面发挥更大价值。
这次做的是「山东版」高考全科试卷,分文理科排名,为了确保公平,不仅评测方式完全对齐高考判卷方法,开放题由两名有资深联考判卷经验的高中老师进行评估,而且大模型也没有引入任何提示词工程,所有输入都是高考原题。
简单来说,这跟一名真实考生做卷子的环境几乎没有区别。
还是先说结论,大模型的整体能力目前已经能拿到一个相当高的分数,其中位列文、理科头名的豆包和Gemini,分别拿到了文科683和理科655分的成绩——这分数甚至可以冲击一下清北——截取一些测评结果里的关键信息给你们看看:
- 不出意料的,大模型表现最好的学科是英语,几家测评成绩都很接近,难以拉开差距;
- 普遍得分最低的学科是化学和生物,不过这跟试题本身有关,这两个学科涉及到的读图题很多,由于这套试题不是官方发布,所以有些图比较模糊,直接造成了大模型的失分;
- 豆包在语文、英语、物理、地理、历史、政治六门学科里均拿到了最高分,其中文科类目里的地理、历史、政治优势明显,事实证明在不同语种的语境里,大模型的表现可能是天差地别的;
- 与豆包相反,Gemini的理科表现很强劲,哪怕在图不清楚的情况下,化学、生物仍然拿到了最高分,它与豆包的路线差别很有观察价值;
- 跟上次高考数学的测评结果略有差异,这次数学学科的榜首是DeepSeek,不过同样与其他大模型差距很小;
- GPT o3又开始整活,上次它是唯一一个在数学客观题上丢分的大模型,结果这次语文作文直接写跑题了,这导致o3的语文分数成了所有大模型语数英主科15份成绩里,唯一一个没有过百的...
- 在发现了化学、生物的读图问题后,测试团队找到了一份更高清版本的试卷,并且采用图文交织的方式把这两科重做了一遍,结果发现豆包通过这种方式,两科总分还能再提高30分左右,这就意味着图文同步的全模态推理,可以更大程度激发模型潜力,很值得深究;
- 目前看来,大模型的视觉方案进步神速,但毕竟视觉的TOKENS消耗要比普通任务高得多,所以它眼下要解决的主要问题,还是如何降本;
- 除了高考全科真题外,测试团队还进行了另一项印度理工学院JEE Advanced的考试测评,题目全部采用图片输入,总分仍然是Gemini和豆包领先,甚至两个模型的成绩,已经可以进到印度TOP 10了。
当然,大费周章做这么多测试,倒不是说它是测量大模型能力的唯一标准,比如今年年初AI行业知名的HLE基准刚出现的时候,各大主流模型的得分普遍低于10%,但HLE的开发团队也说了,按照历史规律来看,今年年底这个数字可能就会有50%。
我的意思是,无论人类如何绞尽脑汁让AI做题,把题目通关也都是假以时日的问题,但这不代表做题成绩就没有意义了,重要的是不断精进学习的过程,也是探索AI究竟能多大程度上为人类所用的必要步骤。
已经开始期待明年高考,AI会给我们一番怎样的景象了。
老规矩,这次参战的5个大模型,仍然是市面上各种跑分都名列前茅的选手:Gemini 2.5Pro、DeepSeek R1、Claude 4、OpenAI o3,以及Seed1.6-Thinking。
高考其实是一种非常典型的测试场景,既能达到测试大模型泛化能力的目的,同时又兼具很高的实用性,也不难想象类似的使用场景,应该可以在教学、科研等方面发挥更大价值。
这次做的是「山东版」高考全科试卷,分文理科排名,为了确保公平,不仅评测方式完全对齐高考判卷方法,开放题由两名有资深联考判卷经验的高中老师进行评估,而且大模型也没有引入任何提示词工程,所有输入都是高考原题。
简单来说,这跟一名真实考生做卷子的环境几乎没有区别。
还是先说结论,大模型的整体能力目前已经能拿到一个相当高的分数,其中位列文、理科头名的豆包和Gemini,分别拿到了文科683和理科655分的成绩——这分数甚至可以冲击一下清北——截取一些测评结果里的关键信息给你们看看:
- 不出意料的,大模型表现最好的学科是英语,几家测评成绩都很接近,难以拉开差距;
- 普遍得分最低的学科是化学和生物,不过这跟试题本身有关,这两个学科涉及到的读图题很多,由于这套试题不是官方发布,所以有些图比较模糊,直接造成了大模型的失分;
- 豆包在语文、英语、物理、地理、历史、政治六门学科里均拿到了最高分,其中文科类目里的地理、历史、政治优势明显,事实证明在不同语种的语境里,大模型的表现可能是天差地别的;
- 与豆包相反,Gemini的理科表现很强劲,哪怕在图不清楚的情况下,化学、生物仍然拿到了最高分,它与豆包的路线差别很有观察价值;
- 跟上次高考数学的测评结果略有差异,这次数学学科的榜首是DeepSeek,不过同样与其他大模型差距很小;
- GPT o3又开始整活,上次它是唯一一个在数学客观题上丢分的大模型,结果这次语文作文直接写跑题了,这导致o3的语文分数成了所有大模型语数英主科15份成绩里,唯一一个没有过百的...
- 在发现了化学、生物的读图问题后,测试团队找到了一份更高清版本的试卷,并且采用图文交织的方式把这两科重做了一遍,结果发现豆包通过这种方式,两科总分还能再提高30分左右,这就意味着图文同步的全模态推理,可以更大程度激发模型潜力,很值得深究;
- 目前看来,大模型的视觉方案进步神速,但毕竟视觉的TOKENS消耗要比普通任务高得多,所以它眼下要解决的主要问题,还是如何降本;
- 除了高考全科真题外,测试团队还进行了另一项印度理工学院JEE Advanced的考试测评,题目全部采用图片输入,总分仍然是Gemini和豆包领先,甚至两个模型的成绩,已经可以进到印度TOP 10了。
当然,大费周章做这么多测试,倒不是说它是测量大模型能力的唯一标准,比如今年年初AI行业知名的HLE基准刚出现的时候,各大主流模型的得分普遍低于10%,但HLE的开发团队也说了,按照历史规律来看,今年年底这个数字可能就会有50%。
我的意思是,无论人类如何绞尽脑汁让AI做题,把题目通关也都是假以时日的问题,但这不代表做题成绩就没有意义了,重要的是不断精进学习的过程,也是探索AI究竟能多大程度上为人类所用的必要步骤。
已经开始期待明年高考,AI会给我们一番怎样的景象了。
从简单记忆功能做起,逐步优化。
多Agent方案适用于可并行化任务,但需注意协调难题。
结论
上下文管理是构建健壮AI Agent的核心,需在性能、成本和准确性间平衡。
上下文工程是一门平衡的艺术,良好的语境和清晰表达需求是获得优质LLM输出的关键。
多Agent方案适用于可并行化任务,但需注意协调难题。
结论
上下文管理是构建健壮AI Agent的核心,需在性能、成本和准确性间平衡。
上下文工程是一门平衡的艺术,良好的语境和清晰表达需求是获得优质LLM输出的关键。
下方链接可在线玩,有安卓版!
https://blasin.itch.io/black-hole-gun
参加 TapTap 48 小时 gamejam 的作品,角色是搭档美术 Frank 自己整的,场景用 Vizcom 和 Tripo3D 等 AI 工具生成。
Anthropic 这个 Claude Artifacts 升级太牛皮了!
现在构建 AI 应用变得前所未有的简单
只要跟 Claude 说“帮我创建一个 AI 应用程序”,后面跟上提示词
就会帮你创建可以调用 Claude 的网页,而且其他人用的时候用的他们自己的账号额度
我用这个功能创建创建了一个分享图生成工具。
用的我原来那个 Bento Grid 风格 提示词。
现在每个人都可以用这个网页快速生成对应文案的分享图片了!
这里尝试,需要 Claude 账号:claude.ai/public/artifacts/f6cda2d3-2ff3-41ff-a8c1-3d19b8e18bb7
现在构建 AI 应用变得前所未有的简单
只要跟 Claude 说“帮我创建一个 AI 应用程序”,后面跟上提示词
就会帮你创建可以调用 Claude 的网页,而且其他人用的时候用的他们自己的账号额度
我用这个功能创建创建了一个分享图生成工具。
用的我原来那个 Bento Grid 风格 提示词。
现在每个人都可以用这个网页快速生成对应文案的分享图片了!
这里尝试,需要 Claude 账号:claude.ai/public/artifacts/f6cda2d3-2ff3-41ff-a8c1-3d19b8e18bb7
豆包Seed1.6-Thinking模型文科考了 683 分、立刻考了 648 分,理科跟 Gemini 并列第一。
今天山东公布了自己的高考录取分数线,基本可以稳定上 985 大学了,文科比 Gemini 还高很多,排名约在前80位左右,都可以考上清华北大了。
国内这一年的 LLM 发展还是相当快的,特别是在我们自有数据方面。
另外也说明随着 AI 的发展在知识水平和教育能力上超越普通的教师是很快就会发生的事情。
如果依然延续现在的应试教育体系,很快高分考生就会过剩。
古典产品经理,是通过调研、直觉来理解用户,做产品决策,满足用户需求。如果产品判断力不行,那就是在自嗨
字节产品经理,是用实验、数据来理解用户,做产品迭代。如果指标定错了,就越努力越错,或者没办法定出一个指标,那就不知道该怎么努力
AI 产品经理,是通过定义标准、测评,尽可能全面真实地反映用户对 AI 交付的结果的感受,来做 pipeline 优化和模型精调。如果标准定错了,产品优化方向就错了,如果测评不客观,那么就带来虚假的乐观
字节产品经理,是用实验、数据来理解用户,做产品迭代。如果指标定错了,就越努力越错,或者没办法定出一个指标,那就不知道该怎么努力
AI 产品经理,是通过定义标准、测评,尽可能全面真实地反映用户对 AI 交付的结果的感受,来做 pipeline 优化和模型精调。如果标准定错了,产品优化方向就错了,如果测评不客观,那么就带来虚假的乐观
Gemini 也发布了类似的 AI 编程产品 Gemini Cli - 开源命令行 AI 工具
而且个人谷歌账号登录就能免费用!
这里下载:https://github.com/google-gemini/gemini-cli/
免费额度为每分钟 60 次请求、每天 1000 次请求,是业内最高的免费额度,几乎不会遇到限制。
- 支持 Google 搜索实时联网,为模型提供外部上下文。
- 支持 MCP和扩展,便于功能拓展。
- 可自定义提示词和指令,适应个人或团队工作流。
- 可在脚本中非交互式调用,实现自动化和集成。