关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
Open AI 也发布了 GPT-5 的官方提示词指南,更适合开发者参考#ai创造营#

具体包括:智能体任务与工具调用、推理与上下文复用、代码生成与协作、可控性与指令遵循、Markdown 格式化、元提示(Metaprompting)代码工具与环境说明

基本涉及了 AI 产品和 Agent 构建的各个方面,我总结了一下还是推荐看原文👇

智能体任务与工具调用

Agentic Workflow Predictability:推荐使用 Responses API 持续保存推理过程,提升智能体应用效率。

Agentic Eagerness:可通过调整 `reasoning_effort` 参数和提示词,控制模型的主动性。
降低主动性:使用低 `reasoning_effort`,明确探索范围和早停标准,减少不必要的工具调用和上下文收集。
提高主动性:提升 `reasoning_effort`,鼓励模型持续完成任务,减少向用户确认或交还的频率。
Tool Preambles:通过提示词引导模型在工具调用前,简明扼要地重述用户目标、规划执行步骤。

推理与上下文复用

Reasoning Effort:可根据任务复杂度调整推理深度。复杂任务建议高推理力度,并将任务拆分为多个步骤分批完成。
Responses API:推荐使用 Responses API 传递前序推理结果,节省 token。

代码生成与协作

前端开发推荐栈:GPT-5 在前端开发表现优异,推荐使用 Next.js、React、Tailwind CSS、shadcn/ui 等主流框架和组件库。
零到一应用生成:通过提示模型自建评估标准,并据此反复自我优化,提升一次性生成应用的质量。
代码风格与规范:明确代码编辑规则、工程原则、目录结构和 UI/UX 最佳实践,确保模型生成代码与现有项目风格一致。
协作编码案例:通过参数和提示词双重控制,平衡输出简洁性与代码可读性,鼓励模型主动提出变更并让用户审核。

可控性与指令遵循

Steerability:GPT-5 对提示词的可控性极高,可控制输出长度、风格和工具调用行为。
Verbosity:新增 `verbosity` 参数,控制最终答案的长度。可在提示词中覆盖默认设置,实现场景化定制。
Instruction Following:GPT-5 对提示词指令极为敏感,需避免矛盾或模糊的指令。
今年全球人形机器人预计出货量10000台
预计5~6家企业出货量过千台

今年全球四足机器人预计出货量50000台

以上数据支撑了N家数十亿及百亿估值企业
Watermark Zero—— AI去除照片水印

利用Flux Kontext模型,轻松去除照片中的水印、文本或标志,保留图像原始质量。无论是复杂的水印还是半透明的文本,这款工具都能智能识别并重建背后的像素。

🔗https://watermarkzero.com/
浪浪山小妖怪
整个电影剧情都是为了塑造人物而服务
故事普通但几个小人物的形象是立住了
一个动画电影的角色能做到比真人更有人味儿
怎么做到的呢?太妙了
乌兰察布的烦恼之旅终于结束了
好的风景全都在路上,不在景区
物价有点离谱尚且能忍
羊肉还不如北京的好吃,令人费解
景区管理全国最差,景区内景区外,永远堵堵堵
景区卫生全国最差,到处都是瓶子、袋子、卫生纸
自然美好,人性丑恶
GPT 5 推出之后大家照例让它算 10.9 和 10.11 的差。它照例失败了,成了新一轮笑柄。倒是真的实现了传说中的 Ph.D level,因为博士生一般来说算术都不好。

当然这不是它一家的问题,别家 AI 也在这个简单的题目上纷纷翻车,包括我很喜欢用的 Gemini Pro 2.5。但 Gemini 翻车的姿势还要更炫酷一点:作为一款思维链模型,它知道这种时候应该调用 Python 来算。但当 Python 返回了正确结果之后,它的反应居然是:「我觉得 Python 算的不对,还是我自己来心算好了。」然后算错了。

这个错误虽然好笑,但暴露的是这一整轮 agentic AI 发展的致命弱点。Agentic AI 作为一个框架要能运行,前提条件是 AI 知道什么时候该使用并依赖外部工具。当然,这里的分界是模糊的:一个小孩子如果在算三位数乘法的时候掏出计算器,你不会批评。如果这个小孩算一位数乘法也要用计算器,你会怀疑是不是智力有点问题——当然无论如何至少结果是对的,但你会心想一个高级一点的大脑是不是应该合理判断这个问题不值当用外部工具。而现在的问题是这个小孩算一位数乘法,掏出计算器算了个结果,然后觉得不对扔掉了,自己心算了一个错误的答案出来。这是人类有可能犯的错误吗?

其实也是。而且如果你细想,这恰恰是非常「人类」的错误。人类的思维之所以不可靠,就是因为我们常常把直觉凌驾于客观证据之上。不是因为我们缺乏证据,而是因为我们不信任证据(例如曼德拉效应)。对人类来说,仅仅因为看到了和自己内心信念不一致的信息就放弃旧有信念不仅是困难的,而且是痛苦的。

但我们发明 AI 本意不就是避免这个缺陷?

于是我们面临着一个尚未有定论的问题,就是以大语言模型为基座的 AI 是不是先天继承了人类的心理偏见机制。我们对 AI 的期待是它能尽量不偏不倚。当然,在社会政治文化领域这是困难的,没有人能指望 AGI 在巴以冲突问题上能做到只看事实没有立场。但在别的更数字更技术的领域呢?给 AI 一份几万字的报表,AI 能够忠实灵敏地查阅所有细节,然后在回答问题的时候精确合理地引用某个细节吗?这不仅仅是我们对 AGI 的期望,这还是要撑起它所联动的万亿市值市场的前提条件。

今天的 AI 尚不能实现这一点,是因为这里有个内在的技术困难:思维链条不是数据库,而是把数据以自然语言的形式有损压缩在中间状态。这种压缩本质上就类似于人类以印象代替现实的思考模式,也是诞生偏见和误解的根源所在。要从根源上铲除它的土壤,就是要让这种压缩在事实上变成无损的。

于是我们面临两种可能的技术前景:

要么下一代思维链条(或者思维树,思维网络,或者不管什么别的数据结构)真的能实现对数据不依赖印象的理解和综摄。这在实践上已有尝试,比如程序化中间表示(JSON-graph、逻辑项、SQL、符号代数),或者对数字、日期、单位、表格索引做硬约束解码。简而言之,找到绕过以文字为思维载体的办法,把图像、数据和表格原生嵌入 AI 思考流程。

要么我们撞上了自然语言的先天限制。AI 将和人类一样,无论再怎么用力检查、对比、参考、判断,也只是不断用一层又一层的新的印象覆盖旧的印象,新的记忆调和旧的记忆,直到自己迷失在真实和幻觉之间的缝隙里。

前者是一种达芬奇式的前景,后者是一种博尔赫斯式的前景。或者用东方哲学的话说,前者意味着更强大的语言模型能够实现「坐照」之境,而后者意味着除非在底层重写技术框架,否则我们将不可避免的撞进文字障。

目前还没有证据证明哪个前景更有可能。前者如果成真,则立足于 AGI 的人类社会工业再数字化不但可行,而且指日可待。后者如果成真,则 AGI 不过是大号的人类,会在分裂和偏见之上引入新的分裂和偏见,不知伊于胡底。

大多数人对 AGI 的期待似乎是前者,并且这种期待如此底层,以至于甚至不需要宣诸纸面而是视为理所应当。然而如果人类运气不佳(一向不佳),我们很可能正在走向后者。
AI、量子计算、机器人和工程化开发在这一刻完美结合了~
Back to Top