关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
Anthropic 和吴恩达公司一起出的 Claude Code 教程#ai创造营#

可以搭配前几天的 Claude Code 最佳实践一起食用,详细的内容有:

协调多个 Claude 子 Agent 同时处理代码库的不同部分

在 GitHub 问题中标记 Claude,并让它自主创建、审查和合并拉取请求

将杂乱的 Jupyter 笔记本转变为干净、可用于生产的仪表板

使用 Playwright 等 MCP 工具,这样 Claude 就能发现你的 UI 出了什么问题,并自主修复它

课程地址:learn.deeplearning.ai/courses/claude-code-a-highly-agentic-coding-assistant/lesson/66b35/introduction
今天我们的新产品 FlowSpeech 正式发布
FlowSpeech 是全球第一个书面语转口语的 TTS
可以读网页,可以念小说,可以讲PPT,还能翻译外语。
它是你的 AI 嘴替,随时替你说话。

这听起来非常不炸裂,但它却是基于我们真实的用户的真实痛点所做的有用的小产品。
为什么在行业都在吹概念,追模型,卷 Agent 的时候,
我们选择花一点时间做一个这样的小产品呢?
作为 AI 应用公司,我们当然希望自己成为天空中的独角兽。
但做产品的本质,是帮助一个个真实的人。
FlowSpeech 的需求来自一位80岁的美国老人,这是他的故事。

ListenHub 在 5 月上线后,我们很快有了一万的注册用户。
在所有的用户中,年龄最大的一位,是一位美国老人。

有一天他在网上看到了 ListenHub,但是不太会用我们的软件,就写邮件问我,有没有使用教程。
我当时第一反应是,我从未想过给 ListenHub 写教程,因为它太简单了。

在 AI 圈子里都觉得过于简单的产品,在大众眼里依然是复杂得无从下手。

于是我回复他的邮件说:我们目前还没有教程,但是这就写,写好了发给您。
我立即打开 Notion,写下了一份最简单的教程,然后发给了这位美国老人。
他看完教程,终于把 ListenHub 用了起来。
后来我们邮件又往来了数次,我也逐渐了解到他的故事。

他在 1957 年参军,今年应该已经有 80 多岁了。
长期的肺纤维化疾病和数次的中风,已经让他失去了说话的能力。
但这并没有打垮他,他组建了一个数万人的线上病友社区。
他把 ListenHub 当作自己嘴替,用 AI 生成播客内容,在社区里输出,帮助病友。

播客很好,也只是万千表达方式中的一种。
我们希望我们的用户能够自由自在地用声音表达。
于是我们决定做一个通用的 AI 嘴替,可以读网页,可以念小说,可以讲PPT,还能翻译外语。‘

让你的 AI 嘴替,随时替你说话。
这就是 FlowSpeech 的缘起。

FlowSpeech 如何使用?
直接在浏览器访问 http://ListenHub.ai 即可在网页内直接使用。

iOS 下载:在 App Store 搜索 ListenHub 即可下载,FlowSpeech 会在下周上线到 App 里。

安卓下载:紧张开发中,即将上线。

还有…API 吗?

很多朋友问我们,ListenHub 里的声音,能不能做成 API,接到自己的产品里?

对,我们即将推出 FlowSpeech 的 TTS API 服务,敬请期待。

Invalid media: video
GPT-5 的相关信息已经加入到了代码库里面做好发布准备了,Pro 会员可以用 GPT-5 Pro 的模型#ai创造营#

- 免费:访问我们的旗舰模型 GPT-5
- Plus:访问具备高级推理能力的 GPT-5
- Pro:访问 GPT-5 pro,使用更多计算资源以提供对最难问题的最佳答案
GPT-5 的介绍泄露了,看起来又是微软的锅,四个模型和优势:#ai创造营#

GPT-5 是 OpenAI 迄今为止最先进的模型,在推理能力、代码质量和用户体验方面都有重大提升。

它能够以极少的提示完成复杂编码任务,提供清晰的解释,并引入更强的代理能力,使其成为所有用户的强大编程协作伙伴和智能助手。

目前可用的 GPT-5 变体包括:

gpt-5:面向逻辑推理和多步骤任务
gpt-5-mini:轻量级版本,适用于对成本敏感的场景
gpt-5-nano:针对速度优化,适合需要低延迟的应用
gpt-5-chat:支持高级、自然、多模态且具上下文感知的对话,面向企业级应用
感觉 OpenAI 最近开源的 gpt-oss 真的被严重低估了。它虽然不是最聪明的,但在使用场景和定位上是非常成功的(服了 Sam 老六)。

首先最小尺寸的 gpt-oss:20b 绝对是你在 Mac 或者家用电脑上就能跑的最好模型之一(对我来说是“唯一”)。它是那种少有的“真正能用”的本地模型,对话体验非常好,持续对话下来非常稳定、不会出现输出混乱崩溃的问题。大部分早期能跑的本地模型是不具备的。

它的尺寸刚刚好,不管是模型文件还是运行显/内存都非常小(大约是 12~16GB),大部分电脑都能使用。在我的 M4 Mac 上能做到 70token/秒 的输出,在我的 19 年老 Intel 的 Mac 上能做到大约 1 token/秒的输出。整体性能上非常出色。

最为重要的是,虽然硬件要求非常低,但它的智能表现出乎意外的好。我把个人最近一些非编程类的问题同时发给 gpt-oss:20b 和元宝(DeepSeek R1),不管是回答速度还是回答质量,我更喜欢 gpt-oss:20b 多一点。这不是严谨的对比测试,我也只尝试了五、六个问题,但考虑到硬件要求,这样的回答效果已经让我感到满意了。

如果你的对话需求非常简单,或者想要一个完全离线、隐私自由的本地模型,gpt-oss:20b 绝对是一个简单可靠的选择。

其次是最大尺寸的 gpt-oss:120b,OpenAI 号称接近 o4-mini 的水平。理论上它也能在 Mac 或者家用电脑上运行起来。我记得大约需要 60~80 GB 的显/内存,对我的 Mac 来说非常吃力。如果电脑硬件足够强、或者并行几个 Mac Mini 跑起来问题应该不大,这就能拥有一个接近 o4-mini 水平的离线本地模型了。

gpt-oss:120b 另外一个被低估的意义是在价格上。在 together.ai 上这个模型的价格低至 $0.15 / $0.60,相比之下 DeepSeek V3(注意是 V3 不是 R1)的价格是 $0.27 / $1.10。也就是说,这么一个号称性能接近 o4-mini 的模型,价格只需要 DeepSeek V3 的一半!!据我所知这样的价格已经是 LLM 中的最低档,类似价格的是 gpt-4o-nano 和 gemini 2.5 flash-lite。

我现在非常怀疑 OpenAI 这波就是冲着 DeepSeek 来的……

另外我还发现了 gpt-oss 非常容易破解,比其他开源模型简单很多。容易到什么程度呢,我可以在大约三次对话内让它回答各种非法问题。不过这个话题不适合在这里讨论了……
今天我们的新产品 FlowSpeech 正式发布
FlowSpeech 是全球第一个书面语转口语的 TTS
可以读网页,可以念小说,可以讲PPT,还能翻译外语。
它是你的 AI 嘴替,随时替你说话。

这听起来非常不炸裂,但它却是基于我们真实的用户的真实痛点所做的有用的小产品。
为什么在行业都在吹概念,追模型,卷 Agent 的时候,
我们选择花一点时间做一个这样的小产品呢?
作为 AI 应用公司,我们当然希望自己成为天空中的独角兽。
但做产品的本质,是帮助一个个真实的人。
FlowSpeech 的需求来自一位80岁的美国老人,这是他的故事。

ListenHub 在 5 月上线后,我们很快有了一万的注册用户。
在所有的用户中,年龄最大的一位,是一位美国老人。

有一天他在网上看到了 ListenHub,但是不太会用我们的软件,就写邮件问我,有没有使用教程。
我当时第一反应是,我从未想过给 ListenHub 写教程,因为它太简单了。

在 AI 圈子里都觉得过于简单的产品,在大众眼里依然是复杂得无从下手。

于是我回复他的邮件说:我们目前还没有教程,但是这就写,写好了发给您。
我立即打开 Notion,写下了一份最简单的教程,然后发给了这位美国老人。
他看完教程,终于把 ListenHub 用了起来。
后来我们邮件又往来了数次,我也逐渐了解到他的故事。

他在 1957 年参军,今年应该已经有 80 多岁了。
长期的肺纤维化疾病和数次的中风,已经让他失去了说话的能力。
但这并没有打垮他,他组建了一个数万人的线上病友社区。
他把 ListenHub 当作自己嘴替,用 AI 生成播客内容,在社区里输出,帮助病友。

播客很好,也只是万千表达方式中的一种。
我们希望我们的用户能够自由自在地用声音表达。
于是我们决定做一个通用的 AI 嘴替,可以读网页,可以念小说,可以讲PPT,还能翻译外语。‘

让你的 AI 嘴替,随时替你说话。
这就是 FlowSpeech 的缘起。

FlowSpeech 如何使用?
直接在浏览器访问 http://ListenHub.ai 即可在网页内直接使用。

iOS 下载:在 App Store 搜索 ListenHub 即可下载,FlowSpeech 会在下周上线到 App 里。

安卓下载:紧张开发中,即将上线。

还有…API 吗?

很多朋友问我们,ListenHub 里的声音,能不能做成 API,接到自己的产品里?

对,我们即将推出 FlowSpeech 的 TTS API 服务,敬请期待。
B 端产品,往往是某种最佳实践的凝结。可通过目标用户调研、逻辑推演,不断提升确定性。

C 端产品,往往并不是理性下的最佳实践。用户调研用途不大,甚至容易带进坑里。

C 端产品,更像一个封装着人性的密码箱。找齐所有密码才能开启。密码错一位,和全错是一样的:打不开。

问题来了:抖音的密码有几位,每一位是什么。

AI 时代有新的平台型产品的机会吗。如果有,密码是什么。又有哪些 AI 应用,已找到部分密码。
社保政策加速了企业自动化。
👀Gemini Storybook玩了,整体内容输出质量很高,故事情节连贯性和配图质量都符合预期。提了一个指令是“做一个梵高和毕加索绘画风格结合的插图(图7)”,生成物的确融入了毕加索立体主义时期的创作风格。

主要是生成的真快,可以想象在哄娃睡觉这个场景下,面对不停提需求的娃,崩溃的家长可以直接打开Gemini寻求帮助了。

📝prompt:
Using Vincent van Gogh artistic style to create a storybook about Pablo Picasso enthusiastically tries to convince van Gogh to collaboratively draw and commercialize their collaborative work through art dealers. The story should be open ending about the fate of van Gogh and should be based on historical facts. At least one picture in the storybook should demonstrate a collaborative work of van Gogh and Picasso. Targeted readers are females between 20-35 years old.
要来了,但可能不是今晚#ai创造营#

GPT-5 有三个模型,图标泄露了

包含 GPT-5、GPT-5 mini、GPT-5 nano
Back to Top