关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
豆包新上线了AI播客,瑞士军刀功能再+1,目前支持PDF和网页链接的上传,总体来说,通过大模型的智能识别,豆包现在可以把任何内容转化成一条高度口语化的双人对话播客,属于趣味性和实用价值都很高的一次尝试。

熟悉大模型播客产品的人都知道,豆包这次对标的是谷歌NotebookLM——或者说是它最出圈的Audio Overviews功能——后者通过识别用户上传的文本、网页、视频,就可以转化成一条口语化且带有情绪表达的AI播客,深得用户喜爱。

Audio Overviews大约是在上个月开始支持中文的,但在中文播客市场砸出来的水花并没有想象中的大,一方面是众所周知的产品迁移成本,另一方面,中文播客市场体系化进度实在迟缓,用户习惯是高度分散的,这就导致了播客本身的适配场景很多,深究起来的播客用户以及潜在播客用户也不少,但商业化空间始终有限。

说回正题,我第一时间试了下豆包的AI播客,并分别投喂了两个不同的网站,一个是我写的刘强东前两天内部讲话的文章「刘强东的机巧」,另一个是B站UP主对Prompt, Agent, MCP等AI技术的科普文。

先说结论,在真正听完豆包生成的这两条AI播客之前,我对这项功能的完整程度预期并不高,原因在于,在这种复杂的任务上,目前很多主流大模型的做法还是「边吞边吐」,由此就会破坏内容输出的结构性。

但豆包已经可以做到在10分钟左右的播客篇幅里基于框架生成内容了,在「刘强东的机巧」生成AI播客的任务里,所有对话的前后呼应都很强,能听得出它是按照同一条逻辑线不断往下捋的,有点意外。

另外就是,豆包AI播客的拟人程度已经可以做到以假乱真了,这真的不是夸张,对话的流畅度、松弛感以及合时宜的抑扬顿挫,像我这种文字工作者,文章简单拿来改一改就能直接原地起个播客账号的程度。

那条硬核技术帖转播客的任务表现也相当亮眼,首次提及专业名词的时候,会贴心附上一段对这个概念的解释。整体的输出脉络,也都是建立在「我要深入浅出讲明白这条科普」这个最终目的上。

说人话,就是AI播客让内容的「可听性」变强了,哪怕注意力没有完全集中在耳朵上,这种通俗易懂的内容也变得更容易被消化。

播客——以及整个音频产业——一直以来的优势,是它不会完全参与到竞争用户注意力的零和博弈里去,大部分情况下,刷视频、聊微信、逛淘宝都是非此即彼的单一选项,但播客只占用一个耳朵,由此它能与很多不同的场景做适配。

豆包不是第一个推出这种功能的大模型,但它在应用场景上的成熟度是完全可以进到第一梯队的,不仅能把拗口的文字进行口语化改造再丝滑地表达出来,同时所有内容输出也都是基于原稿,不存在自己加戏的幻觉问题。

当然,作为新上线的功能,豆包AI播客还会经历一个漫长的迭代过程,比如目前它做不到像NotebookLM一样吃下视频内容,对话的声音、关键信息的提炼浓度,以及生成后的整体风格也都不是客制化的可选项,离用户可以随心所欲地深度使用它,尚且还有一段路要走。

但这并不妨碍我们从这个简单的小功能身上窥见AI在未来的使用场景,一切都是假以时日的问题。

虽然知道AI的技术一日千里,但每次实际体验的时候,那种奇妙感还是会忍不住涌上来。
Dipal D1 开启众筹
可以握在你手心里的 AI 3D 女友

Dipal 通过四种智能输入模式重新定义了人机交互——将视觉、声音、触觉和手势融合成一种无缝的、引起情感共鸣的体验

8 英寸 OLED 曲面屏幕,具有 2K+ 分辨率、10 位支持超过 10 亿种色彩(原生 107 亿种色彩面板)、完整的 DCI-P3 广色域覆盖以及惊人的 4,300,000:1 对比度,可呈现生动逼真的视觉效果。

众筹地址 https://www.kickstarter.com/projects/dipal-d1/dipal-d1-worlds-first-curved-screen-3d-ai-character-pod
看新白娘子,吃灯笼馄饨
宇树机器人到底强不强?深度解读具身智能都有哪些流派?

就在刚刚多个渠道证实宇树近期完成了 C 轮融资的交割。投资方包括中国移动、腾讯、阿里、吉利等企业。在这个节点再次推荐科技播客《脑放电波》的一期内容,是对宇树公司运营细节以及发展历程的最深度内容。
不可编辑和暂停修改的 Agent 不可进化

#ai创造营#
我去,Midjourney 视频模型 V1 发布!

提供低动态和高动态两种方案,支持延长,每次4秒最多4次。

每个月订阅费只需要10美元,视频任务的定价约为图片任务的 8 倍,每次任务将生成四段 5 秒视频。

成本跟图像超分服务相当,非常便宜。
整个小活儿,嘿嘿嘿
ai 导航站 toolify 困境
目前每天十万独立 ip 但是导航站不赚钱 或者说相对没那么赚钱

我现在有两个选择
1.把导航站做到月千万流量 期待头部效应产生更多的收益

2.同样的推广资源 自己做工具产品 收益更高 需要重新起盘

你们会选哪个方向呢?
我发现了一个有意思的事情

很多的产品,比如做PPT,总结文档,生成图片,写代码,或者推理等

无论做的做么花哨,,吹嘘有多少功能

我真的很想问,你的AI模型是哪一个, 调动的是谁家的api,还是自己研究的?

除此之外, 我还想问,如果模型不是顶尖的,也没事,很多场景用不了那么牛的AI模型。

那么,你的使用场景是什么,可以解决什么问题,帮助什么群体去提升效率或者节省成本,,

不然的话,我真的很难去理解那些天天吹AI牛逼的人,然后用了AI,但只是为了用AI,却解决不了问题,只是为了让人知道他在用AI,好像跟着潮流,赢得了异样的眼光,天天直播间那么多人,感觉人生达到了巅峰

即使是使用AI写标题, 我都觉得牛逼
手机带来一个现象,很多人活成了美图秀秀和朋友圈中的自己,颜值大幅提升,从而无法离开美图秀秀。
LLM 也会带来一个现象,很多人活成了 LLM中的自己,智力大幅提升,从而无法离开 LLM。
AI探索指南
Gemini 的产品和研发负责人录了个视频 讨论了一下关于关于优秀编码模型的理念以及 Vibe Coding 的影响,以及编程语言的未来 很多见解挺好的,说明 Gemini 的代码能力进步还是有方法的 视频:https://youtu.be/jwbG_m-X-gE?si=u0nz9RxOaUlhW_Ab 总结了一些我觉得重要的内容: 📌 谷歌 Gemini 团队的编码模型训练方法论 🎯 Gemini 早期编程目标及其局限性 1️⃣ 竞技编程(Competitive programming):…
3️⃣ "Vibe Coding"与专业开发者:他们也看到"Vibe Coding"的兴起。这指的是那些不一定是专业程序员,或者只有少量编程经验的人,利用工具扩展他们使用编程的能力。Andre Karpathy关于"live coding"的推文进一步普及了这个概念。团队的最大愿望是赋能那些不具备专业编程技能的人,让他们能够自己完成一些基本的事情。

🔥 代码就是一切

• 代码作为通识能力:代码能力的提升也能反哺Gemini的其他能力。有些问题可能起初不是一个编程问题,但可以将其转化为代码问题来解决,例如帮助学生解决数学应用题,或者在代码空间中进行推理。

• "代码就是一切"的愿景:"代码就是一切"。举例说,用户询问报税技巧等自然语言问题,其核心需求其实可以通过生成一个"最基本的报税计算"来解决,即便用户没有明确要求"编写一个迷你Quickbook"。

📊 评估(Evals)与挑战:

• 真实世界价值:团队的目标是"理解、预测并押注真实世界的价值将走向何方"。要专注于"这个领域的核心基本挑战,这些挑战对于真实世界的价值是有用的"。

• 评估的实用性:最能反映真实情况的评估是"在AB测试中发布一些东西,看看真实世界会发生什么"。这不切实际,因为不能指望一个新模型在创业公司运行一年来评估其成功。他们需要寻找实用的替代指标。

• 泛化性挑战:编程模型的最大挑战在于,需要构建"能够同时适用于所有用例的能力"。用户使用代码模型的方式多种多样,模型需要能够泛化到所有这些不同的使用场景。

🗂️ 面对处理越来越复杂的代码库(如百万行代码的monorepo)的问题,有两种主要策略:

1️⃣ 长上下文能力:让模型能够将整个代码库作为上下文来处理,并在一个步骤中解决问题。

2️⃣ Agentic编码(Agentic Coding):模型像人一样工作,通过代码搜索、查看文件层级、跳转阅读代码等方式,自主地解决问题。

🎯 Gemini 团队在编程优化上的短期目标:

• 解决2.5 Pro版本中"工具调用功能"的可靠性问题,特别是在代码上下文和Agentic模型进行代码编辑方面
• 细致调整用户交互,确保用户体验更流畅
• 改进模型在特定用例类别上的表现

模型在风格上的表现也至关重要,例如在生成网页UI时,除了功能正确,还需要美观和符合专业标准。Connie提到,有时即使模型犯了两次错误,但如果它表现得"有点调皮",说"第三次会成功"或"这真的很难,我们再试一次",这反而能让用户"原谅Gemini",并建立信任。她强调,"这种风格,比如语气、个性,不一定是你在编码中认为关键的东西,但它在人们接受这些模型的方式中却很重要"。

🌐 为何选择通用模型而非代码专用模型:

• 超越代码的知识需求:代码模型需要"世界知识",而不仅仅是代码本身。例如,一个"Taylor Swift排名应用"就需要对世界有一定了解,而不仅仅是代码。

• 开发流程的复杂性:代码意味着"软件开发过程的越来越多部分",并需要连接到各种不同的信息,其中一些是代码特定的,一些则不是。

• 通用模型的优势:"将所有这些都看作是相互关联的,我们都在为模型的通用能力而共同努力,我们将努力找到最佳方式让一切协同工作,拥有一个真正优秀的通用模型,这对我来说是一个很好的方向"。事实证明,这种方法成功地构建了一个出色的编程模型,同时在其他方面也表现出色。
Gemini 的产品和研发负责人录了个视频

讨论了一下关于关于优秀编码模型的理念以及 Vibe Coding 的影响,以及编程语言的未来

很多见解挺好的,说明 Gemini 的代码能力进步还是有方法的

视频:https://youtu.be/jwbG_m-X-gE?si=u0nz9RxOaUlhW_Ab

总结了一些我觉得重要的内容:

📌 谷歌 Gemini 团队的编码模型训练方法论

🎯 Gemini 早期编程目标及其局限性

1️⃣ 竞技编程(Competitive programming):尽管像OpenAI等公司在评估模型编程能力方面做了很好的工作(如human eval),但竞技编程的能力并不一定等同于一个强大的团队成员所需要的技能,因此这与开发者最终的需求有所偏差

2️⃣ LMS(Language Model Systems):这也不是日常开发工作的真实写照

3️⃣ 代码补全(Code completion):这虽然更具生产力,但其应用空间有限,不足以体现模型现在和未来能够实现的所有功能。

Danny Tarlo认为,前两个目标并不能真正反映开发者的实际工作,而第三个目标则不够宏大。

仅仅关注竞技编程是不够的,因为它无法涵盖软件开发人员日常工作中的更广泛能力需求。竞技编程通常是在一个"非常自给自足的环境中"工作,从零开始构建相对简短的解决方案。然而,软件开发人员日常工作涉及处理大型代码库中的错误报告,这些错误可能分散在"代码库中一百个不同的位置"。因此,模型需要的能力集远大于竞技编程所包含的。

💡 Gemini 编程优化当前关注的"核心要素":

1️⃣ 数据与方法论:Danny强调,一个优秀的编程模型主要取决于"数据和方法论",太鸡贼了最重要的内容一笔带过。

2️⃣ 代码库上下文的重要性(Repo Context):代码库上下文是如此重要。模型不仅要处理代码补全,更要支持"多文件编辑,比只给你几行代码更大的更改"。目标是让模型能够帮助开发者在代码库的上下文中进行需要一小时完成的复杂工作。
MCP is all you need

这篇文章写了一天,内容准备了三个月。🥲
#自媒体运营频道 #@yunying23

基于claude-sonnet-4的小红书爆款笔记生成器智能体已经上线
它的优势在于,基于强大的claude大模型,内容生成比上一版本好很多
除此之外,单次可以直接生成5篇笔记,同时还可以进行关键词布局,关键词植入超级丝滑
Back to Top