关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
此页PPT感谢@罗X 老师贡献灵感…
报告做了70多页了…
估计还得有至少50页…
今天终于搞明白prompt engineering了。

之前的不管是〝精确表达〞还是〝压缩表达〞,都落在了阳的范畴里。

这两天密集尝试了〝共振表达〞,最终发现它落在阴的范畴里。

两者不是升级和替代关系,而是阴阳相生,互相补全的关系。

拼图完整了,初步练手试了下,短篇小说生成这事,已经解决了。

太多想做的试验了,兴奋。
人形机器人一览,最有价值/生动/明晰的list:
https://www.openloong.org.cn/cn/robohub
梳理一下自己写 Prompt 受启发的几个重要节点:

- @云中江树 :langGPT ⇒ 学会结构化写法

- Super Prompt: 以符号传递意思 ⇒ 学会「得意忘言」 ⇒ Lisp

- Think Claude: 显式思维过程 ⇒ 学会「全图景流动」 ⇒ o1

- 豆爸 (织梦师): 量子场 ⇒ 学会「场的氛围」 ⇒ 脱离规则指导

- @莱森 LysonOber (织梦师): 梦境 ⇒ 学会「神经元之海中飘荡」 ⇒ 进一步放开限制

期待从开源社区学习更多,也回馈更多到社区。
#每日一个idea

我去年写了一个叫ChatSum的群聊总结工具,用wechaty框架实时收集微信消息,在群里@机器人提问,请求大模型 API,总结群聊话题。

当时的方案是在提问时拿到群聊消息发给 Claude2 总结,会有隐私问题,也受到了 Claude 模型长度的限制,总结效果不太好,后面这个项目就搁置了。

上周 Anthropic 发布 MCP 协议之后,我打算把这个项目捡起来,技术方案调整了一下:

1. 用 wechaty 在自己电脑上运行微信机器人,实时收集微信消息,存储在本地文件

2. 在自己电脑运行一个 mcp-server-chatsum 程序,接收查询请求,从本地文件返回匹配的微信消息(根据群名/联系人/话题组合查询)

3. 使用 Claude 桌面版作为交互入口,随时查询和总结微信消息,由 Claude 桌面版与本地的 mcp-server-chatsum 进程通行,再由 Claude 内置的大模型完成总结回复

比如我可以这么问:

- 今天早上大家都在聊啥?

- 关于 MCP 最近有哪些讨论?

- idoubi 在哪些群分享了什么内容?

- AI-Native 群最活跃的 5 个用户和关心的话题是什么?

比起去年的实现方案,用 MCP Server 来实现 ChatSum 的功能有一些不同点:

- 消息存储和查询总结完全解耦,灵活性更高

- 由 Claude 客户端做服务发现/意图识别/参数提取 / 流程串联等步骤,准确性更高(之前用的是 Function Calling)

- 虽然现在交互入口用的是 Claude 桌面版,按照 MCP 协议的约定,后面可以自己实现一个 MCP Client,调用本地的大模型,实现完全私有化,数据安全性更高

MCP Client 作为个人电脑的超级入口,AI 助理 2.0 时代即将到来。

最后很高兴宣布,今天的 idea 已经落地了。

微信机器人和消息总结 MCP Server 代码已开源👇

https://github.com/mcpservers/mcp-server-chatsum

用我自己的微信跑了一些查询,总结效果良好,再也不用担心加群太多消息看不过来了。😄

欢迎自行部署体验。

我会写一篇文章总结实现 mcp-server-chatsum 的技术细节,敬请期待。
海螺这个太强了!

发布新的专注于风格化效果的图片转视频模型,这下做动画有的用了。

右上角选择 I2V-01-Live 模型尝试。

Invalid media: video
做了个新AI玩具

情况是这样,和朋友骂骂咧咧看了再见爱人这个综艺之后,忽然觉得这里面的互相通过描述让画师画画的环节很妙(不评价里面的人,只是玩法本身)

即便是非常熟悉的人,也很难直观的看到自己在对方心目中的具体的样子,通过这种方式,两个人可以从一种新的角度了解对方,也了解自己

通过多个AI Agent,我实现了这个小玩具,你可以直接搜索小程序『眼中的彼此』来体验

我没有设置任何付费,在能撑的住的情况下完全免费,希望让大家可以用这种方式来更好的和重要的人有互动,我觉得这种方式还挺不错的

因为这是一个小程序,直接在微信里搜索『眼中的彼此』就行

有任何问题和意见也欢迎直接在评论区提出,我随时更新,感谢大家

这里的图用了我和@碎瓜 的,但我们俩都是直的,这里只是用来测试,也说明朋友之间玩也是没问题的
可可爱爱,圆圆脑袋
Cursor AI隐藏技能:1小时完成专利申请,立省数万💰_哔哩哔哩_bilibili

当AI编程赛道博主还在卷v0.dev,bolt.new,Windsurf,Cursor 0.43的更新,不停一起教用户如何10分钟做网站、做小程序、做app时。

我搞了个完全不同的教程内容😈

对自己这点还挺满意的,我完全懂现在AI编程赛道产品这么卷,每次出新产品做教学都会有不错的流量。但是我自己只喜欢AI编程本身,并不想做AI编程工具的爱好者。

所以在没那么多本质更新迭代的前提下,宁愿做一些长期有价值点的内容。

而且我也不太爱为了教而教的,我是自己真的在用AI做产品,在用AI解决我实际的问题,教是顺带手的帮助我总结经验以及给他人带去价值的事。

所以我现在对自己做视频写文章也都还有丰富的兴趣和表达欲,而不想让这事变成一种纯粹的工作,一种劳役。
即梦更新的 2.1 图像居然可以生成中文!!!

模型效果也很牛批,配合 Claude 可以复刻任何优秀海报了。

Claude 提示词“用一段话详细描述这个海报的风格、内容和里面的文字排版,力求通过文字描述可以还原画面”
Arc 团队的新产品网站终于上线了!

他们发了一个他们关于 AI 时代的产品交互思考来招聘。

想较于前段时间更成体系了还有演示,强烈推荐看看。

我总结了一下。

官网:https://www.diabrowser.com/

1. 核心愿景

AI 不应该仅仅是一个应用或按钮
AI 应该是构建在浏览器之上的全新计算环境
这个环境应该是个性化的,深度集成到用户的工具和工作流程中
能够理解用户上下文并为用户完成工作

2. 关键技术基础

ADK (Arc Development Kit)
全新的浏览器开发方式
让工程师能在几天内完成原本需要数月的功能原型

四个核心组件:
Memory: 安全地理解用户及其在线工作
Actions: 允许浏览器接入工具并执行任务
LLM 技术: 与其他组件混合匹配使用
Self-driving: 让 Dia 能完全接管大型任务

3. 创新交互示例

智能光标:
将个性化智能带入每个文本框
可以直接通过光标进行信息查询和补充

上下文感知:
理解用户正在处理的任务
可以跨标签页整合信息
能够理解并执行复杂指令

自动化任务:
可以模拟用户操作完成重复性任务
支持个性化的任务处理(如批量发送定制邮件)
无需特殊 API,直接在浏览器层面运作

4. 历史视角的思考

他们用爱迪生电灯泡的例子来类比当前 AI 发展:

单个发明(电灯泡/AI模型)本身并不能改变世界
只有当我们重建整个环境来适应新技术时,真正的变革才会发生
目前的 AI 按钮就像"更好的蜡烛",而不是真正的范式转换
Dia 试图创建一个完整的 AI 优先的计算环境

5. 产品理念

打破并重建浏览器的概念
使浏览器成为高度个性化的工具
主动理解用户需求并提供支持
创造真正以 AI 为中心的计算环境

Invalid media: video
Back to Top