关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
试了一下 MyShell 新推出的 ShellAgent 2.0#ai创造营#

这个有意思的点是,没有前端页面,都在一个 Chatbot 里面用通用组件交互,只需要专注 Agent 流程本身就好,用户也不用管展示,只说功能逻辑就行。

我先是想让他整一个计算八字的 Agent,然后再给一张对应的图片。

看过我之前的提示词的都知道我需要写一堆网页样式和交互逻辑的提示词,这个对于 C 端用户来说是很高的门槛,但是现在完全不需要的,一句话就行。
在你输入提示词之后他会先进行需求分析,然后询问你一些需要补充的细节,在你确认之后就开始生成了。
右侧会展示 Agent 的生成进度,下面那个用户旅程图特别有意思,你可以很快的理解他的 Agent 构筑思路。
而且旅程图的部分选中之后还能作为上下文填写到修改的部分。

生成过程非常的简单,输入完提示词等待他生成结果就行。
生成结束后你就能看到右侧预览界面有内容了,这时候直接进行交互就行。
之后等待结果就行,由于这个是真的强力模型在推动,所以效果上非常好,整个结果非常专业、全面和完善。
最后我还会让他根据你的运势生成一张运势海报图片,帮助你形象的理解自己的运势。

搞完这个之后由于 MyShell 里面还内置了一些 Web3 的工具,虽然咱不能玩,但是可以看看八卦。
于是我就让他可以根据你输入的钱包地址详细的分析这个钱包的资产和转账内容,然后给出一个偏娱乐性质的报告。

输入提示词等待一段时间后就好了,我们只需要点击开始追踪,然后输入钱包地址或者 ENS 域名,选择网络就好,这里用 V 神的域名做测试。
然后等待结果就行,AI 会以非常简练而且幽默的方式对你解读这个钱包的资产配置以及背后所代表的意思,很好玩,无论你是否理解 Web 3 都可以看懂。

ShellAgent 2.0 里面内置了超多工具,除了能生成文本和图片之外还能生成音频。
所以就想了一个点子,让他根据我的文档内容生成学习的播客和图片闪卡来拆解学习资料。

你只需要上传文档或者给出你想要学习的网页链接就可以。
比如我这里拿个论文模型试一下,他会先生成对应的核心要点总结,然后你可以选择生成图片的闪卡或者解读播客。
右侧的图片就是生成的图片闪卡,感觉可以自己打印出来放到一个地方去记忆。
后面还会帮你生成一个播客,直接听就行。
今年 AdventureX 通过售卖参赛者的隐私数据来做商业化是我完全没想到的…
现在的年轻人真会玩
视规则为无物
这个活动的性质已经彻底变了

参赛者的称号是梦想家…
用隐私换梦想
钱还给别人赚走
亏得有点大了
Qwen 模型最大的瓶颈
可能是
阿里云
继两个月前通过副主任医师职称考试后,夸克健康大模型又通过了12门学科的主任医师笔试评测,并且夸克已经把该「主任级AI医生」能力全面集成至夸克的AI搜索中,这意味着夸克进一步实现了每人都能有个AI医生的愿景,还是那句话,我就感觉到快。

从数据上看,夸克在这轮测试中67.7%的准确率比第二名高出了近30个百分点,领先不可谓不大,但我真正关心的不是数据,而是相比于五月那轮副主任医师测评,夸克通过推理难度高出几个级别的主任医师考试,到底能为医学领域做多大的实事。

健康大模型不是夸克开创的概念,目前市面上的同类产品以TO B为主流,商业化路径十分明确,不是说这样不好,而是这些大模型性质,决定了它们难为大众所用。

在让AI做题蔚然成风的环境里,大模型的能力边界是一回事,这种能力最后究竟能不能投入到市场变成公共服务,又是另外一回事了。

比如在AI医疗这个母题上,中国最亟待解决的是医疗资源的分配问题,这与其他国家的处境是截然不同的。比如在移动互联网时代,有很多APP和账号都在尝试跑通线上问诊,也不乏类似丁香医生这种已经搭建了一个成熟体系的账号跑出来,但这种模式,仍然没有改变问诊背后在消耗「人」的本质。

搜索引擎当然也尝试干过这事儿,结局也很明显,传统搜索早已被清扫进了历史垃圾堆里,而新兴如小红书这样「人传人」式看病不仅高度依赖经验,准确率也难以保障。

夸克披露了一个很值得细品的数据,就是在产品上搜索医学类考试题目的人数已经突破200万,考虑到非医学生做这种动作的可能性并不大,所以从纯度上讲,中国医学生已经有超过半数在用夸克学习了。

这当然很大程度上能说明,夸克在医学领域数据库的参考价值起码是得到专业人群认可的,不过这不是重点,重点在于夸克通过主任医师评测的考试,证明了其拥有了接近主任医师级别的的思维,AI已经可以完成医学领域的智能化延伸了。

如果你觉得这个说法过于抽象的话,不妨看看前段时间量子杂志刊登过的一篇报道:

美国的一个物理学团队想让AI帮忙设计一款引力波探测器,在没有任何预设的前提下,AI输出的结果让一票物理学家一脸懵,因为这东西实在不符合常理,牵头的领导当时还把这个结果定性成了「一团糟」。

结果过了几个月,研究人员才发现AI的思路,其实是基于几十年前俄罗斯物理学界的一些理论构建出来的,研究越深入,就越能证明AI给出的这套方案,居然是效率最高的...

这就是智能化延伸的能力,AI发展到今天,早已经跳出了「有问必答数据库」 的那套叙事,它如今最大的价值,是给有局限性的人类提供无数可能的思考角度,就像当初世界围棋大师们都看不懂AlphaGo的路数,但后者最终总能赢下对局。

说回正题,在智能化延伸能力的基础上,夸克的推理能力,已经可以取代绝大多数医学上的机械性重复工作,比如分析血常规、看CT影像等等,只要喂料够多,那最终的准确率一定不会比真人医生低。

更重要的是,这种延伸背后是千万级DAU的搜索入口,单是医疗领域,夸克的升级也能直接覆盖到2000万体量的用户群体,实打实影响着每一位正在用AI辅助问诊的人。

当然,这只是个开始,夸克的质变,也是建立在整个行业大模型能力都在突飞猛进的背景上的,AI要想真正参与到医疗体系里,要经历的步骤还有很多。

不过还是希望AI厂商们能更多向类似务实的方向上靠拢,有时候做慢而正确的事,最终的收获,要比想象中多很多。
这个 4o 提示词效果太好了

非常适合做一些比较张扬的产品主题插画,色彩一致性也很好,线条很粗适合转换成 SVG

提示词:Design a bold and dynamic vector icon of [🤡], in a high-contrast color palette: pure black, white, and neon green. The style is playful, expressive, and energetic, with thick black outlines, exaggerated forms, and cartoon-like proportions. Add dynamic shadows and minimalistic graphic effects to create a strong visual impact. The design should feel fun, lively, slightly rebellious, and tech-inspired. No gradients, no textures — only flat colors and striking contrast.
流泪的机器人
家人们我还挺喜欢这种古早味笨重的机器人...
AI探索指南
昨晚看 Lovart 发了正式版,就赶紧试了一下 这个 ChatCanvas 强的离谱,基本上定义了创意类 Agent 的交互范式 昨天刚说完 ax 就来了这么一个完美案例,你现在有一个不知疲倦指哪打哪的 AI 创意员工了 不想等施工🚧可以先看这里:https://mp.weixin.qq.com/s/cTOaTF94DPqMeWiRsdhetQ 过去你是用 Lovart 的时候一定也有一个感觉。 那就是看起来你一直在跟右边的 Agent 聊天交互,左边的无限画布除了展示没有什么用处,今天这个更新会解答你的疑惑。…
比如我这里发现 AI 多写了一行「Keynote」文字,我想要去掉,就可以框选这部分,让他去掉就行。

这个案例里面我完全通过评论(ChatCanvas)功能,不断的调整一张图片,然后最后把它生成了一个动态视频。
调整过程非常精准,完全不需要你费劲巴拉的用文字去描述位置或者图片,点击评论回复问题运行就行。

说完简单的用法我们再来点复杂的。

ChatCanvas 不仅支持每张图片单独调整,其实也支持多张图片联动调整。
这个能力对于有设计能力的朋友来说非常重要,你可以直接在画板中完成拼图编辑组合工作。

这里我想做一张图,包含了最近的几个热梗,乌萨奇在东方明珠下面和蜜雪冰城然后被激光击中的画面。
这里我先找了三张素材图,画面中的主要元素,分别是乌萨奇、东方明珠和蜜雪冰城的饮料。

然后精彩的地方来了,我可以分别给这三张图添加评论,指出分别需要参考的部分以及新图片的风格和位置。
我在乌萨奇这里说了使用这个角色,然后在第二个评论饮料这里说明角色会拿着这个饮料,最后在东方明珠的图片部分指定了三个参考项的位置以及画面风格和比例。

见证奇迹的时刻朋友们,一张乌萨奇在上海偷喝蜜雪冰城,然后被击毙的图片就整好了,我还能让他变成视频。

昨天我发的内容说过,未来的软件设计将会从用户体验(UX)为中心转换为以 Agent 体验(AX)为中心。
一旦体验过真正的 AX,传统的 UX 会让人觉得“过时且低效”,你用完 Lovart 在用其他创意设计产品就会有这种感觉。
FpsFEoUt5sHahsaor_2QBVGzVez3v3.jpeg.jpg
257.3 KB
昨晚看 Lovart 发了正式版,就赶紧试了一下

这个 ChatCanvas 强的离谱,基本上定义了创意类 Agent 的交互范式

昨天刚说完 ax 就来了这么一个完美案例,你现在有一个不知疲倦指哪打哪的 AI 创意员工了

不想等施工🚧可以先看这里:https://mp.weixin.qq.com/s/cTOaTF94DPqMeWiRsdhetQ

过去你是用 Lovart 的时候一定也有一个感觉。
那就是看起来你一直在跟右边的 Agent 聊天交互,左边的无限画布除了展示没有什么用处,今天这个更新会解答你的疑惑。

他们设计了一整套的评论系统 ChatCanvas ,如果你是设计师用过 Figma 的话应该很熟悉。
但是这个评论不是给你的同事反馈的,而是说给 Agent 的。
就好像在虚拟世界里面有一个叫 Lovart 的设计师在随时待命,等待你说出“把这个文字调大点”这种要求。

接下来跟着我用案例带你看这玩意有多强大,首先来看一个比较基础的案例。
这次我们要做一个玻璃质感的 PPT 动态视频封面,首先输入提示词让他给出一些基础的选项。
现在局部修改,你只需要点击左边无限画布的部分页面下方的的评论图标按钮,点击在你想要修改的图片上写出要求就行。

比如上面生成图片上有这种波浪形状的光,我不太喜欢,我就可以点在这个位置跟 AI 说把这部分去掉。
这时候我又发现一个牛皮的地方,他们在这里吸收了一部分 Cursor 代码补全的交互,AI 会根据你打的字补全你的需求,你只需要按 tab 键就能回填。

完事之后点击 「Add to Queue」按钮就可以提交需求,这时候 AI 有时候还会需要你补充一些信息,你们就可以在这里对话。
在你觉得没问题的时候,就可以点击下面的「Run All」按钮执行所有的的评论了,你能够加好几个评论让 Lovart 一起执行。

现在 Lovart 还有了类似 Figam 的 Frame 也就是画板概念,整个画板中的所有改动都有独立的聊天界面去回溯。
想要看我所有执行过的评论的话怎么办,你可以点击评论旁边的「Comments」按钮查看。
还能点击「Reopen」按钮去将这个评论重复添加在图片或者视频上重复执行,考虑的非常周到。

不止可以点击添加注释,你还能画框去标注图片的具体位置让 AI 修改。
Back to Top