关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
Kimi 终于带来了他们的Agent 模式「OK Computer」,而且给了所有之前打赏过的用户提前体验的资格。#ai创造营#

从官方推文来看,这个Agent的定位是全栈助理,直接瞄准生产力场景:

支持使用文件系统、浏览器、终端、代码编写、图片音频生成等 20 多种工具。

支持完成调研、产品方案、交互设计和前端开发的完整过程,也就是一个产研合一的团队。

而且这次依然是用的专门经过特定场景强化学习模型驱动的,可能上限比较高。

我试了一下,先让他分析了一下最近阿里的股票表现,虽然我不懂炒股,但是页面的表格数据和图表可以说生成的相当专业和丰富了,还都是可交互的。

然后让他创建一个购物网站,而且模拟了从展示到购物车到下单的多个页面,设计还行,就是下次可以内置个图标库,别老用 Emoji 当图标。

最后让他创建了一个 PPT,这个结果挺惊喜的,设计风格和配图都跟我的北宋道教发展题目相契合,而且每一页PPT 的每一个元素几乎都支持编辑,比如颜色、字号、位置。

甚至你可以主动插入图标素材或者表格,把一个简易 PPT 工具放到网页上了。

看他们的介绍说未来会增加很多外部应用的连接,这样的话想象空间就大很多了。

Kimi这个团队是不是有点太爱摇滚了
刚写周刊的时候发现阶跃开源的这个 Step Audio 2-7B 端到端语音模型有点意思。

应该是第一个支持推理的端到端语音模型,支持本地部署应该比 Open AI 的 GPT-realtime 便宜很多,发布这几天已经在 huggingface trending 榜上了。#ai创造营#

实时语音对话这点,阶跃的模型一贯做的非常好,而且能够根据不同对话场景和对话信息做出语境适配的回应。

这里比较强的是理解能力,支持通过推理理解语义信息、非语言信息以及非声带信息,让模型可以更好的感知说话人的年龄、性别甚至是情绪。

前几天橘子分享的时候说我们现有的语音转文字去理解语音这种方式可能会丢失 90% 的信息,因为说话人的音调、语气、情绪都没有被传达出来,比如图片里面他就判断了我的年龄以及情绪,还有环境音可以判断所在场景。

感觉 Step Audio 2-7B 这次走在了正确的路上,如果加上更加细致和原生的音频理解的话,语音对话模型的上限和应用场景会变得非常多。

另外 Step Audio 2-7B 还支持工具调用与多模态 RAG,方便开发者去加上适合自己应用场景的知识,实时语音对话的时候可以执行搜索。比如各种垂类行业的语音客服就适合这样,而且还能检索到语音后切换音色。

这次开源了两个模型 Step-Audio 2 mini 和 Step-Audio 2 mini base,7B 的大小让本地部署成为可能,只需要 24G 显存就行,对需要端到端语音模型的开发者来说很实用

可以在阶跃 AI APP里面体验这次的新模型,开启语音通话后可以在小跃新功能里面选择,深度聆听就可以体验音频推理。

模型下载:github.com/stepfun-ai/Step-Audio2
试了一下 MyShell 新推出的 ShellAgent 2.0#ai创造营#

这个有意思的点是,没有前端页面,都在一个 Chatbot 里面用通用组件交互,只需要专注 Agent 流程本身就好,用户也不用管展示,只说功能逻辑就行。

我先是想让他整一个计算八字的 Agent,然后再给一张对应的图片。

看过我之前的提示词的都知道我需要写一堆网页样式和交互逻辑的提示词,这个对于 C 端用户来说是很高的门槛,但是现在完全不需要的,一句话就行。
在你输入提示词之后他会先进行需求分析,然后询问你一些需要补充的细节,在你确认之后就开始生成了。
右侧会展示 Agent 的生成进度,下面那个用户旅程图特别有意思,你可以很快的理解他的 Agent 构筑思路。
而且旅程图的部分选中之后还能作为上下文填写到修改的部分。

生成过程非常的简单,输入完提示词等待他生成结果就行。
生成结束后你就能看到右侧预览界面有内容了,这时候直接进行交互就行。
之后等待结果就行,由于这个是真的强力模型在推动,所以效果上非常好,整个结果非常专业、全面和完善。
最后我还会让他根据你的运势生成一张运势海报图片,帮助你形象的理解自己的运势。

搞完这个之后由于 MyShell 里面还内置了一些 Web3 的工具,虽然咱不能玩,但是可以看看八卦。
于是我就让他可以根据你输入的钱包地址详细的分析这个钱包的资产和转账内容,然后给出一个偏娱乐性质的报告。

输入提示词等待一段时间后就好了,我们只需要点击开始追踪,然后输入钱包地址或者 ENS 域名,选择网络就好,这里用 V 神的域名做测试。
然后等待结果就行,AI 会以非常简练而且幽默的方式对你解读这个钱包的资产配置以及背后所代表的意思,很好玩,无论你是否理解 Web 3 都可以看懂。

ShellAgent 2.0 里面内置了超多工具,除了能生成文本和图片之外还能生成音频。
所以就想了一个点子,让他根据我的文档内容生成学习的播客和图片闪卡来拆解学习资料。

你只需要上传文档或者给出你想要学习的网页链接就可以。
比如我这里拿个论文模型试一下,他会先生成对应的核心要点总结,然后你可以选择生成图片的闪卡或者解读播客。
右侧的图片就是生成的图片闪卡,感觉可以自己打印出来放到一个地方去记忆。
后面还会帮你生成一个播客,直接听就行。
试了一下秘塔新发布的深度研究,这是首个在国内免费提供的深度研究产品

他们在除了免费、准确性高以外,在体验上也做了非常多的优化#ai创造营#

AI 搜索或者 AI 深度研究最重要的就是减少模型幻觉,提高搜索结果和推理结果的准确性。
一般大家都会从两个部分进行优化:
首先就是通过算法和模型真的提高搜索结果和信息获取的准确性,然后加上模型验证等方式降低模型幻觉。
由于我们无法彻底根除模型幻觉,第二个方式就是通过各种交互和展示帮助用户低成本快速的完成信息的验证,给用户信心。

首先秘塔为了降低成本同时保障准确性做了很多工作。
他们将深度研究拆分为多个子任务进行分段强化学习,从而大幅降低了降低资源消耗,又能维持非常高的准确性。在BrowseComp等评测集上也体现了这一点。

然后在通过交互和展示帮助用户快速完成信息验证增强信心的方面。
秘塔这次用一种非常新颖的交互打开了深度研究算法的黑箱,让用户直观的看到了模型在执行任务过程中的动态“问题链”本身。
这个可以说是在搜索结果后面增加标注后的另一个非常重要的 AI 产品交互创新了。
产品交互分为三部分:顶部预览实时展示模型搜索进度和原因,左下 Console 滚动显示搜索摘要,右下总览视图方便定位流程位置。
每步推理用颜色卡片区分:绿色为结论明确,紫色需继续推理,橙色信息待补充。卡片连线标注分支原因,便于理解推理流程。

除了帮你理解过程外,秘塔深度研究还有一个优势是在研究结果的表现上。
不仅有文字,还支持多模态展示,并可点击按钮生成播客式语音讲解,方便随时核实内容。
数字标注悬停时会高亮引用卡片,还能生成语音讲解。PDF 用红色、视频用粉色标记,PDF 可侧边栏直接展开对照。
最后你还可以基于搜索结果生成可互动的研究报告网页,里面除了文字和可视化排版外,他还会搜索对应主题的图片和视频填充进去丰富内容。

说完了这么多交互和产品设计上的创新和优化,我们来看看最核心的搜索结果怎么样。

首先是最近闹得很热的关于娃哈哈宗庆后遗产分配的案子。搜索结果简明梳理了娃哈哈宗庆后遗产案的争议点,按时间线清晰展示事件经过,并分析了后续影响,内容全面且结构清晰。

最近稳定币很火,但是为啥 Web 3 很多国家都在打击,这个东西也是基于 web3 但又好像变合法了,都是不太清楚的。
Gemini CLI 这合并开源贡献者的更新很快啊,发布了超多更新:#ai创造营#

支持音频和视频:现在 Gemini CLI 可以处理音频和视频内容(贡献者:santhoshkumarCodes)。

升级到 Ink 6 和 React 19:底层框架升级,带来更好的性能和兼容性(贡献者:SandyTao520)。

Markdown 文件导入:GEMINI md 文件现在可以通过 @ 导入其他 markdown 文件,方便内容复用(贡献者:bniladridas)。

支持带有 headers 的 Http MCP 服务器:增强了与 MCP 服务器的集成能力(贡献者:aspiers)。

新增 Markdown 表格渲染:可以在 CLI 中更好地显示表格内容(贡献者:heartyguy)。

重构历史记录压缩:优化了历史记录的存储和处理方式(贡献者:scidomino)。

新增 /privacy 命令:允许用户查看和更改隐私设置,提升了隐私管理能力。

增加无限循环保护:为客户端增加了防止无限循环的机制(贡献者:allenhutchison)。

新增 Shades of Purple 主题:为 CLI 增加了新的配色主题(贡献者:ahmadawais)。

支持用 VSCodium 修改:可以直接用 VSCodium 编辑文件(贡献者:psinha40898)。

支持用 Neovim 修改:可以直接用 Neovim 编辑文件(贡献者:yuki-yano)。
上午拿到了小米 AI 眼镜,大概说一下首次体验感受:#ai创造营#

- 颜值还行,脸大点的带上看着好看
- 意外的支持录音,而且支持AI转录和总结
- 看其他测评续航相当给力,只要不连续拍摄视频
- 支持实时翻译,但是不要对质量抱太大希望

上午把眼镜拿去配镜了,眼镜店覆盖还是挺全的。眼镜店拿到后会发给明月眼镜进行镜片安装,所以需要等几天才行,价格还好,我看防蓝光四五百度的基本四五百块钱。
用了几天出门问问刚发布的 AI 语音记录硬件 TicNote #ai创造营#

支持 20 小时连续录制、超长待机 20 天,APP 上的 AI 能力也都很给力

我基本上现在养成语音记笔记的习惯了,有了这个方便很多,一键开启,而且相当稳定不会丢内容。

硬件介绍

打开包装盒之后,你就能看到 TicNote 的产品本体,一个超级薄的卡片。
他们说这玩意只有 29 克,大概只有 iPhone 16 Pro 七分之一,拿在手里基本感受不到重量。
厚度只有三毫米,是 iPhone 16 Pro 的三分之一,大概三张信用卡叠起来差不多。

另外还搭配一个皮质的磁吸卡套,方便吸到 iPhone 或者其他支持磁吸的设备后面。
用我的 13 Pro 和小米 15 试了一下吸力相当不错,使劲甩都不会掉。

最左边是一个模式切换按钮。
默认的时候是扬声器,这个时候 TicNote 会录制周围的声音,适合多人线下会议、讲座&课堂以及采访等形式。
将按钮切换到红色的时候就变成了听筒模式,这个时候他会根据手机的震动来无感录制手机内部的通话声音。
切换的时候右侧会有个小屏幕用不同图标来展示模式和是否在录音。

而且录音是存在卡片本地的,无论跟手机 APP 怎么传输,卡片本身的存储都是最后的保底,可以确保我们的原始音频信息不丢失。

我如何开始录音呢?
你可以长按卡片右侧的按钮,开始录音后卡片会微弱震动,显示屏也会有动画展示,停止录音再次长按就行。
或者你也可以在 APP 里面点击录音按钮开始录音,状态也会在 APP 实时显示。

AI 硬件强的不只是硬件,还有 AI 。

TicNote 支持 120 多个语种和方言,国内主要的方言都能搞定。
在总结的时候它提供了非常多的场景模版,基本覆盖了所有涉及到语音的场景,无论是上课、访谈还是采访、会议都有,支持自定义提示词。

它会帮你自动生成当前录音的思维导图,方便你用非常全面的视角去理解长时间录音的话题的内容。
同时 AI 也会挑选整个语音中他觉得最有价值最有启发的部分,给你生成一个顿悟时刻的文案。

除了前面这几个分析录音本身的内容之外,TicNote 也会用其他信息拓展你们讨论的内容。
首先是会基于你们的聊天内容进行深度研究,根据聊天中提到的信息,进行更多的搜索和进行解释。
腾讯智影 - 腾讯出品!功能超多的一站式云端智能视频创作工具
腾讯智影 腾讯出品!功能超多的一站式云端智能视频创作工具

链接:
https://zenvideo.qq.com/

#Ai工具推荐
录咖AI音视频处理 - AI生成字幕、语音转文字、文字配音、文生视频、视频翻译神器
录咖AI音视频处理 AI生成字幕、语音转文字、文字配音、文生视频、视频翻译神器

链接:
https://reccloud.cn/&utmmedium=uisdc&utmcampaign=ona

#Ai工具推荐
AI降本增效,一开始最好简单粗暴。

差生文具多,如果要做优等生,先得抛弃对工具无休止的追逐。

哪怕是AI博主,也应该回归基本,主动熵减,把日常使用的AI工具控制在 20个以内。

我的工作场景主要围绕AI职场办公,智能体开发和媒体制作。如果按付费意愿,真正会坚持用的会有以下几个:(无广)

1.主力AI模型
GPT+Claude
平替:豆包+文小言(移动版)+kimi
GPT越来越有被Claude替代的趋势,尤其是代码。但是GPTs还是增强了我的使用粘性。豆包的TTS语音国内无法被替代。文小言有一些我喜欢的功能,比如信息聚合订阅。

2.主力IM
飞书
平替:Notion+企微
我知道Notion很强。但是鉴于复杂的操作+国内网络不稳定+数据安全是真不太喜欢用。
创业以来我觉得最值得投入学习时间的并不是任何一款AI软件,而是飞书本身。好的SaaS就是最佳实践的产品化。企微是出于私域+客户对公不得不用。

3.数据分析
Excel+GPT+各平台数据看板
平替:飞书多维表单
Excel没有平替。AI只是帮我解锁高阶功能,比如VBA和宏。多维表单的插件生态值得投入时间学习。

4.设计
Midjourney+ideagram
平替:Canvas+稿定设计+佐糖
比起Mj,Ideagram的出图更具场景感,配合简单工具出海报+商图+封面+运营位都很方便。

5.PPT
PPT+islide插件+彩璇PPT
平替:Gamma,aippt
目前没有同时满足不要钱、支持定制模板、不科学上网、智能还可控性强的方案。但是PPT+islide已经增效超过50%。Gamma是应急神器。
彩璇PPT比较小众,是一个方便做课件分享+编辑的平台,对咨询师/老师有刚需。

6.剪辑
剪映(含AI)+即梦AI
初学者够用,为了省事就用字节系的。

7.文本创作
飞书文档+flomo+GPT
平替:记事本
简单点好。如果开发一个支持flomo api导出直接AI生成标题/思路/文章大纲的工作流会不会有需求?

8.智能体开发
Coze/Dify
平替:百度智能体
目前还在钻研工作流场景。已经做了20多个Bot。Coze/Dify各有千秋,百度则是打通了支付环节和数字人形象的交互。待继续钻研好和大家分享。

9.代码辅助
Cursor+Claude
平替:字节豆包Marscode

10.工作流编排
Coze+飞书+各类Github(开源项目)
通过飞书机器人平台把各类BOT接入到飞书群里。实现在IM办公软件中使用自己调试过的AI数字员工。

#AI工作流
阿里又tm 整了个大活,输入图片和音频就可以生成富有表现力的视频,并且嘴型是可以跟声音匹配的。#ai视频#

支持多语言、谈话、唱歌以及快语速的适配,这玩意又是一个造假利器,这下可能很多名人真要说“不是我说的,你别瞎说”了。

可以根据输入视频的长度生成任意持续时间的视频。

实现方式:

该方法主要分为两个阶段。第一阶段是“帧编码”阶段,在这个阶段,我们使用 ReferenceNet 来从参考图像和运动帧中提取特征。随后进入“扩散过程”阶段,在这一阶段,一个预先训练好的音频编码器用于处理音频数据的嵌入。此外,面部区域的掩码与多帧的噪声数据结合在一起,用于引导面部图像的生成过程。

紧接着,我们使用 Backbone Network 来执行去噪处理。在 Backbone Network 中,我们运用了两种关键的注意力机制:一种是基于参考图像的“参考注意力(Reference-Attention)”,另一种是基于音频的“音频注意力(Audio-Attention)”。

这两种机制对于确保角色的面部特征保持一致和调整角色的面部运动至关重要。最后,我们还利用了时间模块来调节图像的时间维度,使角色的运动速度得以调整。这些组合在一起构成了我们的整体框架。

项目地址:网页链接歸藏的AI工具箱的微博视频
一个猜测,Open AI在Tiktok发布的这些Sora视频的配音和配乐是不是也是某个模型自动匹配和生成的?#ai视频##sora#

提示:“一位 F1 车手白天在旧金山的街道上比赛,头盔摄像头捕捉到了车手的视角。远处可以看到金门大桥和城市景观,蓝天和阳光照亮了场景。驾驶员熟练地操纵汽车,在弯道上超越了汽车。” 歸藏的AI工具箱的微博视频
今天整理的 AI 工具里,有两个是尝试打通 ChatGPT 和 MidJourney 技术栈、摸索交叉领域的。一个是宠物定制画册、一个是生成多幕故事和配图;在 AIGC 领域,还有一个推荐和补全台词的产品,以及一个多语言翻译+配音+字幕的视频工具产品。每天都能够越来越强烈的感觉到,内容领域里新的工作流程正在逐渐成形。我司的短视频工作流也即将完成技术验证,进入产品化阶段。希望可以在这轮工业革命中冲一冲浪。

本日AI工具清单更新如下:

****MakeMyTale****
功能:通过 prompt 生成多幕的故事和配图。
标签:#AIGC #分幕脚本制作
推荐:🌟🌟🌟
地址:https://makemytale.com/

****Translate.video****
功能:自动化视频的字幕、翻译、多语言配音流程。
标签:#视频制作 #AI配音 #AI翻译
推荐:🌟🌟🌟🌟
地址:https://www.translate.video/

****Fobizz****
功能:线上教学辅助工具,提效课件准备、赋能师生互动。
标签:#在线教育
推荐:🌟🌟🌟
地址:https://tools.fobizz.com/

Noise Eraser
功能:减少视频或音频中的噪音。
标签:#音频编辑
推荐:🌟🌟
地址:https://eraserapp.dwave.cc/

****Your Own Story Book****
功能:根据选定脚本,以用户宠物为主人公制作故事画册。支持交付实体书。
标签:#AIGC #分幕脚本制作
推荐:🌟🌟🌟
地址:https://www.yourownstorybook.com/

****Cogram****
功能:根据沟通类型,自动完成会议纪要、总结待办事项等。
标签:#会议纪要
推荐:🌟🌟🌟
地址:https://www.cogram.com/

****Celebrity Voice Changer AI****
功能:变声为名人。
标签:#变声器
推荐:🌟🌟
地址:https://celebvoice.my.canva.site/

****Datature****
功能:高效搭建计算机视觉的工作栈。
标签:#开发工具 #计算机视觉
推荐:🌟🌟🌟
地址:https://celebvoice.my.canva.site/

****Superflow Rewrite****
功能:基于浏览器的网页内容改写。
标签:#改写 #AB测试
推荐:🌟🌟
地址:https://www.usesuperflow.com/rewrite-chatgpt

****AI Screenwriter****
功能:根据大纲及上下文自动补充角色台词。
标签:#分幕台词
推荐:🌟🌟🌟🌟
地址:https://aiscreenwriter.com/

****PostalAI****
功能:根据 prompt 制作明信片。
标签:#AI绘图
推荐:🌟
地址:https://postalai.co/generateImage
 
 
Back to Top