关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
我很少公开分享和 AI 相关的想法,因为这个领域变化得太快了,所有的想法都显得粗糙和仓促:

1、对话依然是目前 AI 最通用的交互方式。功能套壳用起来很爽很高效,但目前只有对话这个交互形式才能延伸出其他的可能用法。
2、场景让对话更有生产力。场景最重要的是为对话引入了环境上下文。
3、现在做个 AI 应用,应该在场景引入对话、还是在对话中开启场景?比如 Notion AI、Cursor 是前者,ChatGPT Canvas 和 Claude Artifact 很自然地选择了后者…
OpenAI 今天推出了 ChatGPT 的新功能 Canvas 画布!
简单说就是抄了 Claude 的 Artifacts...
但是又青出于蓝,抄的非常好,好的不像 OpenAI
这可能是 ChatGPT 的产品团队第一次做出令人惊艳的新功能

范式的新变化!
模型角色从「助理」转变为新角色「创意伙伴」,新增能力如下:
- 知道如何打开画布并进行写作和编程
- 生成多样化的内容类型
- 有针对性的编辑内容
- 重写文档
- 提供文内点评
总结一下,终于不再拘泥于 Chat 交互,让人和机器可以通过打开画板进行视觉交流了!

问题来了,为什么国内没人抄呢?
还是因为模型能力不够
claude artifacts 模型的能力国内模型仍在追赶
4o with canvas 模型甚至是通过蒸馏 o1 得到的
这其中三个挑战:
第一个最关键的挑战是,「定义什么时候打开画布」
第二个挑战是「如何针对性修改而不是完全重写」
第三个挑战是「让模型生成高质量的点评」
未来仍须努力...
bolt. new 太强了,小白福音这玩意。

让他生成了一个 todo 应用,刚开始功能还行,但是有点丑。

我就让他更换Tailwind UI,结果一步到位。

然后又给了一张设计稿让它按照图片的界面开发,也搞定了,中间没有任何修改。

注意:不要使用 Arc 浏览器体验,有 Bug。
终于有个产品把 AI 代码生成这一套做全了。

StackBlitz 推出 bolt. new,可以看作 Artfacts、V0 和 Replit 的结合体。

支持提示、编辑、部署的全栈流程;
带有完整的开发环境;
可以实时预览生产结果。

最重要的是免费。
为什么 AI 播客的范式一定是未来?
我找到了 NotebookLM 最早在今年5月 Google IO 大会的官方演示,看完就知道这一定是未来的形态。
因为 AI 播客,听众可以随时 JOIN!
你可以随时向主播提出任何问题
你甚至可以引导主播谈论问题的倾向
内容消费的下一个形态,就是用户直接偏好的实时内容生成。
耐心看完,不是我吹,这TM就是未来。
这种互动式的内容生成范式是未来,但不一定是播客,也许还是视频,视频就是声音做好之后加个图像模态而已。

Invalid media: video
我可以算是AI的极端拥戴者了,即便如此,我也非常谨慎于AI批量生产垃圾的能力,智能化的用途很广,给互联网增加过剩其实是最没价值的方向。

而且AI生产出来的东西,有点遵循「一旦它涉足了你正好熟知的领域」的规律,如果没有专业的主控者,就只能被门外汉看来「不明觉厉」,实际上全是能够被一眼看穿的纰漏。

说得更直白点,AI的定位始终是副驾驶,如果使用者开车技术不行,就根本做不出达到交付标准的内容出来。

NotebookLM这波就是典型的震惊体,很多人会觉得播客又被颠覆了,普通人随便弄半个小时就能生成上架一档完整的播客,这还得了,要变天了⋯⋯

但会这么认为的人,其实根本不懂播客,播客是最没工业化批量生产容身之地的行业,这里既没有流量补贴的玩法,内部的竞争程度得也够卷,商业变现的逻辑更是跟着人设走的,拿AI预制菜去跑马圈地,除了徒增服务器负载之外,除了取悦自己之外,没有任何意义。

AI的总结也是,如果是用于自己的研读学习,可能问题不大,但是交付到全网,那股异味就怎么都挥之不去,尤其是比如我这种天天和文字打交道的,对于AI总结的无效堆砌和信息丢失简直太敏感了,属于卒读即会破坏我自身文本系统的做法,代价太高了。

换位思考,我也能够理解画手群体对于AI绘画的「尸块」评价,虽然这里面确实有着对饭碗被砸的恐慌,但在他们眼里,AI作品的糊弄性是很强的,一般人跑图觉得自己也能画东西了是一码事,让专业艺术家去接受审美降级又是另一码事。

我前几天跟人说,我对AI的使用,是在交付上零容忍,在兴趣上无上限,什么意思呢,就是在我懂和擅长的领域,比如写给你们看的成品里,没有任何AI的成分,但在我自己是外行的领域,且并不指望拿来交付,只为玩票体验,比如用Midjourney画点东西,用Runway跑跑视频,我对AI是完全拥抱的,同时不会把它交付到垂直社区里增进污染。

这也是我对AI的使用原则,它应该成为扩大人类外延的工具,而不是替换掉人类的训练结果。

当然了,在工作过程里利用AI能力则是另一种场景,不在上述评判当中。
NotebookLM 爆火全网,而我们做出了个中文版!!!

两周前我写了一篇文章介绍了近期最棒的 AI 应用 NotebookLM,最近这个产品越来越火...
连 AI 界的大神 Andrej Karpathy 都制作了10 集的新播客「神秘历史」,并发布到了 Spotify。

NotebookLM 虽好,但目前功能还很局限,目前既不支持中文,也不支持更换主播,非常遗憾。于是 Orange AI 和朋友们在国庆期间搞了个小黑客松,直接做出了 NotebookLM 的中文版。那做好的效果如何呢?我姑且放了一期上来,聊聊最近爆火的中国股市,强烈推荐大家体验:

这套 AI 中文播客工作流,不仅听起来效果不错,而且使用体验极致优雅:
输入任何话题或文章——调用 AI 搜索——自动生成多人 AI播客
- 做一期播客只要2分钟!
- 支持任何话题!
- 支持任何语言!

Invalid media: video
Open AI 终于对前端界面代码生成下手了。

我之前说过目前让 LLM 生产或者解决界面或者交互设计的问题不现实。

因为 LLM 没有那么多 UI 界面数据的训练,也不知道很多美学和体验知识。

Coframe 为了解决这个问题跟 Open AI 合作对 GPT-4o 视觉模型做了微调。

微调后的模型生成的界面在美学表现和视觉语言遵循上好了非常多。

详细介绍:www.coframe.com/post/coframe-works-openai-to-develop-first-of-its-kind-ui-code-generation
一个简单的总结提示,挺好用的,试着总结了一下Anthropic 联合创始人的访谈,还行。

你是一个总结者。您将使用以下步骤对输入进行总结:

1.) 分析输入文本并生成 5 个基本问题,回答这些问题后,即可抓住文本的要点和核心含义。

2.)提出问题时:
a. 讨论中心主题或论点
b. 确定关键支持思想
c. 突出重要事实或证据
d. 揭示作者的目的或观点
e. 探索任何重要的含义或结论。

3.) 逐一详细地回答提出的所有问题。

来源:www.reddit.com/r/LocalLLaMA/comments/1ftjbz3/shockingly_good_superintelligent_summarization/
Open AI 开源了一个新的 Whisper turbo 模型。

这是 Large v3 模型的蒸馏模型
运行速度提升了8倍
显存 (VRAM) 使用效率提高了40%
准确度仅有微小降低

太猛了,在使用Whisper的服务可以替换了。

这里尝试新模型:huggingface.co/spaces/hf-audio/whisper-large-v3-turbo
FnXUg8aRzuY8nCkHSCtwAsqavTACv3.png
265.2 KB
机场的机器人小分队,出击!
编程门槛是真的低了,16岁的香港学生。

用Cursor和V0做了一个可以在图片主体后加文字的工具。

文字可以进行非常详细的自定义,比如字体、位置、大小、颜色等。

而且还带谷歌登录的。

这里尝试:textbehindimage.rexanwong.xyz
明天prompt:不可能三角
Back to Top