关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
卧槽,来了Meta发布Meta Movie Gen视频音频生成模型系列,剪辑模型也太牛了。

具体包括:

Movie Gen Video:30B DiT 模型,单个文本提示生成高质量、高清晰度的图像和视频。

Movie Gen Audio:13B transformer模型,可以接受视频输入以及可选的文本提示用于可控性,生成与视频同步的高保真音频。

Personalized videos:使用生成或现有视频以及附带的文字说明作为输入,可以执行本地化编辑,如添加、删除或替换元素。

详细信息:https://ai.meta.com/research/movie-gen/
转行AI,花了2个月踩了无数坑开发的基于草台班子vast.ai的调度平台终于稳定运行了,相同性能的GPU机器相比AWS最多可节省95%的成本,同时机器的进出带宽也不计费或几乎不计费,配合Cloudflare的Worker和免费CDN,实现了极其便宜的边缘计算、极其便宜的推理服务器和极其便宜的流量带宽,大部分AI场景都可以节省一半以上的综合费用,特别适合成本敏感的个人开发者和小团队。第一次在生产环境大规模使用Cloudflare,把它们家的产品几乎都摸了一遍,踩了不少坑,cf填坑的速度也很快,肉眼可见地在优化。对cf非常看好,打算定投他们家股票了。另外推理服务用的框架是开源的litserve,经受住了考验,也感谢一下他们。
AI 播客新进展!
目前 NotebookLM 最好用的中文平替
URL--播客--小宇宙
1.输入 URL
2.生成中文播客
3.发布到小宇宙
一站式丝滑完成。。。

群友作品,已经开源
https://github.com/lihuithe/podlm-public
我梦想中的 IDE 竟然真的有人做出来了

Canvas 只能展示 code,不能 preview
Cursor 和 V0 可以展示 code,但只能 preview,不能部署
Replit 只能部署
而 Bolt,可以提供写代码、preview、部署网站一条龙服务...

从需求确定到网站上线,端到端都可以搞定。
快速做 POC 几分钟就出来没问题,要做生产级应用就人类一起上改代码。
进退灵活,丰俭由人。

Bolt 野心很大,要解决的问题也最多。
但是非常看好,这就是「人人都是程序员」时代所需要的 IDE。

Bolt 体验地址请收藏
https://bolt.new
刚刚部署的网站网址在此
https://incandescent-basbousa-a772cb.netlify.app
我很少公开分享和 AI 相关的想法,因为这个领域变化得太快了,所有的想法都显得粗糙和仓促:

1、对话依然是目前 AI 最通用的交互方式。功能套壳用起来很爽很高效,但目前只有对话这个交互形式才能延伸出其他的可能用法。
2、场景让对话更有生产力。场景最重要的是为对话引入了环境上下文。
3、现在做个 AI 应用,应该在场景引入对话、还是在对话中开启场景?比如 Notion AI、Cursor 是前者,ChatGPT Canvas 和 Claude Artifact 很自然地选择了后者…
OpenAI 今天推出了 ChatGPT 的新功能 Canvas 画布!
简单说就是抄了 Claude 的 Artifacts...
但是又青出于蓝,抄的非常好,好的不像 OpenAI
这可能是 ChatGPT 的产品团队第一次做出令人惊艳的新功能

范式的新变化!
模型角色从「助理」转变为新角色「创意伙伴」,新增能力如下:
- 知道如何打开画布并进行写作和编程
- 生成多样化的内容类型
- 有针对性的编辑内容
- 重写文档
- 提供文内点评
总结一下,终于不再拘泥于 Chat 交互,让人和机器可以通过打开画板进行视觉交流了!

问题来了,为什么国内没人抄呢?
还是因为模型能力不够
claude artifacts 模型的能力国内模型仍在追赶
4o with canvas 模型甚至是通过蒸馏 o1 得到的
这其中三个挑战:
第一个最关键的挑战是,「定义什么时候打开画布」
第二个挑战是「如何针对性修改而不是完全重写」
第三个挑战是「让模型生成高质量的点评」
未来仍须努力...
bolt. new 太强了,小白福音这玩意。

让他生成了一个 todo 应用,刚开始功能还行,但是有点丑。

我就让他更换Tailwind UI,结果一步到位。

然后又给了一张设计稿让它按照图片的界面开发,也搞定了,中间没有任何修改。

注意:不要使用 Arc 浏览器体验,有 Bug。
终于有个产品把 AI 代码生成这一套做全了。

StackBlitz 推出 bolt. new,可以看作 Artfacts、V0 和 Replit 的结合体。

支持提示、编辑、部署的全栈流程;
带有完整的开发环境;
可以实时预览生产结果。

最重要的是免费。
为什么 AI 播客的范式一定是未来?
我找到了 NotebookLM 最早在今年5月 Google IO 大会的官方演示,看完就知道这一定是未来的形态。
因为 AI 播客,听众可以随时 JOIN!
你可以随时向主播提出任何问题
你甚至可以引导主播谈论问题的倾向
内容消费的下一个形态,就是用户直接偏好的实时内容生成。
耐心看完,不是我吹,这TM就是未来。
这种互动式的内容生成范式是未来,但不一定是播客,也许还是视频,视频就是声音做好之后加个图像模态而已。

Invalid media: video
我可以算是AI的极端拥戴者了,即便如此,我也非常谨慎于AI批量生产垃圾的能力,智能化的用途很广,给互联网增加过剩其实是最没价值的方向。

而且AI生产出来的东西,有点遵循「一旦它涉足了你正好熟知的领域」的规律,如果没有专业的主控者,就只能被门外汉看来「不明觉厉」,实际上全是能够被一眼看穿的纰漏。

说得更直白点,AI的定位始终是副驾驶,如果使用者开车技术不行,就根本做不出达到交付标准的内容出来。

NotebookLM这波就是典型的震惊体,很多人会觉得播客又被颠覆了,普通人随便弄半个小时就能生成上架一档完整的播客,这还得了,要变天了⋯⋯

但会这么认为的人,其实根本不懂播客,播客是最没工业化批量生产容身之地的行业,这里既没有流量补贴的玩法,内部的竞争程度得也够卷,商业变现的逻辑更是跟着人设走的,拿AI预制菜去跑马圈地,除了徒增服务器负载之外,除了取悦自己之外,没有任何意义。

AI的总结也是,如果是用于自己的研读学习,可能问题不大,但是交付到全网,那股异味就怎么都挥之不去,尤其是比如我这种天天和文字打交道的,对于AI总结的无效堆砌和信息丢失简直太敏感了,属于卒读即会破坏我自身文本系统的做法,代价太高了。

换位思考,我也能够理解画手群体对于AI绘画的「尸块」评价,虽然这里面确实有着对饭碗被砸的恐慌,但在他们眼里,AI作品的糊弄性是很强的,一般人跑图觉得自己也能画东西了是一码事,让专业艺术家去接受审美降级又是另一码事。

我前几天跟人说,我对AI的使用,是在交付上零容忍,在兴趣上无上限,什么意思呢,就是在我懂和擅长的领域,比如写给你们看的成品里,没有任何AI的成分,但在我自己是外行的领域,且并不指望拿来交付,只为玩票体验,比如用Midjourney画点东西,用Runway跑跑视频,我对AI是完全拥抱的,同时不会把它交付到垂直社区里增进污染。

这也是我对AI的使用原则,它应该成为扩大人类外延的工具,而不是替换掉人类的训练结果。

当然了,在工作过程里利用AI能力则是另一种场景,不在上述评判当中。
NotebookLM 爆火全网,而我们做出了个中文版!!!

两周前我写了一篇文章介绍了近期最棒的 AI 应用 NotebookLM,最近这个产品越来越火...
连 AI 界的大神 Andrej Karpathy 都制作了10 集的新播客「神秘历史」,并发布到了 Spotify。

NotebookLM 虽好,但目前功能还很局限,目前既不支持中文,也不支持更换主播,非常遗憾。于是 Orange AI 和朋友们在国庆期间搞了个小黑客松,直接做出了 NotebookLM 的中文版。那做好的效果如何呢?我姑且放了一期上来,聊聊最近爆火的中国股市,强烈推荐大家体验:

这套 AI 中文播客工作流,不仅听起来效果不错,而且使用体验极致优雅:
输入任何话题或文章——调用 AI 搜索——自动生成多人 AI播客
- 做一期播客只要2分钟!
- 支持任何话题!
- 支持任何语言!

Invalid media: video
Open AI 终于对前端界面代码生成下手了。

我之前说过目前让 LLM 生产或者解决界面或者交互设计的问题不现实。

因为 LLM 没有那么多 UI 界面数据的训练,也不知道很多美学和体验知识。

Coframe 为了解决这个问题跟 Open AI 合作对 GPT-4o 视觉模型做了微调。

微调后的模型生成的界面在美学表现和视觉语言遵循上好了非常多。

详细介绍:www.coframe.com/post/coframe-works-openai-to-develop-first-of-its-kind-ui-code-generation
Back to Top