关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
Gemini 拉片流程终于完整了!!

用 Claude 写了一个小工具输入对应的时间节点,可以一次性将所有分镜直接剪辑出来。

整个流程会由 Gemin 生成的分镜拆解(画面内容、台词、翻译、隐喻)搭配对应分镜的时间戳、Claude 剪辑命令生成工具组成。
Runway CEO 是这波 AI 视频所有公司中想的最清楚的一个。

其他产品都是模型是模型产品是产品,像是出现 bug 的机器人,左脚画圆右脚踢。

短时间的领先与否并没有那么重要,核心是不下牌桌,现阶段的所有(产品功能、用户、数据、模型)都是下一阶段的基石。

重要的是能否预测到下一阶段的风浪并在这个阶段完成准备。

回到他昨晚发的内容本身。

现代图形学是先解决了控制问题再解决的渲染质量问题。

AI 发展则反其道而行之,先端到端的解决了渲染质量问题,我们面前的是控制问题。

正如计算机图形学最终解决了渲染问题,AI 也一定能解决控制问题。

核心不是是否可以解决,而是我们准备如何解决。

AI 生成内容是否能够提供与传统计算机图形学同等水平的可预测性和精确性,这正是 AI 生成内容能否成为创意表达基础工具的关键所在。

我们的目标是实现实时、低成本,并且具备尽可能直观和通用的精确控制能力。

这一次,控制能力虽然最后才能实现,但它终将到来。
笑死 Runway CEO 点赞了
今天卡兹克发的帝帝那个可以让 Claude 获得类似 O1 思维链的提示词太强了。

再一次证明了随着模型能力的提高,提示工程的重要性也会越来越高。

绝对不是模型越厉害提升工程越不重要。

我用这个提示词思考 AI 生成视频模型和传统图形科学的异同,它得出了和 Runway CEO 类似的结论。

另外不建议折叠 Claude 的思考过程,他的思考路径和方向往往比结论更有价值
宠物狗会不会就是人类的未来。

只要有人养,就衣食无忧了。
只是代价是,放弃繁殖。

人类现在正有一批 LGBT 在提前布局。只等 AI 机器人崛起后,去领养他们了。

可能所有选择都是对的。
OpenAI o1做到了LLM在线推理的scale-up,其实这样的inference-time scale-up也是机器人领域新趋势。

⭐️我们暑假开始做的工作👉DIAL-MPC这套基于扩散模型(Diffusion Models)的方法也实现了机器人在线推理的scale-up (之前的强化学习可以说都是在做离线的scale-up)

很高兴我们的工作受到了很多顶尖实验室(CMU,斯坦福,CalTech)和硅谷机器人公司(DeepMind, NVIDIA)的广泛关注和初步应用
和我碰个小拳拳,你就是我的朋友啦
AI探索指南
秉承Build in Public,分享下使用Cursor实战开发一个前后端分离的网站的经验,希望对大家有帮助,有问题评论区留言,我看到会回复 1.明确技术栈 Cursor中模型我选的是cluade 3.5 sonnet,openai用过就知道根本没法比。拿到一个需求,首先让claude推荐能实现这个需求的技术栈,然后在cursor setting全局配置中的Rules(图1)和项目根目录的.cursorrules中包含对应的技术栈,这个网页中有很多cursorrule的模版,我就是在里面找的https…
首页组件我要求包括但不限于:1.Hero 2.cta 3.faq 4.how it works....”
6.最重要的一点,你和cursor对话的时候通常会开多个聊天框(看图4右侧滑动按钮我完成这个项目开了多少聊天框),一个聊天框聊的东西多了就特别容易抽风,怎么保持让cursor的记忆同步呢?
每聊完一个聊天框,你要开启新聊天框的时候,就和cursor说:“请你回顾我们前面全部对话,总结更新我的项目架构文件,供未来别的开发人员使用“
7.总结:
cursor很强大,也很弱,取决于你会不会使用。
我前端是用next.js,后端用python,中间还涉及一些我从来没有接触过的服务器,命令行等运行命令。你一定要把前提和背景告诉cursor,举个简单的例子,我要在hugging face space上部署项目,但是发现服务器启动的时候日志疯狂报错,你千万不要直接把报错日志丢给cursor,这样子解决不了问题,你要这样说:“这是我部署到hugging face space服务器的时候的错误日志,请你看一遍,然后你告诉我可能是哪里出了问题,需要我提供哪些代码文件给你,我嗯先不急着写代码,先一起讨论下”
希望对大家有帮助,以后还会继续分享我在实战中使用cursor的经验。我是完全0代码基础,我可以,你一样可以,不要对未知的技术畏惧,不懂的就耐心去问cursor
Fr1_-H_kv4bMob7p1cNSzANZeKN_v3.png
159.3 KB
秉承Build in Public,分享下使用Cursor实战开发一个前后端分离的网站的经验,希望对大家有帮助,有问题评论区留言,我看到会回复
1.明确技术栈
Cursor中模型我选的是cluade 3.5 sonnet,openai用过就知道根本没法比。拿到一个需求,首先让claude推荐能实现这个需求的技术栈,然后在cursor setting全局配置中的Rules(图1)和项目根目录的.cursorrules中包含对应的技术栈,这个网页中有很多cursorrule的模版,我就是在里面找的https://cursor.directory/
2.设计架构,逐一实现(图2)
就和写作文一样,你要先写一个大纲,然后根据大纲填入对应的内容
千万别上来就和cursor说我要你帮我实现一个文生图网站,人工智能不是神。
你就是架构师,cursor就是程序员,我通常会这样对cursor说:“好的,让我们一起来实现这个需求。你先把整体的架构列给我,先不要写代码”
然后cursor列出架构后,你根据自己的需要,增加或者减少
3.遇到报错保持耐心,运用好command+回车(macOS, windows我不知道是什么)
command+回车在cursor里面是可以让cursor阅读你当前项目的全部文件。像我这次项目代码特别多,光api的文件就7个还是8个。(图3)
我举个例子,比如有生成图片api,生成音频api,提取pdf文件api,如果你添加了某个功能代码开始报错或者进行本地调试怎么都运行不了,你可以这样子和cursor说:”现在我们遇到了一个报错,控制台日志如下:xxxx,你先不要急着写代码,先分析下可能是哪些文件中的代码出了问题,告诉我需要提供代码的文件,你再修改”
4.如果遇到要修改现有文件的代码,一定一定要给cursor这个提示:“先阅读一遍我目前的代码,再进行修改”,你不这样说,cursor可能不知道你目前代码的结构,把你关键功能直接改没了都可能
5.前端页面如何快速实现?
你可以选择上v0.dev或者别的文生图,生成一个界面的图片,再发给claude让你复刻。我对界面没什么要求,我就是这样提示cursor的:“我们的网站主题是ai播客生成,我希望整体的设计风格是充满活力和激情的,请你以此基础发挥想象力设计我的ui界面。
土耳其老师根据学生未来想成为的职业,生成对应职业的 AI 照片打印出来给他们。

Invalid media: video
我的第一个产品:Ai播客生成器现在上线了!
地址 https://mypodmates.com/
这是一个你可以放入PDF或网页,自动生成双人对话的播客。你会看到有两个ai机器人在对你输入的内容进行聊天和讨论
核心内容:
1.PDF分析:目前最高支持上传15-20页,5M以内的文件
2.网页分析:上传网页链接,分析网页内容
3.问题导向:可以输入你想重点聊的话题,比如放入一篇关于苹果简介的pdf文档,想重点关注苹果的生产地有哪些,播客内容会重点围绕这部分
待提升:
1.目前只支持英文,多语言(包括中文)未来可能放入,主要看用户反馈,不知道中文需求多不多
2.语音生成能力待提高:现在已经找到了更好的语音生成模型和解决方案,打算先收集一下用户反馈
3.PDF更长的文件支持

由于成本问题,我自己也是今年刚毕业,没什么储蓄,所以目前新用户免费赠送2次生成音频的额度,如果有更多的使用需求欢迎付费。关于产品的任何反馈或者疑问也欢迎向我提出

最后感谢:
GitHub开源库:https://github.com/meta-llama/llama-recipes
感谢豆哥的社群技术支持@艾逗笔
感谢飞哥的社群seo支持@哥飞
还有感谢一些路上为我排忧解难的朋友,太多了就不一一艾特了。
Bolt New 的产品和销售数据出来了!

- 4周时间,从0到400万美金的 ARR!
- 使用的 Claude API 消耗量每天翻倍式增长
- 每周有十万人持续使用

这种爆发式的增长,核心是因为它解决了一个一直以来的行业难题:
Web 是世界上使用最广泛的平台,但开发者却无法在浏览器中构建 Web 应用。
通过开创性的 WebContainers 技术和先进的 AI Coder 解决了这个问题。

Bolt 认为未来人人都是开发者,十亿级别的开发者!
一个现实的例子是,一位用户在 Upwork 上获得了 5000 美元的报价和 2-3 个月的时间来打造她的 MVP。几天后 Bolt 发布,她购买了 50 美元/月的计划,并在不到 2 周的时间内构建并推出了她的产品。

引用链接:https://www.anthropic.com/customers/stackblitz
人形机器人什么时候来陪我散步,跟我 deep talk
我回来了~

因为一连贯的原因,在去年11月脱离了AI这股浪潮
甚至为了节约精力,主动切割了和这个行业的联系

期间的忙碌和疲惫尚可切磋,但时不我与的感觉可真不好受
沉舟侧畔千帆过,不是沉舟竟过千帆,而是千帆已过,你却陷于沉舟

好在还有病树床头万木春的下半场,还能有杯酒长精神的意气
重新入学,重新开始,马丁3.0

顺便,谁能告诉我,最近一年,AI最大的进展是啥?
除了字节杀入了几乎所有领域以外(这一年里最放不下我的就是字节的猎头了)
字节的通用图像编辑模型 SeedEdit 发布了。之所以说是编辑模型,因为可以基于刚刚生成的图片改图,包括修图、换装、美化、转化风格、在指定区域添加删除元素等各类编辑操作。

跟普通的编辑最大的区别是自然语言交流。我试用了一下,相当顺畅。自然语言驱动的编辑在业内还是少见的,尤其考虑到豆包本就是目前最有影响力的 AI 通用产品之一,这次可能会真的影响很多人设计的方式。

我之前用 Midjourney,跟很多朋友一样,急迫需要连贯性一致性的绘制形式,可以满足长篇的连贯的设计表达,比如做出有同个主人公的漫画、同类海报的不同呈现等等。

在豆包的官网 doubao.com 能体验到,大家可以试试看。
Back to Top