关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
视频批量分割工具

用 Bolt 写了一下,直接上线了,有类似需求的可以试试。

输入剪辑时间节点后会生成 FFmpeg 命令。

Bolt 才是小白的神器啊,编写、Debug、部署一条龙。

有需求的话我写个文章体系化介绍一下整个 AI 短片分析工作流。

这里尝试:https://gentle-otter-c63b0f.netlify.app/
🤨 神级 Prompt 其实没那么神(刚好算是个合适的话题,蹭蹭热度哈哈)
早上看到卡兹克写的《17 岁高中生写了个神级 Prompt》,说是 claude 用了后,甚至能像素级复刻 Flappy Bird(视觉效果简直无敌),心想还能这样?
——————
💬 我也对比测试了,先说结论:
1. 不少人觉得“神”,其实是 Claude 3.5 sonnet new 神。全球顶级大模型,你不用这段 Prompt 依然也可以生成神级回复
2. 我没法用“神” prompt 复刻出像素级高仿的 flappy bird,神 Prompt 吹的有点过了

👉 你可以再想想,用了以后感觉生成质量好了,到底是:
1. 你对生成结果本身没有预期,对此本身就不了解,只是玩玩而已?
2. 你没用过几次 claude 3.5 sonnet new ,所以不知道裸 claude 本身就已经这么强了?

要不,选些你所专业的领域任务,先想好你要什么结果,再试试呢?

🔬以下是我的测试结果:
P1 是文中的宣传效果,P2 是我神 Prompt 实际测试效果,P3 是不用神 Prompt 的直接提示效果

事实证明,不需要额外提示词,Claude 已经足以完美实现游戏机制的复刻。但对复杂视觉元素的设计,不是一段提示词能解决的。

文章应该是进行了选择性宣传。实际想实现这个效果,大概率是需要单独把设计资源链接告诉 AI,让它进行引用的。
——————
不过,对于普通用户来说,如果把这个 prompt 预置在 chatbot 中,确实能在简单场景中是可以用更少的 input ,获得更“好”更长的输出,主要适合:
1. 在用户不熟悉的领域给予思考启发
2. 帮助用户做一些没那么高标准要求的事情

不过说实话,这种场景下,你让 AI “针对 xx,再 step by step 反思优化一下”,也能满足预期了

——————
鼓励大模型进行 CoT 思考确实能获得不一样的输出效果,这是一个很实用的技巧。但目前不存在能够让大模型成为全能专家的通用型 CoT 提示。

如果说,“我觉得这 Prompt 真是神了”,大概率是因为用户本身也不熟悉该任务领域,对生成的结果没有自己的高预期标准。
Sam Altman发了条言简意赅的推文:there is no wall。

终于还是被推出来回应大模型预训练陷入瓶颈的行业恐慌了。

清理了一下时间线,大致上是这样的:

- The Information率先报道,OpenAI因为GPT系列模型的进化速度放缓,调整了公司战略,GPT-5难产已成定局;

- Bloomberg随后助攻,把采写范围扩大到了OpenAI、Googe和Anthropic三家公司,发现新版模型全在推迟发布,可以看到收益递减曲线;

- AI社区此时普遍还认为媒体报道有失公允,觉得没有核心从业者出来证言,只是搜集了边角料想搞个大新闻而已,大家不要慌,「且听龙吟」;

- 然后从OpenAI出局的前首席科学家Ilya Sutskever刚好跳出来补刀,对路透社判断大模型扩展法则确实已经到达了极限,必须改变训练模式;

- Meta的首席科学家、图灵奖得主Ynn LeCun也没放过攻击闭源竞争对手的机会,在Threads上表示「我不想说我早就告诉过你,但我确实早就告诉过你」;

- Anthropic的创始人Dario Amodei在播客里安抚市场,认为预训练的扩展法则(Scaling Laws)来自经验而非客观规律,但自己会押它仍然会继续存在;

- 再就是两个小时前,Sam Altman现身喊话,说物理学不存,不对,是墙不存在。
Gemini 拉片流程终于完整了!!

用 Claude 写了一个小工具输入对应的时间节点,可以一次性将所有分镜直接剪辑出来。

整个流程会由 Gemin 生成的分镜拆解(画面内容、台词、翻译、隐喻)搭配对应分镜的时间戳、Claude 剪辑命令生成工具组成。
Runway CEO 是这波 AI 视频所有公司中想的最清楚的一个。

其他产品都是模型是模型产品是产品,像是出现 bug 的机器人,左脚画圆右脚踢。

短时间的领先与否并没有那么重要,核心是不下牌桌,现阶段的所有(产品功能、用户、数据、模型)都是下一阶段的基石。

重要的是能否预测到下一阶段的风浪并在这个阶段完成准备。

回到他昨晚发的内容本身。

现代图形学是先解决了控制问题再解决的渲染质量问题。

AI 发展则反其道而行之,先端到端的解决了渲染质量问题,我们面前的是控制问题。

正如计算机图形学最终解决了渲染问题,AI 也一定能解决控制问题。

核心不是是否可以解决,而是我们准备如何解决。

AI 生成内容是否能够提供与传统计算机图形学同等水平的可预测性和精确性,这正是 AI 生成内容能否成为创意表达基础工具的关键所在。

我们的目标是实现实时、低成本,并且具备尽可能直观和通用的精确控制能力。

这一次,控制能力虽然最后才能实现,但它终将到来。
笑死 Runway CEO 点赞了
今天卡兹克发的帝帝那个可以让 Claude 获得类似 O1 思维链的提示词太强了。

再一次证明了随着模型能力的提高,提示工程的重要性也会越来越高。

绝对不是模型越厉害提升工程越不重要。

我用这个提示词思考 AI 生成视频模型和传统图形科学的异同,它得出了和 Runway CEO 类似的结论。

另外不建议折叠 Claude 的思考过程,他的思考路径和方向往往比结论更有价值
宠物狗会不会就是人类的未来。

只要有人养,就衣食无忧了。
只是代价是,放弃繁殖。

人类现在正有一批 LGBT 在提前布局。只等 AI 机器人崛起后,去领养他们了。

可能所有选择都是对的。
OpenAI o1做到了LLM在线推理的scale-up,其实这样的inference-time scale-up也是机器人领域新趋势。

⭐️我们暑假开始做的工作👉DIAL-MPC这套基于扩散模型(Diffusion Models)的方法也实现了机器人在线推理的scale-up (之前的强化学习可以说都是在做离线的scale-up)

很高兴我们的工作受到了很多顶尖实验室(CMU,斯坦福,CalTech)和硅谷机器人公司(DeepMind, NVIDIA)的广泛关注和初步应用
和我碰个小拳拳,你就是我的朋友啦
AI探索指南
秉承Build in Public,分享下使用Cursor实战开发一个前后端分离的网站的经验,希望对大家有帮助,有问题评论区留言,我看到会回复 1.明确技术栈 Cursor中模型我选的是cluade 3.5 sonnet,openai用过就知道根本没法比。拿到一个需求,首先让claude推荐能实现这个需求的技术栈,然后在cursor setting全局配置中的Rules(图1)和项目根目录的.cursorrules中包含对应的技术栈,这个网页中有很多cursorrule的模版,我就是在里面找的https…
首页组件我要求包括但不限于:1.Hero 2.cta 3.faq 4.how it works....”
6.最重要的一点,你和cursor对话的时候通常会开多个聊天框(看图4右侧滑动按钮我完成这个项目开了多少聊天框),一个聊天框聊的东西多了就特别容易抽风,怎么保持让cursor的记忆同步呢?
每聊完一个聊天框,你要开启新聊天框的时候,就和cursor说:“请你回顾我们前面全部对话,总结更新我的项目架构文件,供未来别的开发人员使用“
7.总结:
cursor很强大,也很弱,取决于你会不会使用。
我前端是用next.js,后端用python,中间还涉及一些我从来没有接触过的服务器,命令行等运行命令。你一定要把前提和背景告诉cursor,举个简单的例子,我要在hugging face space上部署项目,但是发现服务器启动的时候日志疯狂报错,你千万不要直接把报错日志丢给cursor,这样子解决不了问题,你要这样说:“这是我部署到hugging face space服务器的时候的错误日志,请你看一遍,然后你告诉我可能是哪里出了问题,需要我提供哪些代码文件给你,我嗯先不急着写代码,先一起讨论下”
希望对大家有帮助,以后还会继续分享我在实战中使用cursor的经验。我是完全0代码基础,我可以,你一样可以,不要对未知的技术畏惧,不懂的就耐心去问cursor
Fr1_-H_kv4bMob7p1cNSzANZeKN_v3.png
159.3 KB
秉承Build in Public,分享下使用Cursor实战开发一个前后端分离的网站的经验,希望对大家有帮助,有问题评论区留言,我看到会回复
1.明确技术栈
Cursor中模型我选的是cluade 3.5 sonnet,openai用过就知道根本没法比。拿到一个需求,首先让claude推荐能实现这个需求的技术栈,然后在cursor setting全局配置中的Rules(图1)和项目根目录的.cursorrules中包含对应的技术栈,这个网页中有很多cursorrule的模版,我就是在里面找的https://cursor.directory/
2.设计架构,逐一实现(图2)
就和写作文一样,你要先写一个大纲,然后根据大纲填入对应的内容
千万别上来就和cursor说我要你帮我实现一个文生图网站,人工智能不是神。
你就是架构师,cursor就是程序员,我通常会这样对cursor说:“好的,让我们一起来实现这个需求。你先把整体的架构列给我,先不要写代码”
然后cursor列出架构后,你根据自己的需要,增加或者减少
3.遇到报错保持耐心,运用好command+回车(macOS, windows我不知道是什么)
command+回车在cursor里面是可以让cursor阅读你当前项目的全部文件。像我这次项目代码特别多,光api的文件就7个还是8个。(图3)
我举个例子,比如有生成图片api,生成音频api,提取pdf文件api,如果你添加了某个功能代码开始报错或者进行本地调试怎么都运行不了,你可以这样子和cursor说:”现在我们遇到了一个报错,控制台日志如下:xxxx,你先不要急着写代码,先分析下可能是哪些文件中的代码出了问题,告诉我需要提供代码的文件,你再修改”
4.如果遇到要修改现有文件的代码,一定一定要给cursor这个提示:“先阅读一遍我目前的代码,再进行修改”,你不这样说,cursor可能不知道你目前代码的结构,把你关键功能直接改没了都可能
5.前端页面如何快速实现?
你可以选择上v0.dev或者别的文生图,生成一个界面的图片,再发给claude让你复刻。我对界面没什么要求,我就是这样提示cursor的:“我们的网站主题是ai播客生成,我希望整体的设计风格是充满活力和激情的,请你以此基础发挥想象力设计我的ui界面。
土耳其老师根据学生未来想成为的职业,生成对应职业的 AI 照片打印出来给他们。

Invalid media: video
Back to Top