关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
今天卡兹克发的帝帝那个可以让 Claude 获得类似 O1 思维链的提示词太强了。

再一次证明了随着模型能力的提高,提示工程的重要性也会越来越高。

绝对不是模型越厉害提升工程越不重要。

我用这个提示词思考 AI 生成视频模型和传统图形科学的异同,它得出了和 Runway CEO 类似的结论。

另外不建议折叠 Claude 的思考过程,他的思考路径和方向往往比结论更有价值
宠物狗会不会就是人类的未来。

只要有人养,就衣食无忧了。
只是代价是,放弃繁殖。

人类现在正有一批 LGBT 在提前布局。只等 AI 机器人崛起后,去领养他们了。

可能所有选择都是对的。
OpenAI o1做到了LLM在线推理的scale-up,其实这样的inference-time scale-up也是机器人领域新趋势。

⭐️我们暑假开始做的工作👉DIAL-MPC这套基于扩散模型(Diffusion Models)的方法也实现了机器人在线推理的scale-up (之前的强化学习可以说都是在做离线的scale-up)

很高兴我们的工作受到了很多顶尖实验室(CMU,斯坦福,CalTech)和硅谷机器人公司(DeepMind, NVIDIA)的广泛关注和初步应用
和我碰个小拳拳,你就是我的朋友啦
AI探索指南
秉承Build in Public,分享下使用Cursor实战开发一个前后端分离的网站的经验,希望对大家有帮助,有问题评论区留言,我看到会回复 1.明确技术栈 Cursor中模型我选的是cluade 3.5 sonnet,openai用过就知道根本没法比。拿到一个需求,首先让claude推荐能实现这个需求的技术栈,然后在cursor setting全局配置中的Rules(图1)和项目根目录的.cursorrules中包含对应的技术栈,这个网页中有很多cursorrule的模版,我就是在里面找的https…
首页组件我要求包括但不限于:1.Hero 2.cta 3.faq 4.how it works....”
6.最重要的一点,你和cursor对话的时候通常会开多个聊天框(看图4右侧滑动按钮我完成这个项目开了多少聊天框),一个聊天框聊的东西多了就特别容易抽风,怎么保持让cursor的记忆同步呢?
每聊完一个聊天框,你要开启新聊天框的时候,就和cursor说:“请你回顾我们前面全部对话,总结更新我的项目架构文件,供未来别的开发人员使用“
7.总结:
cursor很强大,也很弱,取决于你会不会使用。
我前端是用next.js,后端用python,中间还涉及一些我从来没有接触过的服务器,命令行等运行命令。你一定要把前提和背景告诉cursor,举个简单的例子,我要在hugging face space上部署项目,但是发现服务器启动的时候日志疯狂报错,你千万不要直接把报错日志丢给cursor,这样子解决不了问题,你要这样说:“这是我部署到hugging face space服务器的时候的错误日志,请你看一遍,然后你告诉我可能是哪里出了问题,需要我提供哪些代码文件给你,我嗯先不急着写代码,先一起讨论下”
希望对大家有帮助,以后还会继续分享我在实战中使用cursor的经验。我是完全0代码基础,我可以,你一样可以,不要对未知的技术畏惧,不懂的就耐心去问cursor
Fr1_-H_kv4bMob7p1cNSzANZeKN_v3.png
159.3 KB
秉承Build in Public,分享下使用Cursor实战开发一个前后端分离的网站的经验,希望对大家有帮助,有问题评论区留言,我看到会回复
1.明确技术栈
Cursor中模型我选的是cluade 3.5 sonnet,openai用过就知道根本没法比。拿到一个需求,首先让claude推荐能实现这个需求的技术栈,然后在cursor setting全局配置中的Rules(图1)和项目根目录的.cursorrules中包含对应的技术栈,这个网页中有很多cursorrule的模版,我就是在里面找的https://cursor.directory/
2.设计架构,逐一实现(图2)
就和写作文一样,你要先写一个大纲,然后根据大纲填入对应的内容
千万别上来就和cursor说我要你帮我实现一个文生图网站,人工智能不是神。
你就是架构师,cursor就是程序员,我通常会这样对cursor说:“好的,让我们一起来实现这个需求。你先把整体的架构列给我,先不要写代码”
然后cursor列出架构后,你根据自己的需要,增加或者减少
3.遇到报错保持耐心,运用好command+回车(macOS, windows我不知道是什么)
command+回车在cursor里面是可以让cursor阅读你当前项目的全部文件。像我这次项目代码特别多,光api的文件就7个还是8个。(图3)
我举个例子,比如有生成图片api,生成音频api,提取pdf文件api,如果你添加了某个功能代码开始报错或者进行本地调试怎么都运行不了,你可以这样子和cursor说:”现在我们遇到了一个报错,控制台日志如下:xxxx,你先不要急着写代码,先分析下可能是哪些文件中的代码出了问题,告诉我需要提供代码的文件,你再修改”
4.如果遇到要修改现有文件的代码,一定一定要给cursor这个提示:“先阅读一遍我目前的代码,再进行修改”,你不这样说,cursor可能不知道你目前代码的结构,把你关键功能直接改没了都可能
5.前端页面如何快速实现?
你可以选择上v0.dev或者别的文生图,生成一个界面的图片,再发给claude让你复刻。我对界面没什么要求,我就是这样提示cursor的:“我们的网站主题是ai播客生成,我希望整体的设计风格是充满活力和激情的,请你以此基础发挥想象力设计我的ui界面。
土耳其老师根据学生未来想成为的职业,生成对应职业的 AI 照片打印出来给他们。

Invalid media: video
我的第一个产品:Ai播客生成器现在上线了!
地址 https://mypodmates.com/
这是一个你可以放入PDF或网页,自动生成双人对话的播客。你会看到有两个ai机器人在对你输入的内容进行聊天和讨论
核心内容:
1.PDF分析:目前最高支持上传15-20页,5M以内的文件
2.网页分析:上传网页链接,分析网页内容
3.问题导向:可以输入你想重点聊的话题,比如放入一篇关于苹果简介的pdf文档,想重点关注苹果的生产地有哪些,播客内容会重点围绕这部分
待提升:
1.目前只支持英文,多语言(包括中文)未来可能放入,主要看用户反馈,不知道中文需求多不多
2.语音生成能力待提高:现在已经找到了更好的语音生成模型和解决方案,打算先收集一下用户反馈
3.PDF更长的文件支持

由于成本问题,我自己也是今年刚毕业,没什么储蓄,所以目前新用户免费赠送2次生成音频的额度,如果有更多的使用需求欢迎付费。关于产品的任何反馈或者疑问也欢迎向我提出

最后感谢:
GitHub开源库:https://github.com/meta-llama/llama-recipes
感谢豆哥的社群技术支持@艾逗笔
感谢飞哥的社群seo支持@哥飞
还有感谢一些路上为我排忧解难的朋友,太多了就不一一艾特了。
Bolt New 的产品和销售数据出来了!

- 4周时间,从0到400万美金的 ARR!
- 使用的 Claude API 消耗量每天翻倍式增长
- 每周有十万人持续使用

这种爆发式的增长,核心是因为它解决了一个一直以来的行业难题:
Web 是世界上使用最广泛的平台,但开发者却无法在浏览器中构建 Web 应用。
通过开创性的 WebContainers 技术和先进的 AI Coder 解决了这个问题。

Bolt 认为未来人人都是开发者,十亿级别的开发者!
一个现实的例子是,一位用户在 Upwork 上获得了 5000 美元的报价和 2-3 个月的时间来打造她的 MVP。几天后 Bolt 发布,她购买了 50 美元/月的计划,并在不到 2 周的时间内构建并推出了她的产品。

引用链接:https://www.anthropic.com/customers/stackblitz
人形机器人什么时候来陪我散步,跟我 deep talk
我回来了~

因为一连贯的原因,在去年11月脱离了AI这股浪潮
甚至为了节约精力,主动切割了和这个行业的联系

期间的忙碌和疲惫尚可切磋,但时不我与的感觉可真不好受
沉舟侧畔千帆过,不是沉舟竟过千帆,而是千帆已过,你却陷于沉舟

好在还有病树床头万木春的下半场,还能有杯酒长精神的意气
重新入学,重新开始,马丁3.0

顺便,谁能告诉我,最近一年,AI最大的进展是啥?
除了字节杀入了几乎所有领域以外(这一年里最放不下我的就是字节的猎头了)
字节的通用图像编辑模型 SeedEdit 发布了。之所以说是编辑模型,因为可以基于刚刚生成的图片改图,包括修图、换装、美化、转化风格、在指定区域添加删除元素等各类编辑操作。

跟普通的编辑最大的区别是自然语言交流。我试用了一下,相当顺畅。自然语言驱动的编辑在业内还是少见的,尤其考虑到豆包本就是目前最有影响力的 AI 通用产品之一,这次可能会真的影响很多人设计的方式。

我之前用 Midjourney,跟很多朋友一样,急迫需要连贯性一致性的绘制形式,可以满足长篇的连贯的设计表达,比如做出有同个主人公的漫画、同类海报的不同呈现等等。

在豆包的官网 doubao.com 能体验到,大家可以试试看。
过去一年半做了多个AI项目,有简单有复杂的,有面向超大规模的小白用户,也有面向垂类人群,其中prompt是非常核心的要素,也是大家在做项目时绕不开的逻辑。在此总结了做prompt方案设计的经验和教训

核心结论:

GenAI带来应用新范式,支持通过prompt生成优质的个性化结果,但大众用户不想打开键盘,也不知道填什么prompt,所以需要在保证最终效果的前提下,尽可能通过低成本的表达方式来获得用户的意图。

对话式交互是未来,但目前还无法取代传统图形化交互。

1. 交互:不要让prompt变成操作阻力

- 非必要,勿填prompt,让用户多填一个字,都是对用户规模和转化率的巨大折损;

- 如果有prompt的效果更好,那么把prompt做成选填,让专业用户有选择,又不影响小白用户的使用路径;或者首次不填,快速预览结果,后续深度使用再填

- 如果必须填,尽可能填用户不需要额外思考的,否则用户一思考,数据就掉

- 通过推荐词降低输入门槛,并保证对prompt的响应,避免拔高用户预期后但结果又不符预期

2. 信息:通过算法、或信息授权方式来获取用户意图和context背景信息,而不一定要手动输入

3. 流程:把prompt填写留在最后一步,让用户先完成简单的熟悉的操作,增加沉没成本

4. 生态:少数偏专业用户的prompt,沉淀在端内成为模板流转,服务更广大小白用户一键套用和二创。对工具产品来说,飞轮逻辑可能比漏斗逻辑更重要,因为效果比效率更重要。要站在整个平台,整个大生态去思考,从更长周期看对用户的价值,对平台的增长和商业化的价值

提示:

- 我是在一个已有的大体量的移动互联网产品中融入AI能力,用户的习惯、预期,以及业务指标护栏都会对新方案的设计做限制

- 以上交互案例是表象,数据也是表象,仅供参考,不一定能复用到其他产品

- 最重要的是,你的用户是谁,他们的需求是什么,你的产品当前处于什么领域、什么阶段,如何更好的满足他们的需求
刚刚国内的一个做网文的客户看了下效果,表示满意。
然后,他们公司把这个程序买下来了……
有点夸张,但是真的……
感谢AI赏饭吃,本周加鸡腿。

把我整理出来的prompt分享给大家吧:

视角:视角为上帝视角,读者知道每个人物的行为动机,和心里活动。

读者群体:15到25岁的少女或者女性群体,晋江网站的读者

文风:幽默风趣,俏皮,充满着女性的可爱和柔美

段落风格:多换行,少用长句子,多用对话推进情节,避免过多的解释

情节:可以按照你的理解增加新的故事情节,如果你觉得当前的情节不足以支撑过多的字数情节,你可以按照你的理解来丰富内容,甚至创造新的支线剧情

避免重复:不仅避免相同的句子、情节、对话、场景描述和情感表达,还要确保任何重复的信息都能有所不同地呈现,以增加故事层次感,减少冗余感。

剧情快速推进:在每一章或每一个重要场景中,确保有推动情节发展的事件或决策。减少缓慢的内心独白或背景介绍,通过角色的行动和对话来展示故事关键要素。

连贯无断层:每个情节的承接点应自然流畅,从一个场景进入下一个场景时,合理描述事件或情绪的变化,避免突然的情节转折让读者感到突兀。

起承转合清晰:在每个段落或章节中,设置小的高潮和转折,并为主要情节做好铺垫,使读者能够循序渐进地融入情节发展。

无意义的对话和场景减少:确保每一句对话、每一个场景都具有明确的情节功能(推动情节或展现角色性格)。无实质内容的对话避免出现,每一场景的描写都应紧扣情节或人物发展。

多换行、少用长句:增加视觉上的“喘息”空间,使用短句增强节奏感。在描述情绪时用简练的词汇,不冗长,保证阅读时顺畅。

语言流畅自然:选用简洁明了的现代用词,减少过多修饰,避免用过于冗杂或华丽的语言,特别是在紧张的情节或情绪描写中。

情感和情绪的准确表达:用更直接、精准的方式表达人物情绪,避免含糊或过于抽象的情感表述。情感逐步递进,增加人物情感的张力。

视觉与情境感的渲染:在环境描写中,用简洁而富有画面的文字,将场景“画”出来,使读者更容易融入。
文字是有力量的。

写prompt之后,才真正理解了什么是「一字千钧」。

请尊重文字,LLM会感受到。
Back to Top