关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
没想到机器人已经发展到这种程度了
还得说是马斯克啊

Invalid media: video
试了一下智谱新发布的基于思维链的AI搜索,有点🐂🍺的。

前几周Open AI 发布O1和O1 mini之后,基本上大家都看到了思维链和模型推理能力的价值,对于事实核查以及复杂问题的解决有非常大的作用。

而这类解决方案除了帮助科学家和开发者之外,离普通用户最近的需求就是搜索了。

推理能力和长文本阅读可以大幅解决之前AI搜索的幻觉问题,另外可以对搜索结果进行复杂总结给出更深入和准确的结果,节约整理和一定的逻辑推理成本。

智谱新发布的AI搜索就结合了网页深度阅读和多步推理能力,可以实现:

- 可以支持单次阅读超过100多个网页;
- 支持多级推理的思维链;
- 可以联动智谱其他的AI工具

你可以在多步复杂内容上增加需要计算的问题,比如这个每天吃5个苹果的热量占正常人类消耗的百分之多少。

推理能力的最好提现是你可以在一个问题中询问多个逻辑相关的问题他都能给出回答,比如这里询问二战密码破译机的发明者以及他的贡献以及对AI的影响。

除了能整理内容之外核心是可以对内容进行一定处理,比如下面截图里面的A股历史牛市分析它可以深入阅读网页信息并且给出对应的表格,之后还可以用Python画出对应的图表。

最后是终极问题,之前的AI搜索即使我降低难度问AI领域的歸藏是谁很多都答不对,开始给我介绍歸藏易,智谱回答和介绍的非常好。

智谱“AI搜索”智能体已经正式上线,感兴趣可以试试。
虽然迟到将近 1 个小时,但发布会开场效果确实炸。
机器人跳舞、调酒看着虽然没啥大用(看不出续航和长期稳定性),但这几步还是走得蛮流畅的。递东西的手法简直像真人。比前几年 Optimus 亮相时进步明显。
就这个步态,目前也不是那么容易做到。(WAIC 上,中国20几个人性机器人,大部分像手办一样要靠架子撑起或绳子吊脖)

目前看到的一些要点:
-Robotaxi 车辆形态
重点显然是轿车版(P4),无方向盘,无刹车板,完全为自动驾驶设计的新车辆。现场至少已有十台以上样车。
而且真如此前彭博社的路透,是个蝶翼门(why?开车门半径很大呀,这实用吗?)

-成本
轿车成本在2-3万美元。
这比百度萝卜快跑第六代贵,百度由江铃代工的第六代无人出租车预计成本会在 20 万元人民币左右。比 Waymo 的车便宜。

-巴士版(P5)
也无方向看,看直播是对向双排座,大概可以坐20+人。没说成本等更多信息。

❗️BUT!
马斯克这次没说 Robotaxi 的计划运营范围,这是个关键指标。最初准备在多大范围跑呢?能超过 Waymo吗?(旧金山主城区)和萝卜快跑比(武汉三镇主城区)呢?

-运营时间:预计明年(和之前各方消息一致)

不到一个小时,发布会已经结束了?!发布时长小于迟到时长。有点虎头蛇尾了!😅

不过特斯拉有了一票新东西,可以期待一下之后陆续的进展了。😆
特斯拉的We Robot发布会有3种机器人。很容易混淆概念。
酒保机器人和玩石头剪子布的是遥操作。在密集的人群内部署、力反馈的安全性和网络的稳定性方面做了很多功课。但这种实时性的遥操作目前还只能在WIFI的内网环境。部署到异地目前的网络基础设施还不足以支持。
4个人跳舞的是预录制动捕的动画。
好几个机器人一起向前走路的是真正的自动运行模式。
拿礼物、打招呼、合影比手势、石头剪子布是反复表演的项目,应该是MKT专门彩排过的演示环节。

结论:
遥操作:可以让很多麻瓜以为“西部世界要来了”。但对网络环境极度苛刻短时间内无法异地部署。实用性有限。且遥操作的实时性即使可以玩石头剪子布。但无法完成腿部的行走,因为保持平衡需要的实时性还要上一个大台阶。所以所有遥操作的机器人都无法行走。

自主执行任务:没新进度,表演个走个路。

看似一切都变了,实则什么都没变。股民的情绪还是容易煽动的。今晚又会有无数短视频又要惊呼改变世界了。
关于字节豆包的耳机说几个暴论:
大部分阅读理解有问题的人都幻想这个耳机有"AI功能"。但实际上所有的AI功能都来自于豆包APP,而这个硬件和普通耳机没有任何区别。
能听和能说是两个不同的品类。做一个能听的耳机很容易,但是能清晰的听清用户指令对话。仍然需要做大量的工作关于音频和声学。麦克风阵列的相位处理、内噪和外噪的处理、指令人声纹分离、唤醒词和意图的识别、结束标志的延迟、息屏唤醒、后台无豆包app运行的唤醒对话。
这些都是要搬的砖,都需要大量计算工作在"豆包app"团队之外的硬件团队。今天的ola大概率是最后一代传统tws耳机冒充AI硬件。vivo/oppo/米 随手一个安全/能耗问题就可以让豆包必须保持前台才能对话。然后让自家的耳机无缝息屏用。手机厂家可以保持OS级的唤醒能力"优化加速"所有后台第三方app。
换第三方的耳机是一个非常品牌心智迁移的动作,手机厂家一定会守住这条线,而且所有的手机厂家现在都all in ai。
卧槽 兄弟们 炸裂了

现在只需在 GitHub URL 前添加 bolt.new 即可直接打开 GitHub 仓库

然后你就可以直接在浏览器中直接运行该仓库的项目

即时运行预览项目的内容并进行直接提问、修改、继续编码等。

但是注意下:

该功能处于 alpha 测试阶段,可能会有问题。
目前仅支持小到中型仓库,且不支持分叉或提交。

我测试了下大一点的仓库直接报错运行不了。
最近 FLUX 生成擦边视频和网红图看起来很火啊。

其实我有个比较成体系的网红图生成方案。

主要是一些保证正式感的参数和流程,还有一些保证擦边内容质量的东西。

之前的问题是已有的视频模型面部表情过于僵硬,海螺刚好解决了这个问题。

看看要不要整理一下。

Invalid media: video
ChatGPT 的记忆功能,是需要刻意养号的,因为默认情况下什么时候触发往记忆里面塞东西会非常的迷。
而且记忆功能从上线到现在也不到一年,这么短时间如果你不刻意养号,是不可能实现好效果的。
我在过去一段时间,试了两个刻意养号的方法:

一、让 ChatGPT 访谈我
Prompt 大致如下:
我们接下来将开启一段对话,以帮助你更好的了解我。
每轮对话,你随机向我提出五个问题,我将选择其中一个或多个进行回答。你将总结我回答中有价值的信息,写入你的记忆。
整个对话的目的是为了让你获取我更多的信息,请不要提及无关问题,请不要提及重复或近似的问题。

这个方法配合新的高级语音模式非常好用,可以每天和 ChatGPT 打电话聊半个小时,一周收获一个知心好友。Prompt 的部分还可以增加对问题方向的限制,以确保在尽可能短的时间内覆盖尽可能多的领域。

二、让 ChatGPT 记得我作品中的观点
这个说起来比较简单,就是把自己的作品发给 ChatGPT 然后让他记住这其中的观点。但实际上有两个技巧是需要注意的。一个是,目前 ChatGPT 的 4o 模型在读取文件时有惰性,默认只阅读文章前 1000 字。所以你的 Prompt 要特意强调“阅读全文”。
再有,就是对于较长的文章来说,可能会包含你的多个观点和看法,这个时候让单次让 ChatGPT “记住”的效果不好,因为 ChatGPT 的记忆库每条有长度限制。
比如,我要让它记住我写过《互联网是人类历史的一段弯路吗?》这个 5 万字的文章,要怎么做呢?
我的做法是,先把文章发给他(尽量用 Markdown 文件减轻模型的思考负担),要求他阅读全文,并总结本文的数个核心观点。
然后,发送:

现在,根据原文内容,详细阐述第一点“叙事的崩溃”。

这里的第一点,是它根据原文自己总结出来的。这个时候,它会大概生成一个 500 字左右关于此观点的缩略解释。我再回复:

你总结的很好,现在,将这个部分写入记忆。

这时,就触发了 ChatGPT 的长期记忆功能,把我的这个观点写入了记忆库。然后,再继续让他详细阐释第三点、第四点、第五点,直到遍历完。
以上两个方法,亲测好用。
Cursor 的企业客户数量 10 月份超过了 Open AI!

而且新增客户数量也是第一。

只要可以提高生产效率,公司还是非常愿意付费的。

Ramp 是美国一个专注于为企业提供金融服务的公司。

他们发布了 10 月份 Saas 十大供应商,这个数据非常值得参考,因为都是真金白银的支出。

来源:ramp.com/blog/top-saas-vendors-oct-2024
AI时代的快速产品验证:从MVP到付费用户

结合Pieter Levels、@哥飞 、@刘小排 等大佬们的方法论和实践经验,最近琢磨出一个节省时间且可以快速测试产品付费意愿的方法,我自己也在实践中:

1. 修改自己的模版或购买模版做出MVP(vercel有很多好看的免费模板,也有功能更完善但比较贵的如shipfa.st),UI要好看和专业。网站的全部功能必须付费:用户如果没有登陆,在尝试使用功能时弹出登录窗口;用户如果登陆了但没有订阅,在尝试使用功能时重定向到价格/订阅页面。

2. 投放Google关键词搜索广告(注意广告类型)。如果是AI工具站,看100uv是否至少可以成一单(可以视情调整预期),并不是说点击到100就停止投广告,可以多投一些。根据Law of large numbers,样本数量越多,则其算术平均值就有越高的概率接近期望。投放广告本身也是有学问的,比如可以根据semrush关键词搜索量和谷歌趋势热度选择国家等等。

3. 如果转化率不太行,就要考虑这个关键词/服务本身的付费意愿问题了。

4. 如果转化率还不错,再去做SEO优化,比如写内容、加外链等等,提高排名和竞争力。

我感觉独立开发做产品最大的阻碍往往是“心力”和情绪,而不是购买域名、初期广告费、api开销、模版费用这样的小额经济成本。正反馈和快速的负反馈都是很重要的,只有负反馈来得快,才能更快地ship fast,去做下一个网站/app/产品。当然,如果新词找的好,一开始就有很多自然流量的话,是没必要投广告的。我这个方法比较适合有竞争的老词和上站初期自然流量难获取的情况,且只适用于需要用户购买/订阅的网站,不适合纯靠流量拿广告费的网站。

以上只是我一个多月来做AI出海的一点心得,仍然在“入门前”阶段。期待和朋友们多多交流、共同进步!
看到一个理念很有意思
​人类的进化其实靠的是手的解放,生产和使用工具。
​而手机的出现是把手束缚住了。
​未来的智能设备很大可能是脱离手的,重新把手释放出来。
​手巧才会心灵。
一位创业者朋友跟我分享了自己的 AI 产品矩阵

不能盈利。。。
用即梦AI 制作超可爱表情包,效果超赞还免费!

如何生成这些表情包?

1、使用下面的提示词模板,在 “【xxx】” 中填写要生成的内容。

图片主体:一个可爱搞怪的动漫版【xxx】,脸部特征,上半身或全身
情绪:各种表情和动作,动作夸张,欢乐,生气,悲伤,愤怒,思考,拥抱,奔跑,招手等
风格:可爱动漫插画风格,白色和蓝色主色调
画质:精致的细节,超高清,8k
图片布局:3x3 网格图,一个网格一个头像,不显示网格线,白色背景

注意:模型使用 “即梦 通用 v2.0 pro”

2、例如生成猫咪的表情包,修改模板为下:

图片主体:一个可爱搞怪的动漫版小猫咪,脸部特征,上半身或全身
情绪:各种表情和动作,动作夸张,欢乐,生气,悲伤,愤怒,思考,拥抱,奔跑,招手等
风格:可爱动漫插画风格,白色和蓝色主色调
画质:精致的细节,超高清,8k
图片布局:3x3 网格图,一个网格一个头像,不显示网格线,白色背景
Back to Top