关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
给参加首个人形机器人半马比赛的选手加油!

Invalid media: video
元宝chat现在还是纯效率工具
无历史记录记忆
还没到陪伴机器人
有些做陪伴机器人的朋友是不是对陪伴有些误解:如果猫会说人话,整天察言观色,嘘寒问暖…想想已经有点烦了
日韩追赶中美,人形机器人应用的冷与热|RoboInsight 37

本期,我们换一种阐述方式,串联过去一周发生的人形机器人事件,并且关联以往的一些迹象,试着窥得趋势轨迹,市场动向,以及技术发展状况对人形机器人应用的局限等等,我们开始吧!

https://mp.weixin.qq.com/s/_i2O8YakDwGtr17yfY-_Eg
继迪士尼之后,环球影城也开始引入了机器人表演
每家都号称全栈自研

都做本体 都做灵巧手 能不卷么

当整个行业都在做自以为的高壁垒时

整个行业就没有壁垒了
增加照片真实感的方式是向照片添加瑕疵

当问题足够多的时候,真正的问题就会被掩盖

提示词:帮我创建一张极其普通的成龙自拍 iPhone 照片,没有明确的主体或构图——只是一张随意的快照。照片略带动态模糊,因光线不均而轻微过曝。角度别扭,构图全无,整体效果平庸得令人发指。
我的照片已经next level
终于有时间写一下 Pollo 的推荐了,如果你烦透了每个月给各家模型交订阅费还要承担被封号的风险, Pollo AI 绝对是个很不错的选择。在实际项目中,我已经完全离不开它了。

先放链接再夸:https://pollo.ai/home

你能在这用到市面上最优秀的一批生图模型:Imagen3(也就是我经常夸的 Whisk 和 ImageFX ),Recraft V3,Flux1.1 Pro Ultra(也就是满血版Flux)……

生成完的图片不仅自带扩图、去背、超清等 AI 编辑功能,甚至可以直接进入视频生成,工作流无比丝滑。

当然,你也能在这用到市面上第一梯队的所有视频模型,包括但不仅限于:可灵,海螺,Pixverse,luma,Pika……甚至连 Google 的 Veo2 也有(而且是 Image to Video ),还有最近刚上的 Runway Gen-4 Turbo。

更别说还有大量宝藏功能:视频超分,视频生视频,视频转绘等等等……你甚至能在这找到各种刷屏的 AI 特效。

☁️

最后想分享一下 Pollo 在实际项目中对我的帮助 —— 快速验证

一直以来我在做项目时的最大痛点就是抽卡焦虑:我并不确切知道哪个镜头应该用哪个模型效果最好,于是总在各个模型之间反复横跳。

当你在 Hailuo 生成了一个 80 分的镜头时,你肯定会忍不住想:可灵能不能冲到90分?如果换成 Pixverse 呢?放在以前,不到半天我可能就被逼开了所有家会员,Chrome 上打开12个标签页了。

现在,一个就够了。(还省钱
Flowith 真的猛

最近他们在 0 投放的情况下达到了 100 万美元的 ARR 收入!

不过他们在去年都已经开始搞类似通用 Agents 的 Oracle 模式,同时一直坚持类似 AI 知识库的知识花园模式。

这个成绩也可以算是对他们认知和行动的双重奖赏吧。

我也咨询和调研了一下是如何 0 投入做到的:

1️⃣首先是产品力很硬,上面也说了知识花园和通用 Agents 都搞得很早,知识花园还能帮用户赚钱,确保用户会主动推荐自己的内容。
2️⃣另外是创始人在很重视营销,他们自己开设小红书和推特非常勤奋的运营两三个月小红书干到了 3 万粉丝。

最近他们也在举办《智能体全球创作大赛》,我也是评委,很多朋友基于 Oracle 模式的强大能力搞了很多好玩的工具或者用法,比如 Emoji 用法指导、知识测评游戏网站、动效和设计都很在线的企业官网等。

各位可以去试试他们的 Oracle 模式,不需要邀请注册可用,自动帮你完成多步骤非常复杂的任务和需求。
而且支持自主规划、拆分和完成任务,还会自我反思修复问题。

可以来这里看看 Agents 大赛的作品获取一下灵感:https://agentga.me/
https://mp.weixin.qq.com/s/HsFhXMLejsQWjTghUYdKFA

呕心沥血整理我近两年做 AI 产品积累的经验
周末在全球软件开发大会上分享反响特别好,好多人找我要讲稿,遂也整理公开全部讲稿,算是我对社区的一点回馈!本文聚焦三个方面:
1️⃣AI 产品为什么这么难做
2️⃣提示词工程被极大低估
3️⃣AI产品团队如何构建

希望大家阅读有收获,写给一起在 AI 路上的朋友们😊
向 AI 的深度思考学习深度思考

---

01. 先用自己的理解复述一遍用户的问题。如果问题不够精准,则换一种精准描述。

02. 如果是多个问题,要搞清楚问题之间的关联。如果问题描述有重复,可以合并问题。如果是大问题,先拆解为小问题,再把小问题以某种逻辑串起来。

03. 如果问题够精准,则会挑出其中的核心概念。

04. 以核心概念为关键词,从信息源搜索参考资料。

05. 快速阅读参考资料,提取其中有用的信息。

06. 谈谈核心概念的定义,以及用哪几个例子来帮助理解这些核心概念。

07. 在理解问题本身的基础上,推测用户的需求,即用户的背景是什么,为什么要问这个问题,最终想要得到什么答案,用在什么场景下。

08. 对于用户的需求,列出几种可能性,然后逐一思考,找到用户最想要的一种可能。

09. 如果是追问,一开始要回顾之前的对话历史:用户之前问过什么,我已经答过什么,用户又问了什么,期待我答什么,这次回答要注意什么。

10. 调取模型来分析问题,生成第一轮回答。

11. 如果用户需要例子,那么列举例子,并去掉重复的例子,挑出典型的例子。

12. 调取视角来审视回答,拷问第一轮回答,查缺补漏,生成第二轮回答。

13. 回到用户的问题描述,提取用户对回答有哪些期待或者说限制:有用户直接描述的,有用户没有直接说但 AI 猜的。

14. 根据用户的期待或限制条件,生成一个内容模板,可以装下用户期待的回答。

15. 拿内容模板,对第二轮回答进行修改,生成第三轮回答。

16. 最后,检查第三轮回答是否符合需求与条件,微调,生成第四轮回答。

17. 把第四轮回答告诉用户。
ChatGPT 的新图形生成功能,甚至能根据前后文生成连续帧:

图 1 生成后,我用了:“让她转头,对着我笑,我开了闪光灯,这是一款老 iPhone,夜景效果不好。”来生成图 2。

可以看到,远处建筑物和和服花纹在完全一致的情况下,被添加了闪光灯下的光影效果。
远处的烟花也向着“下几秒”的方向运动了一下。
感觉这个功能出圈是因为做“宫崎骏”图片,着实是网友想象力太低了。
Back to Top