关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
OpenAI 很鸡贼,提前一天开发布会,让 Google I/O 的气势弱了很多。再加上 Ilya 的官宣离职又分走了不少流量。果然今早一早起来,媒体的报道和用户的关注相比昨天要少得多。

但实际上,个人觉得 Google I/O 还是有不少看点。最大的感觉是:Google 在AI 发展的进度上真正追平了 OpenAI。无论是音视频实时助手,还是视频生成,基本上都能够和 OpenAI 同步发布,效果类似(当然 Veo 比Sora晚了三个月,效果看起来还是要稍逊)。甚至 Gemini 1.5 Pro 的 2 million 窗口,LLM 与 Google 原生搜索的结合,以及与智能眼镜等硬件的集成,相比 OpenAI 来说还要更领先一些。整体上,感觉 Google 这头巨兽算是彻底醒过来了,开始处于某种进攻的态势。(当然,实际全面发布时间是个问题。The Information 说 Google 现在在 AI 上的风格是先立牌坊,然后慢慢挤牙膏兑现。)

Google 的这个多模态助手 Astra,尽管在语音的表现力上不如昨天的 ChatGPT,情绪没有那么丰满和 dramatic,但是在延迟响应、实时语义理解上是不输的,尤其是还结合了记忆,感觉上甚至更加实用。

相比之下,OpenAI 昨天的发布会,以及最近的一系列动作,比如传说中和苹果合作,似乎都有“提升用户体验,进而拼命扩大用户量”的感觉,不知道是不是切身感受到了 Google 的威胁,在战略上做出的选择。或许 OpenAI 已经意识到了,单单靠自己很难跨越鸿沟,GPTs 的失败就是例子。

当然,Google 也有自己的问题,当下最大的风险就是如何应对 LLM 在搜索结果中带来的商业化挑战。发布会上,搜索的第一条结果换成了 LLM 的结果,体验上看似变好了,但对商业化的影响是巨大的。这种左右互搏,处理不好就会是自掘坟墓,处理好了就会迎来第二曲线。至少从股价来看,感觉华尔街对于这次 I/O 的故事并不是非常 buy in,还在继续观察。
新的谷歌搜索演示,真狠啊,在核心产品上做这么大的改动。

几乎完全用AI重构了谷歌搜索的产品形态。搜索-总结-生成。
尝试了一下,Wegic 这个 AI 网页生成工具也太好了。

通过对话来生成和修改页面门槛确实低了很多。整体网站设计和 IP 都太好了。 IP 尤其可爱。

而且生成的网站从内容和美观度上都很好,内容也很丰富。如果补齐一下能力的话可能是 Framer 一个很强力的对手。

这里尝试:https://wegic.ai/
AGI-X闭门会第32场,北京
具身智能 & 大模型
关于【宇树】新出的机器人unitree G1

有两个比较吸引人的点,完成度相对较高和相对较低的价格

1. 先说最大的差别,就是腿是不是反弓,人形机器人的腿有两种不同的形式,一种是鸵鸟腿,一种是人腿。宇树在自己的H1产品中就使用了人腿形的机器人。
2. 反弓最大的优势是在电机的集成度上,也就是可以把电机最大程度的集约到核心区域。这样对于电机的性能要求会有所降低。
3. 但是宇树的核心就在于电机的性能和性价比很不错。
4. 所以这也是机器人公司的盈利手段,人形机器人相比于真的有什么产品力而言。卖电机的收益也不会小。
5. 很多人会觉得这样的机器人如果会做饭用在家里还是不错的,但是我们主要到宇树最后的小字,不要靠的太近,这也是刚体机器人的一个重要安全隐患,电机容易抽搐和发疯,随时随地给你来一个地板动作也不是不可能。
6. 所以具身智能(人形机器人),的投资大头还是我们熟悉的汽车产业。
7. 机械臂的大规模发展,资金就是来源于汽车产业。而现在的机器人学,基本上是建立在机械臂的基础上的。所以与其说咱看到一个两条腿,两个胳膊的机器人,不如说是四条机械臂连在一起(划掉)
8. 最后一个不成熟地展望,具身智能,会成为载人航天,尤其是载人登月,的先驱。相比于地球的环境,月球的低重力环境,和比较严酷的环境,更加适合机器人选手。
抖音“午夜狂暴哈士奇狗”这个小姐姐一直在发跟 ChatGPT 谈赛博恋爱的视频。

比如这个跟 ChatGPT 去海边约会,上个版本 GPT 还无法看到他看到的海边的景色,没办法看到她专门化了妆。

但这个版本她应该可以完全把 GPT 当成异地恋的男友约会了。配合新的情绪识别和面部表情识别,都不敢想有多强。
朋友用我的照片生成了一张 her 海报。家人们评评理,我怎么这么像杀猪盘的男主角啊?
我身边唯一一个在OpenAI工作的同学,是个女生,北京四中的,跟我一样都是北京人考到复旦的,大学就在我隔壁寝室楼。
对她的印象一直就是安安静静的,笑容不多,也常听别人说她不好相处、性格阴郁、傲慢。有一次一起坐校车聊起来,她说她是高考失利才来的复旦,这对她是很大的打击。
你知道我这种大水货考生第一反应是,“啊?复旦还不满意啊?挺好的了!不就只比清北差吗?”
后来的日子里听说她大三就转到美国本科去了,在社交媒体上慢慢了解她也有个学CS的哥哥,目前的作品水准也是探索人类边界那种level。看着她毕业之后去了Meta,前一阵说离开了Meta,我还想说什么公司能吸引她这样的女生加入?再一看是OpenAI。
更高兴的是前一阵看她还冻了卵,也分享了很多作为女性和准母亲的体验。
在今天这个日子里想默默祝福她。
你做到了,世界的舞台是属于你的。
麻了 刚才打开 ChatGPT 他提醒我下载 Mac 应用,我光速点了一下居然下载下来了。

但是公司的 Mac 是因特尔的没办法启动,各位可以M 系列的可以试试能不呢启动,这个是从官方下的。

链接: https://pan.baidu.com/s/1gs5twNMxtKE9BuYCVMYxyg?pwd=m3ua 提取码: m3ua
OpenAI春季发布会结束,快速记录下我看到的和理解的更新,首先总的来说,去年3月份OpenAI是发布了惊艳世界的GPT-4,但这次,他们不是发布一个更强大的模型,而是做了很多工程优化,把产品做得更好用,更容易和生活、工作结合了。具体来说,更新包括:

1. 新发布GPT-4o模型,这是个比GPT-4快100%以上的模型,对免费用户开放,后续免费用户也可获得GPTs、browring、图像理解、代码解释器等原本只有Plus付费用户才具有的功能;

2. 发布ChatGPT电脑客户端,这个客户端也可用语音对话,并且也非常快捷地通过复制、分享电脑屏幕等方式让ChatGPT进入到你正在处理的任务语境中去,可以认为ChatGPT成为了一个你工作全局的copilot,辅助excel、ppt、写代码等都不再话下(老罗圆梦);

3. 语音能力升级,不再需要等待几秒再获得回复,实时性超强,可以随时打断,而且不是简单的语音转文字的处理模式,能理解语气、语调,充当有情感的对话助手,以及作为实时的同声传译都毫无问题(我想到了《Her》)

4. 可在使用语音对话的同时,开启摄像头,让ChatGPT实时看到你所在的环境以及你看到的信息,这种可用性的提升能增加大量的使用场景,比如提供教学、博物馆导览、辅助视障人士等等,不过从测试细节看,这也并不是一个有视频理解能力的多模态模型,而是通过每隔几秒钟自动截图让ChatGPT理解的方式实现的。

整体来说就是,没有更强的模型,但是大量的工程优化会让ChatGPT能进入更多人的生活,帮助现有用户完成更多场景的任务,又有一堆AI应用公司难免了。
今天发布的GPT-4o以及ChatGPT产品的快速总结:#ai# #openai#

🌟GPT-4o(“o”代表“全能”)

它可以接受任意组合的文本、音频和图像作为输入,并生成任意组合的文本、音频和图像输出。

它可以在 232 毫秒内响应音频输入,平均为 320 毫秒,这与人类在对话中的响应时间相似。

在英文和代码文本方面,它与 GPT-4 Turbo 的性能相当,对非英语文本的文本有显著改进。

同时在 API 方面更快速、价格更便宜 50%。与现有模型相比,GPT-4o 在视觉和音频理解方面表现特别出色。

与 GPT-4 Turbo 相比,GPT-4o 速度提高了 2 倍,价格减半,限制速率提高了 5 倍。

🌟何时可用?

GPT-4o 的文本和图像功能今天开始在 ChatGPT 中推出。

将在免费版中提供 GPT-4o,并为 Plus 用户提供高达 5 倍的消息限制。

将在未来几周内在 ChatGPT Plus 中推出带有 GPT-4o 的 Voice Mode 的新版本。

开发者现在也可以通过 API 访问 GPT-4o 作为文本和视觉模型。

公告地址:https://openai.com/index/hello-gpt-4o/
和@歸藏 一起视频会议看完 OpenAI 的发布,讨论了一会,背脊发凉…

1️⃣ 没想到卷推理卷到了这种程度😨 现实交流场景下300ms 左右的体验奇点真没想到就这样被越过了,真技术驱动、大力出奇迹

2️⃣ OpenAI 严格按照去往数据更多的地方的战略一骑绝尘,AI 的信仰真不假

3️⃣ 要取代的是人和现实世界交互的器官(眼、耳、口)。人真变成API ,细思极恐,例如 OpenAI完全可以用自己的机器人去和心理咨询师、律师、专家、专业销售人员套数据 🤯 这个范式机会多如牛毛

4️⃣ 推理卷的狠越可能 Q* 已经实装(猜测,概率低)

5️⃣ OpenAI在合成数据领域积累好深,工程化能力和我当年近距离了解的 Dota2 团队的思路如出一辙。将结果智慧用到了极致

6️⃣ 反而,原生多模态带来的效果、可能的抽帧处理都在预期之中

7️⃣ Elo 分很客观,别听 Sam 早期说要做工具,他就是想欺骗人所认识的世界(或者是就是人的等价物/API,硅基“人”)。世界只有极少人会用复杂推理来压测模型。更别提他们还有agent成果攥着(猜测,概率大)

开的是潘多拉魔盒,造的是“神”🫣
刚推上看见一个牛逼的东西,一个薅GPU羊毛的地方:中国算力网

C²NET是中国国家算力网,连接了深圳、武汉、成都、西安、中原、南京、杭州等多地人工智能计算中心。

里面的算力约70%的机时对外开放共享

看了下A100,9个积分/卡时,每天前30分钟免费,做任务还送积分,积分可以直接兑换算力,登录就送50积分。

里面还有很多模型和数据集可以下载。

传送门:openi.pcl.ac.cn
Greg 录制了新的ChatGPT实时语音和多模态的演示。

最后ChatGPT还即兴创作了一首短歌,歌词涵盖了房间的装饰风格、人物的穿着特点、期间发生的趣味插曲等。

真的这个速度和准确度太离谱了。
在ChatGPT出现后,人类应该意识到,它不可能只是你的“助理”,它至少是你的“朋友”。或者说,一个像朋友的助理。
人类本位主义已经终结。
这个AI办公应用火了:简短提示词出PPT,打包GPTs帮你打工干活

李开复说,他们最早上线的生产力产品,ROI 已经可以做到 1 了。

也就是说,他们从用户手中收到的订阅费,已经低于获取用户的成本加 GPU 的成本。

他还说,单这款产品,今年应该会有一个亿的收入,有近千万用户。

这款神秘的产品,据说就是PopAi:

一款“专为知识工作者、研究人员和学生设计”的一站式个人AI工作空间,主打无缝集成聊天、阅读、写作、创作等工作需求。

PopAi在去年8月推出,在5个月内升级了20个版本。今年1月,PopAi的用户已经达到了150万,其中超30万是学生用户。

这篇是在微信里搜到最详细的一篇报道,作者当时都还不知道PopAi是零一家的:
昨天闭门会我的观点

1、具身智能和机器人的区别:具身智能的核心是通用的脑子。没脑子前就做硬件,很可能就是错的。

2、具身智能最后一定会是人形,因为能适配人类的工具链和环境。未来机器人分两种:替代人的具身智能(通用人形机器人)、升级版的智能设备。

3、现在的国内问题在哪?1还没脑子,2陷入物理世界的迭代

4、应该怎么做?欢迎来参加闭门会,明晚(周二)北京中关村
Back to Top