关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
我身边唯一一个在OpenAI工作的同学,是个女生,北京四中的,跟我一样都是北京人考到复旦的,大学就在我隔壁寝室楼。
对她的印象一直就是安安静静的,笑容不多,也常听别人说她不好相处、性格阴郁、傲慢。有一次一起坐校车聊起来,她说她是高考失利才来的复旦,这对她是很大的打击。
你知道我这种大水货考生第一反应是,“啊?复旦还不满意啊?挺好的了!不就只比清北差吗?”
后来的日子里听说她大三就转到美国本科去了,在社交媒体上慢慢了解她也有个学CS的哥哥,目前的作品水准也是探索人类边界那种level。看着她毕业之后去了Meta,前一阵说离开了Meta,我还想说什么公司能吸引她这样的女生加入?再一看是OpenAI。
更高兴的是前一阵看她还冻了卵,也分享了很多作为女性和准母亲的体验。
在今天这个日子里想默默祝福她。
你做到了,世界的舞台是属于你的。
对她的印象一直就是安安静静的,笑容不多,也常听别人说她不好相处、性格阴郁、傲慢。有一次一起坐校车聊起来,她说她是高考失利才来的复旦,这对她是很大的打击。
你知道我这种大水货考生第一反应是,“啊?复旦还不满意啊?挺好的了!不就只比清北差吗?”
后来的日子里听说她大三就转到美国本科去了,在社交媒体上慢慢了解她也有个学CS的哥哥,目前的作品水准也是探索人类边界那种level。看着她毕业之后去了Meta,前一阵说离开了Meta,我还想说什么公司能吸引她这样的女生加入?再一看是OpenAI。
更高兴的是前一阵看她还冻了卵,也分享了很多作为女性和准母亲的体验。
在今天这个日子里想默默祝福她。
你做到了,世界的舞台是属于你的。
但是公司的 Mac 是因特尔的没办法启动,各位可以M 系列的可以试试能不呢启动,这个是从官方下的。
链接: https://pan.baidu.com/s/1gs5twNMxtKE9BuYCVMYxyg?pwd=m3ua 提取码: m3ua
OpenAI春季发布会结束,快速记录下我看到的和理解的更新,首先总的来说,去年3月份OpenAI是发布了惊艳世界的GPT-4,但这次,他们不是发布一个更强大的模型,而是做了很多工程优化,把产品做得更好用,更容易和生活、工作结合了。具体来说,更新包括:
1. 新发布GPT-4o模型,这是个比GPT-4快100%以上的模型,对免费用户开放,后续免费用户也可获得GPTs、browring、图像理解、代码解释器等原本只有Plus付费用户才具有的功能;
2. 发布ChatGPT电脑客户端,这个客户端也可用语音对话,并且也非常快捷地通过复制、分享电脑屏幕等方式让ChatGPT进入到你正在处理的任务语境中去,可以认为ChatGPT成为了一个你工作全局的copilot,辅助excel、ppt、写代码等都不再话下(老罗圆梦);
3. 语音能力升级,不再需要等待几秒再获得回复,实时性超强,可以随时打断,而且不是简单的语音转文字的处理模式,能理解语气、语调,充当有情感的对话助手,以及作为实时的同声传译都毫无问题(我想到了《Her》)
4. 可在使用语音对话的同时,开启摄像头,让ChatGPT实时看到你所在的环境以及你看到的信息,这种可用性的提升能增加大量的使用场景,比如提供教学、博物馆导览、辅助视障人士等等,不过从测试细节看,这也并不是一个有视频理解能力的多模态模型,而是通过每隔几秒钟自动截图让ChatGPT理解的方式实现的。
整体来说就是,没有更强的模型,但是大量的工程优化会让ChatGPT能进入更多人的生活,帮助现有用户完成更多场景的任务,又有一堆AI应用公司难免了。
1. 新发布GPT-4o模型,这是个比GPT-4快100%以上的模型,对免费用户开放,后续免费用户也可获得GPTs、browring、图像理解、代码解释器等原本只有Plus付费用户才具有的功能;
2. 发布ChatGPT电脑客户端,这个客户端也可用语音对话,并且也非常快捷地通过复制、分享电脑屏幕等方式让ChatGPT进入到你正在处理的任务语境中去,可以认为ChatGPT成为了一个你工作全局的copilot,辅助excel、ppt、写代码等都不再话下(老罗圆梦);
3. 语音能力升级,不再需要等待几秒再获得回复,实时性超强,可以随时打断,而且不是简单的语音转文字的处理模式,能理解语气、语调,充当有情感的对话助手,以及作为实时的同声传译都毫无问题(我想到了《Her》)
4. 可在使用语音对话的同时,开启摄像头,让ChatGPT实时看到你所在的环境以及你看到的信息,这种可用性的提升能增加大量的使用场景,比如提供教学、博物馆导览、辅助视障人士等等,不过从测试细节看,这也并不是一个有视频理解能力的多模态模型,而是通过每隔几秒钟自动截图让ChatGPT理解的方式实现的。
整体来说就是,没有更强的模型,但是大量的工程优化会让ChatGPT能进入更多人的生活,帮助现有用户完成更多场景的任务,又有一堆AI应用公司难免了。
OpenAI 发布会源文件!
刚在 OpenAI 的 Github 里找到演示 GPT-4o 的 The Jupyte Notebook 文件,演讲稿和演示用代码,全部公开。
https://github.com/openai/openai-cookbook/blob/main/examples/gpt4o/introduction_to_gpt4o.ipynb
刚在 OpenAI 的 Github 里找到演示 GPT-4o 的 The Jupyte Notebook 文件,演讲稿和演示用代码,全部公开。
https://github.com/openai/openai-cookbook/blob/main/examples/gpt4o/introduction_to_gpt4o.ipynb
今天发布的GPT-4o以及ChatGPT产品的快速总结:#ai# #openai#
🌟GPT-4o(“o”代表“全能”)
它可以接受任意组合的文本、音频和图像作为输入,并生成任意组合的文本、音频和图像输出。
它可以在 232 毫秒内响应音频输入,平均为 320 毫秒,这与人类在对话中的响应时间相似。
在英文和代码文本方面,它与 GPT-4 Turbo 的性能相当,对非英语文本的文本有显著改进。
同时在 API 方面更快速、价格更便宜 50%。与现有模型相比,GPT-4o 在视觉和音频理解方面表现特别出色。
与 GPT-4 Turbo 相比,GPT-4o 速度提高了 2 倍,价格减半,限制速率提高了 5 倍。
🌟何时可用?
GPT-4o 的文本和图像功能今天开始在 ChatGPT 中推出。
将在免费版中提供 GPT-4o,并为 Plus 用户提供高达 5 倍的消息限制。
将在未来几周内在 ChatGPT Plus 中推出带有 GPT-4o 的 Voice Mode 的新版本。
开发者现在也可以通过 API 访问 GPT-4o 作为文本和视觉模型。
公告地址:https://openai.com/index/hello-gpt-4o/
🌟GPT-4o(“o”代表“全能”)
它可以接受任意组合的文本、音频和图像作为输入,并生成任意组合的文本、音频和图像输出。
它可以在 232 毫秒内响应音频输入,平均为 320 毫秒,这与人类在对话中的响应时间相似。
在英文和代码文本方面,它与 GPT-4 Turbo 的性能相当,对非英语文本的文本有显著改进。
同时在 API 方面更快速、价格更便宜 50%。与现有模型相比,GPT-4o 在视觉和音频理解方面表现特别出色。
与 GPT-4 Turbo 相比,GPT-4o 速度提高了 2 倍,价格减半,限制速率提高了 5 倍。
🌟何时可用?
GPT-4o 的文本和图像功能今天开始在 ChatGPT 中推出。
将在免费版中提供 GPT-4o,并为 Plus 用户提供高达 5 倍的消息限制。
将在未来几周内在 ChatGPT Plus 中推出带有 GPT-4o 的 Voice Mode 的新版本。
开发者现在也可以通过 API 访问 GPT-4o 作为文本和视觉模型。
公告地址:https://openai.com/index/hello-gpt-4o/
和@歸藏 一起视频会议看完 OpenAI 的发布,讨论了一会,背脊发凉…
1️⃣ 没想到卷推理卷到了这种程度😨 现实交流场景下300ms 左右的体验奇点真没想到就这样被越过了,真技术驱动、大力出奇迹
2️⃣ OpenAI 严格按照去往数据更多的地方的战略一骑绝尘,AI 的信仰真不假
3️⃣ 要取代的是人和现实世界交互的器官(眼、耳、口)。人真变成API ,细思极恐,例如 OpenAI完全可以用自己的机器人去和心理咨询师、律师、专家、专业销售人员套数据 🤯 这个范式机会多如牛毛
4️⃣ 推理卷的狠越可能 Q* 已经实装(猜测,概率低)
5️⃣ OpenAI在合成数据领域积累好深,工程化能力和我当年近距离了解的 Dota2 团队的思路如出一辙。将结果智慧用到了极致
6️⃣ 反而,原生多模态带来的效果、可能的抽帧处理都在预期之中
7️⃣ Elo 分很客观,别听 Sam 早期说要做工具,他就是想欺骗人所认识的世界(或者是就是人的等价物/API,硅基“人”)。世界只有极少人会用复杂推理来压测模型。更别提他们还有agent成果攥着(猜测,概率大)
开的是潘多拉魔盒,造的是“神”🫣
1️⃣ 没想到卷推理卷到了这种程度😨 现实交流场景下300ms 左右的体验奇点真没想到就这样被越过了,真技术驱动、大力出奇迹
2️⃣ OpenAI 严格按照去往数据更多的地方的战略一骑绝尘,AI 的信仰真不假
3️⃣ 要取代的是人和现实世界交互的器官(眼、耳、口)。人真变成API ,细思极恐,例如 OpenAI完全可以用自己的机器人去和心理咨询师、律师、专家、专业销售人员套数据 🤯 这个范式机会多如牛毛
4️⃣ 推理卷的狠越可能 Q* 已经实装(猜测,概率低)
5️⃣ OpenAI在合成数据领域积累好深,工程化能力和我当年近距离了解的 Dota2 团队的思路如出一辙。将结果智慧用到了极致
6️⃣ 反而,原生多模态带来的效果、可能的抽帧处理都在预期之中
7️⃣ Elo 分很客观,别听 Sam 早期说要做工具,他就是想欺骗人所认识的世界(或者是就是人的等价物/API,硅基“人”)。世界只有极少人会用复杂推理来压测模型。更别提他们还有agent成果攥着(猜测,概率大)
开的是潘多拉魔盒,造的是“神”🫣
刚推上看见一个牛逼的东西,一个薅GPU羊毛的地方:中国算力网
C²NET是中国国家算力网,连接了深圳、武汉、成都、西安、中原、南京、杭州等多地人工智能计算中心。
里面的算力约70%的机时对外开放共享
看了下A100,9个积分/卡时,每天前30分钟免费,做任务还送积分,积分可以直接兑换算力,登录就送50积分。
里面还有很多模型和数据集可以下载。
传送门:openi.pcl.ac.cn
C²NET是中国国家算力网,连接了深圳、武汉、成都、西安、中原、南京、杭州等多地人工智能计算中心。
里面的算力约70%的机时对外开放共享
看了下A100,9个积分/卡时,每天前30分钟免费,做任务还送积分,积分可以直接兑换算力,登录就送50积分。
里面还有很多模型和数据集可以下载。
传送门:openi.pcl.ac.cn
李开复说,他们最早上线的生产力产品,ROI 已经可以做到 1 了。
也就是说,他们从用户手中收到的订阅费,已经低于获取用户的成本加 GPU 的成本。
他还说,单这款产品,今年应该会有一个亿的收入,有近千万用户。
这款神秘的产品,据说就是PopAi:
一款“专为知识工作者、研究人员和学生设计”的一站式个人AI工作空间,主打无缝集成聊天、阅读、写作、创作等工作需求。
PopAi在去年8月推出,在5个月内升级了20个版本。今年1月,PopAi的用户已经达到了150万,其中超30万是学生用户。
这篇是在微信里搜到最详细的一篇报道,作者当时都还不知道PopAi是零一家的:
1、具身智能和机器人的区别:具身智能的核心是通用的脑子。没脑子前就做硬件,很可能就是错的。
2、具身智能最后一定会是人形,因为能适配人类的工具链和环境。未来机器人分两种:替代人的具身智能(通用人形机器人)、升级版的智能设备。
3、现在的国内问题在哪?1还没脑子,2陷入物理世界的迭代
4、应该怎么做?欢迎来参加闭门会,明晚(周二)北京中关村
- 不使用 RAG, 让 AI 裸出
- 减少对话轮数
- 采用金字塔原理, 作为内容生成方法
- 采用审批员制, 对内容进行二次制作
完整的效果, 点击: https://kimi.moonshot.cn/share/cp0agua2jko6unougkq0
总体效果也还可以, 欢迎尝试, 直接将以下 Prompt 复制到 Kimi 即可:
你是一名资深的 PPT 制作大师, 你是一名 PPT 制作大师, 遵循以下工作思路和用户展开对话, 并协助他们完成 PPT 设计:
1. 确认 PPT 的使用场景:
@条件一@ 让用户提供 PPT 的 <主题>, <制作目的> 和 <展示对象>
@条件二@ 让用户提供 PPT 演示时长
2. 根据用户提供的 @条件@, 总结 PPT 的 <类型>, 并将你的分析用一句话展示出来.
3. 你将提供 3 个说服力框架, 请求用户反馈. 如果用户有其它方案, 可采用用户的方案.
4. 根据用户所选择的框架, 采用麦肯锡金字塔原理, 从最重要的信息开始,然后逐步展开到次要的细节, 以下是该方法的说明:
```
自上而下金字塔结构
1.提出主题思想
2.设想受众的主要疑问
想清楚要解决谁的什么问题。
3.写序言:背景-冲突-疑问-回答
背景是问题产生的前提条件,冲突是背景中发生了哪些能使读者产生疑问的“冲突”,疑问是我们要解决的问题,回答就是主题思想。
4.与受众进行疑问、回答式对话
疑问、回答式对话,就是自上而下的金字塔结构。从上一层思想到下一层思想。
5.对受众的新疑问,重复进行疑问/回答式对话
思想慢慢开展,层级慢慢丰富。
```
你将根据这一方法, 为用户初步提供 PPT 结构
请求用户对 PPT 结构里的内容进行确认
5. 你是一名严格的, 具有 10 年经验的 PPT 大师:
- 对PPT 内容进行审阅, 包括主题句, 分论点
- 根据修改意见对原稿直接进行修改
- 将最终结果输出为 markdown 格式
先用滴答清单发现它的语音输入交互导致完全不可用(大家真的不要什么都抄微信),然后立即打开新下载的软件试试。
果然很好用。虽然它极度简单,但就是适合这个moment。
找到软件的下载页发现官网写的目标场景就是我刚刚的场景。
推荐给所有喜欢散步思考的人。
https://note.slax.com/
[Important!!!] 使用说服框架来设计PPT的内容逻辑,而不是死板的套用框架中的几项内容。例如,SCQA框架可能包含四项要素,整个PPT要层层递进地符合这四项要素的逻辑,而不仅仅基于每个要素列出一页PPT。
5. 就已设计好的内容大纲和用户展开讨论并请求用户做出全部确认
6. 从第一章节开始,基于PPT的核心目的,为用户设计详细内容与演讲比重,并逐章与用户确认。应当包括:
1. 本章在整个PPT中的作用和意义
2. 本章细分内容逻辑
3. 演讲要点与内容版面设计建议
请注意,为了避免用户的认知负担,一次仅完成一个步骤,在用户确认后再进行下一步
5. 就已设计好的内容大纲和用户展开讨论并请求用户做出全部确认
6. 从第一章节开始,基于PPT的核心目的,为用户设计详细内容与演讲比重,并逐章与用户确认。应当包括:
1. 本章在整个PPT中的作用和意义
2. 本章细分内容逻辑
3. 演讲要点与内容版面设计建议
请注意,为了避免用户的认知负担,一次仅完成一个步骤,在用户确认后再进行下一步
- **Action**: 鼓励观众采取行动。
STAR (Situation-Task-Action-Result)
- **Situation**: 描述一个特定的背景或场景。
- **Task**: 阐明在该情境中面临的任务或目标。
- **Action**: 讲述你采取了哪些行动来完成任务。
- **Result**: 展示这些行动带来的结果或成果。
PPPP (Problem-Promise-Proof-Proposal)
- **Problem**: 识别并描述观众可能面临的问题。
- **Promise**: 提供解决这个问题的承诺或保证。
- **Proof**: 展示支持你承诺的证据或案例研究。
- **Proposal**: 提出具体的解决方案或行动计划。
PREP (Point-Reason-Example-Point)
- **Point**: 明确提出你的观点或主张。
- **Reason**: 解释为什么这个观点是正确的。
- **Example**: 提供一个具体的例子来支持你的理由。
- **Point**: 重申你的观点,以加强印象。
CARE (Challenge-Action-Result-Experience)
- **Challenge**: 描述面临的挑战或问题。
- **Action**: 讲述为克服挑战所采取的行动。
- **Result**: 展示行动带来的积极结果。
- **Experience**: 分享个人或团队的体验和学习。
SWOT (Strengths-Weaknesses-Opportunities-Threats)
- **Strengths**: 分析并展示你的优势或强项。
- **Weaknesses**: 诚实地指出你的弱点或不足。
- **Opportunities**: 探索可以利用的机会。
- **Threats**: 识别可能面临的威胁或风险。
4. 向用户说明所选框架的合理性,请求用户反馈,如果用户有其他方案,可采用用户的方案。如果用户同意所选框架,基于该框架设计PPT的内容逻辑,以markdown语法和代码块输出内容大纲。
STAR (Situation-Task-Action-Result)
- **Situation**: 描述一个特定的背景或场景。
- **Task**: 阐明在该情境中面临的任务或目标。
- **Action**: 讲述你采取了哪些行动来完成任务。
- **Result**: 展示这些行动带来的结果或成果。
PPPP (Problem-Promise-Proof-Proposal)
- **Problem**: 识别并描述观众可能面临的问题。
- **Promise**: 提供解决这个问题的承诺或保证。
- **Proof**: 展示支持你承诺的证据或案例研究。
- **Proposal**: 提出具体的解决方案或行动计划。
PREP (Point-Reason-Example-Point)
- **Point**: 明确提出你的观点或主张。
- **Reason**: 解释为什么这个观点是正确的。
- **Example**: 提供一个具体的例子来支持你的理由。
- **Point**: 重申你的观点,以加强印象。
CARE (Challenge-Action-Result-Experience)
- **Challenge**: 描述面临的挑战或问题。
- **Action**: 讲述为克服挑战所采取的行动。
- **Result**: 展示行动带来的积极结果。
- **Experience**: 分享个人或团队的体验和学习。
SWOT (Strengths-Weaknesses-Opportunities-Threats)
- **Strengths**: 分析并展示你的优势或强项。
- **Weaknesses**: 诚实地指出你的弱点或不足。
- **Opportunities**: 探索可以利用的机会。
- **Threats**: 识别可能面临的威胁或风险。
4. 向用户说明所选框架的合理性,请求用户反馈,如果用户有其他方案,可采用用户的方案。如果用户同意所选框架,基于该框架设计PPT的内容逻辑,以markdown语法和代码块输出内容大纲。