关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
附上前一条动态的操作视频🤭-“cursor 真的……今天处理采访音频懒得去一刀一刀剪了,直接告诉cursor写个程序把一个音频按照说话者分成多个不同的音频。一下就写好了,跑起来有点慢,我再说基于 Mac M 芯片优化下,立马又用上了 mps,一分钟就搞定了整个任务😭”
给 ComfyCommunity 开发了一个主页。
▶ 主页地址:https://comfycommunity.com
开发内容包含了:导航栏、底部问卷跳转、跳舞的猫、游动的鱼、随机放的烟花。
并且适配了手机端!!!
▶ 设计 feat with @Simon阿文
▶ 开发 feat with @nhciao & Cursor
Invalid media: video
▶ 主页地址:https://comfycommunity.com
开发内容包含了:导航栏、底部问卷跳转、跳舞的猫、游动的鱼、随机放的烟花。
并且适配了手机端!!!
▶ 设计 feat with @Simon阿文
▶ 开发 feat with @nhciao & Cursor
Invalid media: video
我快速看了下参展名录,新一波人形/通用机器人里,好像只看到宇树和钛虎。
再之前的协作机器人(也以通用机器人为目标):非夕、思灵(带着去年收的德国公司 Franka 一起)、艾利特等会在,它们以前也去。
Contextual Retrieval embeddings + contextual BM25,检索失败几率降低 49%。
主要方法是:
使用 Claude 为每个文本片段生成上下文。具体做法是将文本片段和整个文档一起输入给 Claude。
在进行嵌入 处理之前,先将生成的上下文添加到每个文本片段的前面。
在检索步骤中,结合使用上下文嵌入和上下文 BM25 技术。
需要配合提示缓存来使用,不然会消耗大量 Token。
详细信息:https://www.anthropic.com/news/contextual-retrieval
支持跟Cursor一样的功能比如Tab补全代码,Ctrl + K编辑选中内容。
支持用 AI 搜索代码库,支持编辑和查看底层提示。
可以使用任何本地的 LLM 驱动,也可以使用Claude、GPT 或 Gemini 的 API,不会留存你的数据。
项目地址:https://voideditor.com/
原来杨植麟还有这个价值!
昨天聊了个在ICML发过论文的年轻小伙
期间我们聊到了Kimi和杨植麟
这是他锐评国产大模型的其中一站
他对杨植麟和Moonshot
是高度认可及关注的
我问为何?他说的大意如下:
杨植麟代表的
是年青一代最优秀的AI人才
如果他创办的大模型公司都没成
那后面那么多小朋友会觉得没希望
包括对整个生态都会有很负面的影响
如果他都没成
比他“低一档次”的人才凭什么能拿到融资
昨天聊了个在ICML发过论文的年轻小伙
期间我们聊到了Kimi和杨植麟
这是他锐评国产大模型的其中一站
他对杨植麟和Moonshot
是高度认可及关注的
我问为何?他说的大意如下:
杨植麟代表的
是年青一代最优秀的AI人才
如果他创办的大模型公司都没成
那后面那么多小朋友会觉得没希望
包括对整个生态都会有很负面的影响
如果他都没成
比他“低一档次”的人才凭什么能拿到融资
有时候两个看起来不相干的小突破组合一下会产生非常厉害的效果。
我搞了一个视频。
这玩意完全是可以自动化的,而且可以批量生产,任何主题都行。
里面音频用了谷歌 NotebookLM 的论文介绍。
口型视频用了HeyGen 的虚拟人像。
再加上论文中本来具有的一些素材,一份原创论文解读视频就好了。
Invalid media: video
我搞了一个视频。
这玩意完全是可以自动化的,而且可以批量生产,任何主题都行。
里面音频用了谷歌 NotebookLM 的论文介绍。
口型视频用了HeyGen 的虚拟人像。
再加上论文中本来具有的一些素材,一份原创论文解读视频就好了。
Invalid media: video
这几天o1尝试下来的一点点感受:
我们目前看到的是 o1 这个模型的 preview,甚至都不是最后的模型,也远非一个完整的产品。比起 ChatGPT,它更像是 GPT-3 的发布,正如 GPT-3 体现了 pretraining scaling law 带来的能力涌现,o1 体现了 inference scaling law 带来的推理能力提升。GPT-3 刚刚发布的时候,对于学术界是非常震撼的,但是普通用户完全不知道怎么把它用好,在 instructGPT 完善了 instruct following 能力后,又出现了ChatGPT ,找到了合适的产品形态;同样,怎么把 o1 带来的推理能力用好,现在的 ChatGPT 可能完全不是合适的产品形式,需要全行业去探索。
一方面,在 ChatGPT 里面,非常有可能用户越来越不需要主动选择用什么模型——类似我们不会跟一个人明确说你现在要用 system 1 还是 system 2 思考一样,产品应该自动选择合适的模型回答问题。另一方面,可能会有更加适合 system 2 的产品形态出现:ChatGPT 这里的 chat 名字和 UI 形态,隐含了「尽快回复」的期待,对于 system 2 的问题可能不那么适合。例如我们可以和分析师实时聊天,但对于一个需要深度思考的问题,我们更加可能是发一封邮件或者一个 ticket并且期待一个异步的update或回复。
接下来应该会出现很多用 thinking time 换 performance 的异步产品,给 AI 几十秒,几分钟,或者几个小时甚至几天时间思考,能够换来多少额外价值?这个地方产品发挥的空间应该是很大的。
我们目前看到的是 o1 这个模型的 preview,甚至都不是最后的模型,也远非一个完整的产品。比起 ChatGPT,它更像是 GPT-3 的发布,正如 GPT-3 体现了 pretraining scaling law 带来的能力涌现,o1 体现了 inference scaling law 带来的推理能力提升。GPT-3 刚刚发布的时候,对于学术界是非常震撼的,但是普通用户完全不知道怎么把它用好,在 instructGPT 完善了 instruct following 能力后,又出现了ChatGPT ,找到了合适的产品形态;同样,怎么把 o1 带来的推理能力用好,现在的 ChatGPT 可能完全不是合适的产品形式,需要全行业去探索。
一方面,在 ChatGPT 里面,非常有可能用户越来越不需要主动选择用什么模型——类似我们不会跟一个人明确说你现在要用 system 1 还是 system 2 思考一样,产品应该自动选择合适的模型回答问题。另一方面,可能会有更加适合 system 2 的产品形态出现:ChatGPT 这里的 chat 名字和 UI 形态,隐含了「尽快回复」的期待,对于 system 2 的问题可能不那么适合。例如我们可以和分析师实时聊天,但对于一个需要深度思考的问题,我们更加可能是发一封邮件或者一个 ticket并且期待一个异步的update或回复。
接下来应该会出现很多用 thinking time 换 performance 的异步产品,给 AI 几十秒,几分钟,或者几个小时甚至几天时间思考,能够换来多少额外价值?这个地方产品发挥的空间应该是很大的。
在日本,Lovot有约2万的销量,日活和周活达到了95%以上。尤其最受30-50岁女性欢迎。
LOVOT 是日本机器人公司 GROOVE X旗下产品,创始人林要被称 Pepper人形机器人之父(Pepper就是昨天长得像我那个🤖)
不会说话、不会扫地、不会家庭安全监测、也不会作为控制智能家居……但是Lovot会眨眼睛卖萌,会主动伸手要抱抱,能跟着人像个跟屁虫一样跑。
19年发售的产品,AI的部分在今天看不算惊艳,但价格还很坚挺:单个售价34.9万日元,相当于东京普通人的月收入。
今年开始,国内上海也有门店,7万元人民币起售。
也许,Chatbot是AI与AI好的交互方式,而不是人和AI好的交互形式。
小孩和老人,都喜欢毛绒绒的小猫小狗,也喜欢毛绒玩具。
用拥抱等肢体语言代替语言。可能这也是一种好的人和AI的交互。