关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
最近看了很多人形机器人的Demo,昨天还去傅立叶拜访了一下。对比各家来看,Optimus 的步态明显地比当前所有的人形机器人都要好。
Optimus 的这个迭代速度,加上他们展现出来的极快的技术迭代(最好的硬件、最好的运控、遥操数据采集、simulation、源自自动驾驶的路径规划、AI 赋能manipulation... ),已经遥遥领先了。
记得前段时间特别想开一个机器人相关的课题,对比一看国内和国外的Robotics Lab真的差距明显。对人形来说,虽然人形整体还在早期,但我怀疑过几年就会像ChatGPT一样出来一个很难追上的技术产品,相比之下现在的差距还可以追赶一下。
国内的几家人形机器人(宇树、傅立叶、追觅、智元)要加油了。
Optimus 的这个迭代速度,加上他们展现出来的极快的技术迭代(最好的硬件、最好的运控、遥操数据采集、simulation、源自自动驾驶的路径规划、AI 赋能manipulation... ),已经遥遥领先了。
记得前段时间特别想开一个机器人相关的课题,对比一看国内和国外的Robotics Lab真的差距明显。对人形来说,虽然人形整体还在早期,但我怀疑过几年就会像ChatGPT一样出来一个很难追上的技术产品,相比之下现在的差距还可以追赶一下。
国内的几家人形机器人(宇树、傅立叶、追觅、智元)要加油了。
2024年,人形机器人赛道将会迎来哪些技术变革?距离人人都能买起机器人的时代还有多远?热门玩家们又是否会在这一年发生洗牌,有人在商业化上上岸,有人出局?
这些问题将决定人形机器人赛道的走向和玩家们的生存,在深度走访对话多位业内人士后发现,决胜焦点集中在这三个关键:制造成本的持续降低、应用场景的开拓、以及用什么样的算力来驱动人形机器人的大脑。
涨价倒计时最后1天,今晚24点涨价到19.9元,恭喜入手的同学们!
下一步就是多了解各个项目的拆解细节,了解别人是怎么玩的,如果是自己的话该怎么入手,别人为什么可以,你为什么不可以。
他提出了模型设计师这一职位,指出设计师不应仅仅关注AI模型的界面设计,而应深入了解模型的核心构造。
不过这个内容主要还是跟 LLM 相关,设计师在图像和视频模型的优化和训练上其实可以做更多事情,重要性也比 LLM 要更强,我找时间写一下这部分内容。
模型设计师的职责包括与工程团队紧密合作,应对AI模型构建中固有的诸如幻觉、隐私和偏见等问题。
还给出了一些模型设计师需要做的例子,比如通过体验优化引导和简化用户书写提示词的难度等。
翻译及原文:https://quail.ink/op7418/p/model-designer-rise
最近在看合同全周期管理系统(contract lifecycle management system)的时候遇到UPenn法学院的这篇文章,不得不说法学研究者写文章真的严谨。此文虽长但读来并不枯燥,反而妙趣横生。一边读一边笔记,最后整理了一篇公众号文章,没有时间详读原文的小伙伴可以借此文快速了解文章梗概和亮点。也欢迎大家关注公众号Life Transformer。
用Kimi Chat 总结微信公众号文章的Prompt
```
1. 📌 元数据概览:
- 标题:请简要描述文章的标题和其可能的主题。
- 作者:提供文章作者的名称,如果有可能,简述其背景或专业领域。
- 链接:提供文章的具体网址,确保链接有效且指向正确的内容。
- 标签:列出文章的关键词或标签,以便快速了解文章的主要内容领域。
2. ✨ 核心观点与亮点:
- 主张:总结文章的核心论点或主张,阐述作者试图传达的主要信息或观点。
- 亮点:指出文章中特别有洞察力或创新的部分,例如独特的分析方法、新颖的观点或实用的建议。
3. 🔍 逐层深入理解:
- 开始:概述文章的引入部分,包括提出的问题或讨论的背景。
- 发展:描述文章如何展开论述,包括使用的方法、论据或例证。
- 结论:总结文章的结论部分,包括作者的最终观点或提出的解决方案。
4. 📚 关键术语/概念:
- 列出并解释文章中引入的关键术语或概念,以便更好地理解文章的内容。
5. 🚫 无关信息过滤:
- 指出文章中可能的冗余或偏离主题的信息,这些信息对理解文章的核心内容不是必需的。
6. 🌟 文章摘要:
- 简要总结文章的核心信息,包括主要论点、支撑论据以及作者的结论或建议。
7. 💡 金句提取:
- 引用文章中最精彩或最具启发性的一句或几句话,这些金句应能够体现文章的精髓。
8. 🔄 总结归纳:
- 综合以上内容,提供一个精炼的总结,捕捉文章的精华并强调其对读者的价值。
9. ❓ 引发思考的问题:
- 基于文章内容,提出一两个问题,旨在激发读者的思考,可能与文章的应用、批评或进一步探索相关。
```
按照上述输出模板总结这篇文章:https://mp.weixin.qq.com/s/bjWgILO0JPpTB1PFGKVAtg
```
1. 📌 元数据概览:
- 标题:请简要描述文章的标题和其可能的主题。
- 作者:提供文章作者的名称,如果有可能,简述其背景或专业领域。
- 链接:提供文章的具体网址,确保链接有效且指向正确的内容。
- 标签:列出文章的关键词或标签,以便快速了解文章的主要内容领域。
2. ✨ 核心观点与亮点:
- 主张:总结文章的核心论点或主张,阐述作者试图传达的主要信息或观点。
- 亮点:指出文章中特别有洞察力或创新的部分,例如独特的分析方法、新颖的观点或实用的建议。
3. 🔍 逐层深入理解:
- 开始:概述文章的引入部分,包括提出的问题或讨论的背景。
- 发展:描述文章如何展开论述,包括使用的方法、论据或例证。
- 结论:总结文章的结论部分,包括作者的最终观点或提出的解决方案。
4. 📚 关键术语/概念:
- 列出并解释文章中引入的关键术语或概念,以便更好地理解文章的内容。
5. 🚫 无关信息过滤:
- 指出文章中可能的冗余或偏离主题的信息,这些信息对理解文章的核心内容不是必需的。
6. 🌟 文章摘要:
- 简要总结文章的核心信息,包括主要论点、支撑论据以及作者的结论或建议。
7. 💡 金句提取:
- 引用文章中最精彩或最具启发性的一句或几句话,这些金句应能够体现文章的精髓。
8. 🔄 总结归纳:
- 综合以上内容,提供一个精炼的总结,捕捉文章的精华并强调其对读者的价值。
9. ❓ 引发思考的问题:
- 基于文章内容,提出一两个问题,旨在激发读者的思考,可能与文章的应用、批评或进一步探索相关。
```
按照上述输出模板总结这篇文章:https://mp.weixin.qq.com/s/bjWgILO0JPpTB1PFGKVAtg
🚨 哇,Arc 浏览器又整活了!终于等到移动端~
🫣 我以为是更新 Arc 浏览器就好了,实际上必须从 App Store 搜索下载 Arc Search
🤔 那么 Arc Search 有什么特点呢?最大的特点就是输入文字后既可以直接用搜索引擎搜索,还可以点击「Browse for Me」,通俗来讲就是 Arc 会根据网页内容智能整理一个报告(类似于 Perplexity),还可以追溯原网页
🤷 缺点,估计是刚刚上线的原因,响应速度时快时慢。以下视频剪辑掉了等待时间,生成部分 8 倍速……
🫣 我以为是更新 Arc 浏览器就好了,实际上必须从 App Store 搜索下载 Arc Search
🤔 那么 Arc Search 有什么特点呢?最大的特点就是输入文字后既可以直接用搜索引擎搜索,还可以点击「Browse for Me」,通俗来讲就是 Arc 会根据网页内容智能整理一个报告(类似于 Perplexity),还可以追溯原网页
🤷 缺点,估计是刚刚上线的原因,响应速度时快时慢。以下视频剪辑掉了等待时间,生成部分 8 倍速……
Minimax的AI对话机器人问答产品海螺问问上线了,产品的语音对话能力、模型能力以及体验打磨都非常的不错。
体验好的一方面是海螺问问有非常自然的语音模型接入,支持语音回答问题。
还支持跟软件进行类似 ChatGPT 的实时的 AI 语音对话,但是没有 ChatGPT 那股外国腔,比如视频第一段的演示。
语音能力的另外一个杀手锏是,可以在海螺问问里面训练自己的语音模型,而且这个过程非常简单,只需要阅读屏幕上显示的一段话就可以。比如20 秒以后的视频配音就是我自己的模型。
然后就是模型能力,海螺问问接入的是 Minimax 的 Moe 模型,所以在很多特殊任务的处理上会比同规模的其他不是 Moe架构的模型要强很多。
它也支持图像的多模态识别,比如我这里在出租车的时候拍了一张照片让它识别内容,它识别出了座位下面的报纸和前面的车座,同时还进行了一定的推理,判断出这个车可能是用来拉人的不是自用的。
最后是海螺问问的整个UI细节和交互逻辑都是经过精细打磨过的,比如输入框为了支持长内容输入是可以展开的,而且支持按住Command 加上回车换行,从Web到移动端非常一致且有温度的UI界面样式。
另外海螺问问现在也是免费的,尤其是语音能力的加持让他的使用场景变得更多了,如果你不方便使用或者嫌 ChatGPT 慢的话,可以试试跟海螺问问聊聊。
这里使用:https://hailuoai.com?origin=op7418
体验好的一方面是海螺问问有非常自然的语音模型接入,支持语音回答问题。
还支持跟软件进行类似 ChatGPT 的实时的 AI 语音对话,但是没有 ChatGPT 那股外国腔,比如视频第一段的演示。
语音能力的另外一个杀手锏是,可以在海螺问问里面训练自己的语音模型,而且这个过程非常简单,只需要阅读屏幕上显示的一段话就可以。比如20 秒以后的视频配音就是我自己的模型。
然后就是模型能力,海螺问问接入的是 Minimax 的 Moe 模型,所以在很多特殊任务的处理上会比同规模的其他不是 Moe架构的模型要强很多。
它也支持图像的多模态识别,比如我这里在出租车的时候拍了一张照片让它识别内容,它识别出了座位下面的报纸和前面的车座,同时还进行了一定的推理,判断出这个车可能是用来拉人的不是自用的。
最后是海螺问问的整个UI细节和交互逻辑都是经过精细打磨过的,比如输入框为了支持长内容输入是可以展开的,而且支持按住Command 加上回车换行,从Web到移动端非常一致且有温度的UI界面样式。
另外海螺问问现在也是免费的,尤其是语音能力的加持让他的使用场景变得更多了,如果你不方便使用或者嫌 ChatGPT 慢的话,可以试试跟海螺问问聊聊。
这里使用:https://hailuoai.com?origin=op7418
目前第一个版本只做了封面图片生成功能,没有打通微信红包封面的审核流程,也不能给到 C 端用户在发红包的时候使用。
正在思考如何实现全流程闭环,请大家先体验已有功能,提点意见~过几天择机开源。😏