关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
在科技的助力下,有时候依托系统快速升温和精准控温技术,炒菜甚至还能还原出大厨颠锅炒制时的‘锅气’,这其实已经远超部分人类的做菜水平。更是有餐饮机器人企业透露,下阶段的目标就是尝试借助大模型等新技术,实现中国餐饮调味体系的数字化,并用科学还原甚至超越传统烹饪的极限。
和大家分享 5 款不错的 AI 工具:
1.Postnitro:小红书做号神器
2.TTS-Online:多语言文字转语音平台
3.AI Comic Factory:漫画生成工具
4.MyLens:时间线生成工具
5.Aminer:新一代 AI 学术搜索平台
后端是Mixtral-8x7b 模型,托管在 LeptonAI 上,输出速度能达到每秒大约200个 token,用的搜索引擎是 Bing 的搜索 API。
作者还写了一下自己的经验:
(1) 搜索质量至关重要。优质的摘要片段是形成精准概括的关键。
(2) 适当加入一些虚构内容实际上有助于补充摘要片段中缺失的“常识性信息”。
(3) 在进行内容概括时,开源模型表现出了卓越的效果。
这里尝试:https://search.lepton.run/
🚀 AI 新知:为什么基础代理将会是下一个革命性技术?
来自英伟达高级研究员 & AI Agents负责人Jim Fan 近期释放的TED 演讲,《The next grand challenge for AI》提出了「基础代理」将在虚拟世界和物理世界中无缝运行。他解释了这项技术将如何从根本上改变我们的生活--渗透到从视频游戏、元宇宙到无人机和仿人机器人的方方面面--并探讨了这一模型如何掌握跨越这些不同现实的技能。
他提出「基础代理」(Foundation Agent)的秘诀:一个单一的模型,可以学习如何在不同的世界中行动。
(如果你之前不太熟悉AI agents相关基础知识, 可以结合文本内容补充相关知识点,Enjoy)
🎮 「基础代理」中的智能体, Voyager 是什么??
- 它是一个在 Minecraft开放世界中无限学习的智能体。Voyager 可以自己写代码、自我迭代、不断完善技能库中,实现无限学习(Longlife learning)的探索过程。
- 这里核心只有一个,就是无限迭代。 它不断扩充自己的技能图书馆, 无论是在游戏中制作工具,并升级科技树(例如,从Wooden Tool 到Iron Tool), 全部是自主迭代、自主验证的。 它不仅是自动化,它是通过一套机制自主学习 [1]。
- 它建立在GPT-4之上,并解锁了一个新的范式:「训练」在这个语境下是执行代码;「训练模型」是Voyager迭代组成的技能代码库,而不是浮点矩阵。
- Voyager 作为一个超级玩家,在《我的世界》中,它获得了3.3倍的独特物品,旅行了2.3倍的距离,解锁关键技术树里程碑的速度比之前的方法快15.3倍。它还开源的。 [1]
🤖 为什么这个「基础代理」具有非凡意义?
- LLM 适用于大量文本,而基础代理可以跨越很多很多现实。 基础代理 已经在虚拟世界被验证强大的学习自主性。
- 其次,Jim Fan 认为它具有跨越Reality的拓展性。 开放游戏世界Minecraft 只是作为一个模拟现实(simulated realities)和实验基地,他们还在其他仿真环境进行训练和探索得到惊人进展。[2]
- 如果它能够掌握 10,000 种不同的模拟现实,那么它就能很好地推广到我们的物理世界,而物理世界只是第 10,001 个现实。
- 换句话说,它正在加速应用于物理世界,特别是机器人技术。 参考Jim Fan的PPT 。 [3]
📒 Hans 注释:
[1] 这套自主学习和迭代的机制,有三个核心组件: a)结合游戏反馈、执行错误、自我验证来完善程序的迭代提示机制;(让 GPT-4 写代码 ) b)用于存储和检索复杂行为的技能代码库;(任务的完善和迭代,成为了技能) c)最大化探索的自动课程。Hans 在去年相关论文讨论的《当GPT-4 遇上开放世界》中,有更详细的解读。 https://m.okjike.com/originalPosts/647db839f039ad00d6c6b2f7
[2] 英伟达 Isaac Gym 是一个功能强大的端到端 GPU 加速仿真环境,用于强化学习,可用于训练机器人和模型。它是英伟达 Omniverse 平台的一部分,为机器人和计算机视觉算法提供基于物理的高保真模拟。
[3] TED 视频中Jim Fan的PPT :https://drive.google.com/file/d/1NSY6MxMu3OPQ4U6hx0OxPq7EQB5XTcAG/view
Invalid media: video
来自英伟达高级研究员 & AI Agents负责人Jim Fan 近期释放的TED 演讲,《The next grand challenge for AI》提出了「基础代理」将在虚拟世界和物理世界中无缝运行。他解释了这项技术将如何从根本上改变我们的生活--渗透到从视频游戏、元宇宙到无人机和仿人机器人的方方面面--并探讨了这一模型如何掌握跨越这些不同现实的技能。
他提出「基础代理」(Foundation Agent)的秘诀:一个单一的模型,可以学习如何在不同的世界中行动。
(如果你之前不太熟悉AI agents相关基础知识, 可以结合文本内容补充相关知识点,Enjoy)
🎮 「基础代理」中的智能体, Voyager 是什么??
- 它是一个在 Minecraft开放世界中无限学习的智能体。Voyager 可以自己写代码、自我迭代、不断完善技能库中,实现无限学习(Longlife learning)的探索过程。
- 这里核心只有一个,就是无限迭代。 它不断扩充自己的技能图书馆, 无论是在游戏中制作工具,并升级科技树(例如,从Wooden Tool 到Iron Tool), 全部是自主迭代、自主验证的。 它不仅是自动化,它是通过一套机制自主学习 [1]。
- 它建立在GPT-4之上,并解锁了一个新的范式:「训练」在这个语境下是执行代码;「训练模型」是Voyager迭代组成的技能代码库,而不是浮点矩阵。
- Voyager 作为一个超级玩家,在《我的世界》中,它获得了3.3倍的独特物品,旅行了2.3倍的距离,解锁关键技术树里程碑的速度比之前的方法快15.3倍。它还开源的。 [1]
🤖 为什么这个「基础代理」具有非凡意义?
- LLM 适用于大量文本,而基础代理可以跨越很多很多现实。 基础代理 已经在虚拟世界被验证强大的学习自主性。
- 其次,Jim Fan 认为它具有跨越Reality的拓展性。 开放游戏世界Minecraft 只是作为一个模拟现实(simulated realities)和实验基地,他们还在其他仿真环境进行训练和探索得到惊人进展。[2]
- 如果它能够掌握 10,000 种不同的模拟现实,那么它就能很好地推广到我们的物理世界,而物理世界只是第 10,001 个现实。
- 换句话说,它正在加速应用于物理世界,特别是机器人技术。 参考Jim Fan的PPT 。 [3]
📒 Hans 注释:
[1] 这套自主学习和迭代的机制,有三个核心组件: a)结合游戏反馈、执行错误、自我验证来完善程序的迭代提示机制;(让 GPT-4 写代码 ) b)用于存储和检索复杂行为的技能代码库;(任务的完善和迭代,成为了技能) c)最大化探索的自动课程。Hans 在去年相关论文讨论的《当GPT-4 遇上开放世界》中,有更详细的解读。 https://m.okjike.com/originalPosts/647db839f039ad00d6c6b2f7
[2] 英伟达 Isaac Gym 是一个功能强大的端到端 GPU 加速仿真环境,用于强化学习,可用于训练机器人和模型。它是英伟达 Omniverse 平台的一部分,为机器人和计算机视觉算法提供基于物理的高保真模拟。
[3] TED 视频中Jim Fan的PPT :https://drive.google.com/file/d/1NSY6MxMu3OPQ4U6hx0OxPq7EQB5XTcAG/view
Invalid media: video
前几天刷到了好几个用Pixverse做的好视频,刚好他们最近上线了网页版本和新模型就想顺便测试一下和 Runway 以及 Pika 的质量相比怎么样。
先说结论:
如果不考虑其他功能和交互我这次测试的结果Pixverse和 Pika 的质量接近分别是 74.5 分和 73.5 分。Runway 效果居然最差只有 64.5 分。
Pixverse的模型是这三者最为平衡的,可以有比较强的运动幅度,同时可以维持较好的一致性,模型可以比较好的对提示词进行响应,尤其是 2.5D 那个镜头非常的惊艳,但是纯二次元图片的效果也不是很好。
Pika 在动漫和 2.5D 风格上的优势巨大,但是只有 Pika 每次生成是 3秒钟,所以图像质量打分会比其他两个差,写实风格效果也不是很如意,图像质量以及一致性相对差一些。
Runway 的模型质量和上面两者差距较大,主要是二次元风格的还原度太差还有 2.5D 风格直接无法维持一致性,写实场景对复杂画面改动较大有时候无法维持画面一致性,但是 Runway 对生成内容的控制还是三者最强的,因为其他两个都没有所以这部分就不计入分数。
这里使用Pixverse:https://app.pixverse.ai/create/
说一下测试的内容这次只测试视频模型的质量,所以三者都会使用图生视频来测试,这样可以忽略各自的图像模型的差距。
另外每个都会使用物品特写、写实风景、写实人像、皮克斯 2.5D 风格、 2D 动画风格,这五种风格,然后每张图片生成的视频会从主题一致性、运动平滑度、运动程度以及成像质量这四个维度进行主观评分,每张图片随机一次,所以评分非常主观不保证复现,就是给大家使用的时候一个参考。
下面是具体每个测试的分数,视频是三者生成视频的对比:
物品特写-橘子落水:
Runway 主题一致性4分、运动平滑度 4分、运动程度 4.5分、成像质量 3.5分 、总分: 16
Pixverse 主题一致性4分、运动平滑度 4分、运动程度 3.5分 、成像质量 4分 、总分:15.5
Pika 主题一致性 3.5分、运动平滑度 4分、运动程度 4分 、成像质量 3.5分、总分:15
写实风景-伦敦塔着火:
Runway:主题一致性2分、运动平滑度 4分、运动程度 4分、成像质量 3.5分 、总分: 13.5
Pixverse:主题一致性4分、运动平滑度 4分、运动程度 3.5分 、成像质量 4分 、总分:15.5
Pika:主题一致性 3.5分、运动平滑度 3.5分、运动程度 3.5分 、成像质量 3.5分、总分:14
皮克斯 2.5D 风格-拟人狐狸:
Runway:主题一致性2分、运动平滑度 3.5分、运动程度 4分、成像质量 2分 、总分: 11.5
Pixverse:主题一致性4分、运动平滑度 4分、运动程度 4分 、成像质量 4分 、总分:16
Pika:主题一致性 3.5分、运动平滑度 4分、运动程度 3.5分 、成像质量 3.5分、总分:14.5
写实人像-水面古装:
Runway:主题一致性4分、运动平滑度 4分、运动程度 2分、成像质量 3.5分 、总分: 13.5
Pixverse:主题一致性4分、运动平滑度 4分、运动程度 4分 、成像质量 4分 、总分:16
Pika:主题一致性 3分、运动平滑度 3.5分、运动程度 4.5分 、成像质量 3分、总分:14
动漫场景-植物园女孩:
Runway:主题一致性 1分、运动平滑度 2分、运动程度 4分、成像质量 3分 、总分:10
Pixverse:主题一致性3分、运动平滑度 3分、运动程度 2.5分 、成像质量 3分 、总分:11.5
Pika:主题一致性 4分、运动平滑度 4分、运动程度 4.5分 、成像质量 3.5分、总分:16
总分: Runway:64.5、Pixverse:74.5 、Pika:73.5
Invalid media: video
先说结论:
如果不考虑其他功能和交互我这次测试的结果Pixverse和 Pika 的质量接近分别是 74.5 分和 73.5 分。Runway 效果居然最差只有 64.5 分。
Pixverse的模型是这三者最为平衡的,可以有比较强的运动幅度,同时可以维持较好的一致性,模型可以比较好的对提示词进行响应,尤其是 2.5D 那个镜头非常的惊艳,但是纯二次元图片的效果也不是很好。
Pika 在动漫和 2.5D 风格上的优势巨大,但是只有 Pika 每次生成是 3秒钟,所以图像质量打分会比其他两个差,写实风格效果也不是很如意,图像质量以及一致性相对差一些。
Runway 的模型质量和上面两者差距较大,主要是二次元风格的还原度太差还有 2.5D 风格直接无法维持一致性,写实场景对复杂画面改动较大有时候无法维持画面一致性,但是 Runway 对生成内容的控制还是三者最强的,因为其他两个都没有所以这部分就不计入分数。
这里使用Pixverse:https://app.pixverse.ai/create/
说一下测试的内容这次只测试视频模型的质量,所以三者都会使用图生视频来测试,这样可以忽略各自的图像模型的差距。
另外每个都会使用物品特写、写实风景、写实人像、皮克斯 2.5D 风格、 2D 动画风格,这五种风格,然后每张图片生成的视频会从主题一致性、运动平滑度、运动程度以及成像质量这四个维度进行主观评分,每张图片随机一次,所以评分非常主观不保证复现,就是给大家使用的时候一个参考。
下面是具体每个测试的分数,视频是三者生成视频的对比:
物品特写-橘子落水:
Runway 主题一致性4分、运动平滑度 4分、运动程度 4.5分、成像质量 3.5分 、总分: 16
Pixverse 主题一致性4分、运动平滑度 4分、运动程度 3.5分 、成像质量 4分 、总分:15.5
Pika 主题一致性 3.5分、运动平滑度 4分、运动程度 4分 、成像质量 3.5分、总分:15
写实风景-伦敦塔着火:
Runway:主题一致性2分、运动平滑度 4分、运动程度 4分、成像质量 3.5分 、总分: 13.5
Pixverse:主题一致性4分、运动平滑度 4分、运动程度 3.5分 、成像质量 4分 、总分:15.5
Pika:主题一致性 3.5分、运动平滑度 3.5分、运动程度 3.5分 、成像质量 3.5分、总分:14
皮克斯 2.5D 风格-拟人狐狸:
Runway:主题一致性2分、运动平滑度 3.5分、运动程度 4分、成像质量 2分 、总分: 11.5
Pixverse:主题一致性4分、运动平滑度 4分、运动程度 4分 、成像质量 4分 、总分:16
Pika:主题一致性 3.5分、运动平滑度 4分、运动程度 3.5分 、成像质量 3.5分、总分:14.5
写实人像-水面古装:
Runway:主题一致性4分、运动平滑度 4分、运动程度 2分、成像质量 3.5分 、总分: 13.5
Pixverse:主题一致性4分、运动平滑度 4分、运动程度 4分 、成像质量 4分 、总分:16
Pika:主题一致性 3分、运动平滑度 3.5分、运动程度 4.5分 、成像质量 3分、总分:14
动漫场景-植物园女孩:
Runway:主题一致性 1分、运动平滑度 2分、运动程度 4分、成像质量 3分 、总分:10
Pixverse:主题一致性3分、运动平滑度 3分、运动程度 2.5分 、成像质量 3分 、总分:11.5
Pika:主题一致性 4分、运动平滑度 4分、运动程度 4.5分 、成像质量 3.5分、总分:16
总分: Runway:64.5、Pixverse:74.5 、Pika:73.5
Invalid media: video
AI 时间线生成工具
这款时间线生成AI工具完全免费登录,只需要输入你想要了解的主题,AI 就会自动生成这个主题的时间线,每个节点都会有详细的信息介绍。
https://mylens.ai
#AI的神奇用法 #AI工作流