关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
一些关于 Devin 的想法
很多投资人 & 行业内朋友都来询问怎么看待 Devin 这个产品,发布的第一时间就有关注,并且自己也在 building developer tools,所以来写一些简单的 comments,可能过段时间就打脸。
1. 我更倾向于把 Cognition Labs 这家公司看做是一家类似于 DeepMind 的研究型公司,而不是商业型公司,这两种公司的目标和愿景是不一样的;
2. Devin 发布的演示视频很惊艳,能够处理一些基本的 GitHub Issue,甚至能解决 Upwork 上实际的问题,但是对于更复杂的场景能够解决得多好现在还是未知的 (目前还没有拿到测试资本),SWE-bench 13% 的指标还是不能直接用在生产环境上 (无干预情况下);
3. 软件开发是一个复杂的系统性工程,实际的 coding 其实只占其中的很少一部分,理解需求、生成代码、Debugging、优化、部署等等涉及到非常多的环节;
4. Devin 演示的一个亮点是,它所展示的决策树很长 (按照 blog 中提到能有上千个决策节点),这个要求底层模型有非常强的 reasoning 能力和 long context window,目前看起来 Devin 应该并没有 train 自己的模型 (或者说只是在 reasoning 的某些环节使用了 finetune 的模型),核心的 reasoning 能力可能还是基于 GPT-4;
5. Devin 的演示中遇到了很多出现 error 需要 debug 的情况,这个相当于是在决策树中需要回退到某个节点,选择其他路径中的某一条,如何判断哪条路径后续是正确的?Devin 在演示的过程中有一个 keyError,解决的办法是添加一个 try catch 来捕获这个 error,这条决策路径不一定是对的,比如说如果前置的代码里面已经有这个 keyError 了,那么后面再捕获这个 error 就没有意义。如果是人来进行决策,就会对可能的清况有一个更详尽的分析 (或者说直觉);
6. 抛开各种营销号吸引眼球的标题,现在来说 Devin 代替开发者还太早,不过自动驾驶 Day 1 也不是能直接上路驾驶的,L5 级别的自动化软件开发一定是终局;
7. Devin 在用户交互上提供了一些新的探索,不再是调用外部的工具,而是自己维护了一套系统内的 shell, code editor, browser,这样的好处是可以自定义一套 DSL 来操作这些工具。但是如果考虑到现阶段没有办法实现完全的无干预 coding 的话,这套方案是和现在的整个 development workflow 脱离的。
------
一些私货:
1. Devv 最开始的愿景就是 Redefine development tools and achieve L5 level of automated software development. 为什么没有选择直接做一个 automated coding agent,就是因为当前的技术还不满足构建一个能够在生产环境使用的 coding agent,作为一家商业公司,这个路是很难直接走通的。Devv 的方法是先选择能够落地的、开发者日常最高频和刚需的信息检索这个场景去切入;
2. Devv Agent 当前的目标也不是做一个完全 automated 的 agent,而是在更好地辅助开发者去解决开发流程中遇到的问题,本质上还是在 copilot。
Jiayuan from devv.ai
很多投资人 & 行业内朋友都来询问怎么看待 Devin 这个产品,发布的第一时间就有关注,并且自己也在 building developer tools,所以来写一些简单的 comments,可能过段时间就打脸。
1. 我更倾向于把 Cognition Labs 这家公司看做是一家类似于 DeepMind 的研究型公司,而不是商业型公司,这两种公司的目标和愿景是不一样的;
2. Devin 发布的演示视频很惊艳,能够处理一些基本的 GitHub Issue,甚至能解决 Upwork 上实际的问题,但是对于更复杂的场景能够解决得多好现在还是未知的 (目前还没有拿到测试资本),SWE-bench 13% 的指标还是不能直接用在生产环境上 (无干预情况下);
3. 软件开发是一个复杂的系统性工程,实际的 coding 其实只占其中的很少一部分,理解需求、生成代码、Debugging、优化、部署等等涉及到非常多的环节;
4. Devin 演示的一个亮点是,它所展示的决策树很长 (按照 blog 中提到能有上千个决策节点),这个要求底层模型有非常强的 reasoning 能力和 long context window,目前看起来 Devin 应该并没有 train 自己的模型 (或者说只是在 reasoning 的某些环节使用了 finetune 的模型),核心的 reasoning 能力可能还是基于 GPT-4;
5. Devin 的演示中遇到了很多出现 error 需要 debug 的情况,这个相当于是在决策树中需要回退到某个节点,选择其他路径中的某一条,如何判断哪条路径后续是正确的?Devin 在演示的过程中有一个 keyError,解决的办法是添加一个 try catch 来捕获这个 error,这条决策路径不一定是对的,比如说如果前置的代码里面已经有这个 keyError 了,那么后面再捕获这个 error 就没有意义。如果是人来进行决策,就会对可能的清况有一个更详尽的分析 (或者说直觉);
6. 抛开各种营销号吸引眼球的标题,现在来说 Devin 代替开发者还太早,不过自动驾驶 Day 1 也不是能直接上路驾驶的,L5 级别的自动化软件开发一定是终局;
7. Devin 在用户交互上提供了一些新的探索,不再是调用外部的工具,而是自己维护了一套系统内的 shell, code editor, browser,这样的好处是可以自定义一套 DSL 来操作这些工具。但是如果考虑到现阶段没有办法实现完全的无干预 coding 的话,这套方案是和现在的整个 development workflow 脱离的。
------
一些私货:
1. Devv 最开始的愿景就是 Redefine development tools and achieve L5 level of automated software development. 为什么没有选择直接做一个 automated coding agent,就是因为当前的技术还不满足构建一个能够在生产环境使用的 coding agent,作为一家商业公司,这个路是很难直接走通的。Devv 的方法是先选择能够落地的、开发者日常最高频和刚需的信息检索这个场景去切入;
2. Devv Agent 当前的目标也不是做一个完全 automated 的 agent,而是在更好地辅助开发者去解决开发流程中遇到的问题,本质上还是在 copilot。
Jiayuan from devv.ai
OpenAI + Figure 最新成果
机器人在端到端神经网络上与人类对话:
→ OpenAI 提供视觉推理和语言理解
→ Figure 的神经网络提供快速、低等级、灵巧的机器人动作
视频无遥控操作,1 倍速。
Figure 的摄像头被喂入 OpenAI 大型视觉语言模型 (VLM)。
Figure 的神经网络还通过机器人上的摄像头以 10hz 的频率拍摄图像。
然后神经网络以 200hz 输出 24 个自由度的动作。
Domo 中展示的人工智能工作是由 Corey Lynch(刚加入)和 Toki Migimatsu 领导的。
机器人在端到端神经网络上与人类对话:
→ OpenAI 提供视觉推理和语言理解
→ Figure 的神经网络提供快速、低等级、灵巧的机器人动作
视频无遥控操作,1 倍速。
Figure 的摄像头被喂入 OpenAI 大型视觉语言模型 (VLM)。
Figure 的神经网络还通过机器人上的摄像头以 10hz 的频率拍摄图像。
然后神经网络以 200hz 输出 24 个自由度的动作。
Domo 中展示的人工智能工作是由 Corey Lynch(刚加入)和 Toki Migimatsu 领导的。
这是用很早之前哥飞跟大家介绍过的 https://ideogram.ai 做的,每天有免费25次使用,一次生成4张图,也就是每天可以从100张图里挑选自己想要的,够用了。
提示词我甚至直接用中文写的“漫画风格,治愈感觉,一个小果园,里边有小树苗也有结果的水果树”,这个AI画图工具前两周上线了1.0版本,可以优化提示词,最终花了四五次,我找到了这张我比较满意的图片。
万字解析,我们在做中国版的Replika,吗?
https://a0orhs0srr.feishu.cn/docx/Joi6dumdCorhJUx6XHYc05BKnCg
为了做出世界上最棒的虚拟伴侣产品,加入我们!
https://a0orhs0srr.feishu.cn/docx/LdUodR4bYoU2S9xWdZ4cBwdBnde
央视这个AI视频做得真的很不错。
初步拆解下,这个AI视频的工作流大概是mj+sd+runway/pika,sd有用到animatediff和deforum插件。
央视最近跟疯了一样地拥抱AI,从春晚到专题报道再到实际工作中的素材都在全面拥抱AI,激进得和老大哥稳重形象一点都不符,用的还都是要科学上网才能用的工具…
是有什么kpi吗?
初步拆解下,这个AI视频的工作流大概是mj+sd+runway/pika,sd有用到animatediff和deforum插件。
央视最近跟疯了一样地拥抱AI,从春晚到专题报道再到实际工作中的素材都在全面拥抱AI,激进得和老大哥稳重形象一点都不符,用的还都是要科学上网才能用的工具…
是有什么kpi吗?
终于来了! Midjourney角色一致性功能发布.
下面视频是网站的使用方法和介绍:
这个功能和之前的风格参照很相似,不同之处在于它不是匹配一个特定风格,而是让角色与给定的角色参照图像相符合。
如何使用:
在你输入的指令后面加上 --cref URL,URL是你选择的角色图像的链接。
你还可以用 --cw 来调整参照的“强度”,范围从100到0。
默认的强度是100 (--cw 100),这时会参考人物的脸部、发型和衣着。
如果设置为强度0 (--cw 0),那么系统只会关注脸部(这对于更换服饰或发型很有帮助)。
适用范围:
这个功能最适合用于Midjourney创作的角色图像。不太适合用于真人照片(可能会产生一些扭曲,就像普通图像提示那样)。
Cref的工作方式类似于普通图像提示,但它更专注于角色的特征。
但请注意,这项技术的精确度是有限的,它无法复制极其细微的特征,比如特定的酒窝、雀斑或T恤上的标志。 Cref同样适用于Niji和普通MJ模型,并且可以与--sref一起使用。
高级功能:
你可以使用多个URL,通过 --cref URL1 URL2 的方式来结合多个图像中的角色信息(这和使用多重图像或风格提示类似)。
在web alpha版本中如何操作:
只需将图片拖动或粘贴到想象工具栏,你会看到三个图标。选择这些图标之一,可以设置图片用作图像提示、风格参照或角色参照。如果你想让一张图像同时用于多个类别,只需按住Shift键再选择。
请记住,由于MJ V6目前还处于alpha测试阶段,这个和其他功能可能会有所变化。但不久后,我们会推出官方的V6 beta版。
下面视频是网站的使用方法和介绍:
这个功能和之前的风格参照很相似,不同之处在于它不是匹配一个特定风格,而是让角色与给定的角色参照图像相符合。
如何使用:
在你输入的指令后面加上 --cref URL,URL是你选择的角色图像的链接。
你还可以用 --cw 来调整参照的“强度”,范围从100到0。
默认的强度是100 (--cw 100),这时会参考人物的脸部、发型和衣着。
如果设置为强度0 (--cw 0),那么系统只会关注脸部(这对于更换服饰或发型很有帮助)。
适用范围:
这个功能最适合用于Midjourney创作的角色图像。不太适合用于真人照片(可能会产生一些扭曲,就像普通图像提示那样)。
Cref的工作方式类似于普通图像提示,但它更专注于角色的特征。
但请注意,这项技术的精确度是有限的,它无法复制极其细微的特征,比如特定的酒窝、雀斑或T恤上的标志。 Cref同样适用于Niji和普通MJ模型,并且可以与--sref一起使用。
高级功能:
你可以使用多个URL,通过 --cref URL1 URL2 的方式来结合多个图像中的角色信息(这和使用多重图像或风格提示类似)。
在web alpha版本中如何操作:
只需将图片拖动或粘贴到想象工具栏,你会看到三个图标。选择这些图标之一,可以设置图片用作图像提示、风格参照或角色参照。如果你想让一张图像同时用于多个类别,只需按住Shift键再选择。
请记住,由于MJ V6目前还处于alpha测试阶段,这个和其他功能可能会有所变化。但不久后,我们会推出官方的V6 beta版。
我认为,自动化软件工程的发展轨迹会与自动驾驶类似。以自动驾驶为例,它的发展过程大致可以分为以下几个阶段:
起初,人们完全手动驾驶。
随后,AI开始帮忙控制车辆保持车道。
接着,AI能够根据前车速度调整自己的行驶速度。
之后,AI进一步能够自主变道和选择分叉路口。
然后,AI还能在交通标志和红绿灯前停车,并执行转弯操作。
最终,随着功能的完善和质量的不断提升,实现完全自动驾驶成为可能。
在这个过程中,AI的参与程度越来越高,而人类的直接操作则逐渐减少,但仍需进行监督。软件工程的发展也遵循着类似的模式:
最初,开发者完全手动编写代码。
然后,GitHub Copilot能够自动补全几行代码。
进一步地,ChatGPT可以编写较大的代码块。
之后,我们会处理越来越大的代码差异(例如,Cursor copilot++风格,可以参考这个精彩的演示 网页链接)。
5.... “Devin”是一个非常引人注目的演示,它可能预示着软件工程的下一步发展方向:协调多种开发工具(如终端、浏览器、代码编辑器等)的集成应用,同时人类监督者的角色也逐渐转变为进行更高层次的抽象管理。
在这一过程中,不仅AI技术本身需要大量的工作,用户界面和用户体验设计也同样重要。我们需要思考,开发者如何有效地进行监督?他们需要关注哪些信息?他们如何引导AI朝向不同的发展路径?遇到问题时,他们又该如何进行调试?为了适应这些变化,我们可能需要对代码编辑器进行根本性的改进。
总之,软件工程正处于一个重大变革的时期。在未来,它更可能呈现为监督自动化过程的形式,同时贡献高层次的指令、创意或发展策略,而这一切都将通过英语来实现。
来源:网页链接