3. 调用支持多模态输入的模型,输入当前任务要求,从当前浏览的网页中提取有效信息(是否有符合要求的结果,如果不满足要求,返回下一个该点击的 button 元素)
4. 模拟浏览器点击 + 网页滚动行为,拿到更多的网页内容 + 视觉信息,重复几次,直到收集到的内容满足任务要求为止
5. 把收集到的内容保存到任务文件夹
这个 search agent 的核心在于模拟用户浏览网页行为,需要用到无头浏览器和多模态模型。
code agent 和 data-analysis agent 相对而言比较简单:
1. 根据任务需求,创建本地文件,写入代码(python 代码做数据分析,html 代码做视觉呈现)
2. 通过系统调用执行代码,把执行结果保存到任务文件夹
3. 通过 code-preview 服务,预览 html 文件的内容
---
此类 multi-agent 产品,还有一些改进的空间:
1. todo.md 的多个任务,是线性依赖关系,可以使用 DAG(有向无环图)实现更加复杂的任务依赖
2. 需要引入自动化测试 agent,对任务结果进行判断和矫正,如果对某个步骤评分过低,需要回溯到之前的某个任务节点重新执行
3. 允许全自动 + 用户介入的混合模式,在某个步骤执行完,先寻求用户反馈,如果几秒内没收到反馈,则自动继续运行
---
整体评价:manus 在工程层面做了很多工作,整体交互比其他产品好很多。技术层面,依然是没什么壁垒,对模型有比较深的依赖:
1. 也许有个小模型,做任务执行前的意图识别
2. 任务规划和推理,用 deepseek-r1
3. 图片识别 + 代码生成,用 claude-3.7-sonnet
token 消耗会很高,能不能广泛用起来,取决于谁来负担这个成本。
最终的任务准确性和用户满意度,还需要更多的案例来说明。
4. 模拟浏览器点击 + 网页滚动行为,拿到更多的网页内容 + 视觉信息,重复几次,直到收集到的内容满足任务要求为止
5. 把收集到的内容保存到任务文件夹
这个 search agent 的核心在于模拟用户浏览网页行为,需要用到无头浏览器和多模态模型。
code agent 和 data-analysis agent 相对而言比较简单:
1. 根据任务需求,创建本地文件,写入代码(python 代码做数据分析,html 代码做视觉呈现)
2. 通过系统调用执行代码,把执行结果保存到任务文件夹
3. 通过 code-preview 服务,预览 html 文件的内容
---
此类 multi-agent 产品,还有一些改进的空间:
1. todo.md 的多个任务,是线性依赖关系,可以使用 DAG(有向无环图)实现更加复杂的任务依赖
2. 需要引入自动化测试 agent,对任务结果进行判断和矫正,如果对某个步骤评分过低,需要回溯到之前的某个任务节点重新执行
3. 允许全自动 + 用户介入的混合模式,在某个步骤执行完,先寻求用户反馈,如果几秒内没收到反馈,则自动继续运行
---
整体评价:manus 在工程层面做了很多工作,整体交互比其他产品好很多。技术层面,依然是没什么壁垒,对模型有比较深的依赖:
1. 也许有个小模型,做任务执行前的意图识别
2. 任务规划和推理,用 deepseek-r1
3. 图片识别 + 代码生成,用 claude-3.7-sonnet
token 消耗会很高,能不能广泛用起来,取决于谁来负担这个成本。
最终的任务准确性和用户满意度,还需要更多的案例来说明。