- 计算不同维度的错误率并识别分布规律
- 必要时建立专门的评估器
- 出现系统性问题时返回步骤3
👉 个人实践启发
在涉及到我们团队具体的工程实践上,我理解 Critique Shadowing 相当于在向用户输出output前的workflow里,自行加了一步evaluation,评估通过则展示给用户,评估不通过则返回继续生成再评估,循环往复直至评估通过为止再输出。流程如下:
A[用户输入] --> B[LLM生成回答]
B --> C[Critique评估器]
C -->|通过| D[展示给用户]
C -->|不通过| E[重新生成/优化]
E --> B
再进一步地,我还想到,也可以通过 Critique Shadowing 的评估结果来指导 prompt 优化。流程如下:
A[用户输入] --> B[LLM生成回答]
B --> C[Critique评估器]
C -->|不通过| D[分析不通过原因]
D --> E[自动调整Prompt]
E --> B
C -->|通过| F[记录通过模式]
F --> G[更新Prompt库]
总结来看,这个方法特别适合内容质量控制、代码审查自动化、用户反馈分析等需要专业判断同时又面临大规模数据处理的场景。
但是也很显然,这个方法论明显的弊端就是系统的复杂度及其token成本。实践中首先还是要基于自己的业务场景做合理评估,以ROI为导向,选择最适合自己的LLM质量控制策略。
我也很好奇大家都是怎么解决AI生成质量的优质及稳定性问题的?以及大家都在做哪些内容场景?不同的内容场景对内容质量及稳定性的需求差异还是挺明显的。
大家有什么好思路或者心得体会,也求分享😊
- 必要时建立专门的评估器
- 出现系统性问题时返回步骤3
👉 个人实践启发
在涉及到我们团队具体的工程实践上,我理解 Critique Shadowing 相当于在向用户输出output前的workflow里,自行加了一步evaluation,评估通过则展示给用户,评估不通过则返回继续生成再评估,循环往复直至评估通过为止再输出。流程如下:
A[用户输入] --> B[LLM生成回答]
B --> C[Critique评估器]
C -->|通过| D[展示给用户]
C -->|不通过| E[重新生成/优化]
E --> B
再进一步地,我还想到,也可以通过 Critique Shadowing 的评估结果来指导 prompt 优化。流程如下:
A[用户输入] --> B[LLM生成回答]
B --> C[Critique评估器]
C -->|不通过| D[分析不通过原因]
D --> E[自动调整Prompt]
E --> B
C -->|通过| F[记录通过模式]
F --> G[更新Prompt库]
总结来看,这个方法特别适合内容质量控制、代码审查自动化、用户反馈分析等需要专业判断同时又面临大规模数据处理的场景。
但是也很显然,这个方法论明显的弊端就是系统的复杂度及其token成本。实践中首先还是要基于自己的业务场景做合理评估,以ROI为导向,选择最适合自己的LLM质量控制策略。
我也很好奇大家都是怎么解决AI生成质量的优质及稳定性问题的?以及大家都在做哪些内容场景?不同的内容场景对内容质量及稳定性的需求差异还是挺明显的。
大家有什么好思路或者心得体会,也求分享😊