把今天用AI翻译整本书的脚本代码开源了,也顺带说下思路:
1、书的文本太长了,超过了LLM的上下文限制,更是远超了多数模型4096的输出token。所以文本需要分割,但是分割得不能太短,短的话会上下文不足会影响翻译质量,所以最好是接近LLM最长输出长度的;
2、分割翻译容易导致上下文同类表述翻译风格不一致,所以最好的是先提取文本高频词汇,直接在system prompt里限制;风格方面可以通过few-shot实现前后风格的接近;
3、从提高翻译质量和不要有机翻感的目标来说,可以做两步,一是直接定义风格(比如鲁迅),特定风格不容易有机器感;二是两步或更多步翻译,给AI更多的token进行思考,尤其是第二次翻译可以实现对前面内容的反思。