拆解网易有道翻译的 AI 工程栈:大模型推理、低延迟架构与亿级流量下的成本优化
一、背景:亿级流量下的翻译工程难题
网易有道翻译作为国民级翻译产品,覆盖文本、文档、图片、语音、同传等场景。用户可能从有道翻译官网进入在线翻译,也可能通过有道翻译下载安装桌面端或移动端。看似简单的“输入-翻译-输出”,背后是 OCR、ASR、NMT、LLM、TTS 等多模型协同,以及一整套面向延迟、质量和成本的 AI 工程栈。
二、总体架构
接入层:全球 CDN、边缘网关、QUIC/HTTP3、WAF、API 网关;协议支持 HTTP、WebSocket、SSE。
调度层:模型路由、租户隔离、优先级队列、A/B 实验、流量染色。
推理层:GPU 池、CPU 池、NPU,vLLM、TensorRT-LLM、ONNX Runtime。
数据层:术语库、翻译记忆、向量库、多级缓存。
可观测:Metrics、Tracing、Logging、成本看板。
三、大模型推理:从单模型到异构推理平台
模型分级:轻量 NMT/小模型处理高频短句;LLM 处理长文本、上下文、风格化;OCR/ASR 作为前端。
推理引擎:连续批处理、PagedAttention、KV Cache 复用、Chunked Prefill、prefill/decode 分离。
量化与压缩:FP16、INT8、INT4、AWQ/GPTQ、蒸馏、剪枝。
推测解码:小模型草稿 + 大模型验证,降低 decode 延迟。
约束解码与术语注入:术语库、翻译记忆、RAG,保证品牌词一致。
模型热更新:灰度发布、影子流量、版本回滚。
四、低延迟架构:把 P99 压到用户无感
- 首 token 延迟:流式输出,SSE 推送,边生成边渲染。
- 多级缓存:精确缓存、语义缓存、前缀缓存、结果缓存。
- 边缘计算:高频短句在边缘节点命中,减少回源。
- 异步流水线:文档翻译拆分为 OCR、版面分析、段落翻译、排版合成,并行执行。
- 优先级调度:交互式请求高优先级,离线批量低优先级,防止大任务挤占。
- 连接复用与压缩:HTTP/2、HTTP/3、gRPC、Protobuf、Brotli。
- 过载保护:背压、熔断、降级到小模型或缓存。
五、亿级流量下的成本优化
成本公式:总成本 = GPU 成本 + CPU 成本 + 存储/网络成本 + 运维成本。核心指标:每百万 token 成本、每请求成本、GPU 利用率、缓存命中率。
- 分级路由:缓存/规则 -> 小模型 -> 中模型 -> 大模型,只有必要才调用大模型。
- 动态批处理:合并请求,提高 GPU 利用率;按 token 调度,减少空转。
- 自动伸缩:KEDA 基于队列深度、GPU 利用率、延迟 SLO 扩缩容。
- 混部与 Spot:在线推理与离线任务混部,利用 Spot 实例跑可中断任务。
- 模型压缩:量化、蒸馏、共享底层,降低显存和算力。
- 缓存为王:语义缓存对重复/相似 query 直接返回,降低 LLM 调用。
- 成本可观测:按业务线、模型、租户拆分成本,设置预算告警。
- 绿色计算:区域调度,利用低碳时段,提升能效比。
六、质量与评估
在线指标:延迟、成功率、token 吞吐、缓存命中率。离线指标:BLEU、COMET、术语准确率、人工评分。A/B 实验和影子流量验证新模型。反馈闭环:用户修改、术语纠错回流训练。
七、稳定性与安全
多可用区、多集群容灾;模型服务无状态化;故障演练与混沌工程;内容安全、数据脱敏、权限隔离。对于有道翻译官网和有道翻译下载客户端,端到端加密和隐私合规同样关键。
八、总结
拆解网易有道翻译的 AI 工程栈,可以看到一条主线:用异构模型和分级路由保证质量,用连续批处理、流式输出和多级缓存压低延迟,用自动伸缩、混部和成本可观测对抗亿级流量成本。无论是通过有道翻译官网在线使用,还是完成有道翻译下载后离线使用,用户感知到的只是一个快速、准确的翻译结果,而背后是 AI 基础设施的持续演进。
Top comments (0)