DEV Community

Charles Zhang
Charles Zhang

Posted on

拆解网易有道翻译的 AI 工程栈:大模型推理、低延迟架构与亿级流量下的成本优化

拆解网易有道翻译的 AI 工程栈:大模型推理、低延迟架构与亿级流量下的成本优化

一、背景:亿级流量下的翻译工程难题

网易有道翻译作为国民级翻译产品,覆盖文本、文档、图片、语音、同传等场景。用户可能从有道翻译官网进入在线翻译,也可能通过有道翻译下载安装桌面端或移动端。看似简单的“输入-翻译-输出”,背后是 OCR、ASR、NMT、LLM、TTS 等多模型协同,以及一整套面向延迟、质量和成本的 AI 工程栈。

二、总体架构

接入层:全球 CDN、边缘网关、QUIC/HTTP3、WAF、API 网关;协议支持 HTTP、WebSocket、SSE。

调度层:模型路由、租户隔离、优先级队列、A/B 实验、流量染色。

推理层:GPU 池、CPU 池、NPU,vLLM、TensorRT-LLM、ONNX Runtime。

数据层:术语库、翻译记忆、向量库、多级缓存。

可观测:Metrics、Tracing、Logging、成本看板。

三、大模型推理:从单模型到异构推理平台

  1. 模型分级:轻量 NMT/小模型处理高频短句;LLM 处理长文本、上下文、风格化;OCR/ASR 作为前端。

  2. 推理引擎:连续批处理、PagedAttention、KV Cache 复用、Chunked Prefill、prefill/decode 分离。

  3. 量化与压缩:FP16、INT8、INT4、AWQ/GPTQ、蒸馏、剪枝。

  4. 推测解码:小模型草稿 + 大模型验证,降低 decode 延迟。

  5. 约束解码与术语注入:术语库、翻译记忆、RAG,保证品牌词一致。

  6. 模型热更新:灰度发布、影子流量、版本回滚。

四、低延迟架构:把 P99 压到用户无感

  • 首 token 延迟:流式输出,SSE 推送,边生成边渲染。
  • 多级缓存:精确缓存、语义缓存、前缀缓存、结果缓存。
  • 边缘计算:高频短句在边缘节点命中,减少回源。
  • 异步流水线:文档翻译拆分为 OCR、版面分析、段落翻译、排版合成,并行执行。
  • 优先级调度:交互式请求高优先级,离线批量低优先级,防止大任务挤占。
  • 连接复用与压缩:HTTP/2、HTTP/3、gRPC、Protobuf、Brotli。
  • 过载保护:背压、熔断、降级到小模型或缓存。

五、亿级流量下的成本优化

成本公式:总成本 = GPU 成本 + CPU 成本 + 存储/网络成本 + 运维成本。核心指标:每百万 token 成本、每请求成本、GPU 利用率、缓存命中率。

  1. 分级路由:缓存/规则 -> 小模型 -> 中模型 -> 大模型,只有必要才调用大模型。
  2. 动态批处理:合并请求,提高 GPU 利用率;按 token 调度,减少空转。
  3. 自动伸缩:KEDA 基于队列深度、GPU 利用率、延迟 SLO 扩缩容。
  4. 混部与 Spot:在线推理与离线任务混部,利用 Spot 实例跑可中断任务。
  5. 模型压缩:量化、蒸馏、共享底层,降低显存和算力。
  6. 缓存为王:语义缓存对重复/相似 query 直接返回,降低 LLM 调用。
  7. 成本可观测:按业务线、模型、租户拆分成本,设置预算告警。
  8. 绿色计算:区域调度,利用低碳时段,提升能效比。

六、质量与评估

在线指标:延迟、成功率、token 吞吐、缓存命中率。离线指标:BLEU、COMET、术语准确率、人工评分。A/B 实验和影子流量验证新模型。反馈闭环:用户修改、术语纠错回流训练。

七、稳定性与安全

多可用区、多集群容灾;模型服务无状态化;故障演练与混沌工程;内容安全、数据脱敏、权限隔离。对于有道翻译官网有道翻译下载客户端,端到端加密和隐私合规同样关键。

八、总结

拆解网易有道翻译的 AI 工程栈,可以看到一条主线:用异构模型和分级路由保证质量,用连续批处理、流式输出和多级缓存压低延迟,用自动伸缩、混部和成本可观测对抗亿级流量成本。无论是通过有道翻译官网在线使用,还是完成有道翻译下载后离线使用,用户感知到的只是一个快速、准确的翻译结果,而背后是 AI 基础设施的持续演进。

Top comments (0)