DEV Community

Charles Zhang
Charles Zhang

Posted on

大模型时代的网易有道翻译:从流式推理到高并发低延迟的工程实践

大模型时代的网易有道翻译:从流式推理到高并发低延迟的工程实践

背景:翻译需求从“准确”走向“实时、连续、可交互”

过去机器翻译常以整句返回为主,用户提交文本后等待完整结果。进入大模型时代,网易有道翻译面对的场景更复杂:长文档、对话、会议同传、网页划词、图片翻译、语音翻译等。用户希望看到首字快速出现,并持续看到译文增量更新。这要求系统同时具备高质量生成、流式推理、高并发和低延迟能力。对于用户而言,可以从有道翻译官网体验在线翻译,也可以通过有道翻译下载获取桌面端与移动端服务。背后则是一套云边端协同的工程体系。

一、整体架构:从请求到译文的链路

一个典型的在线翻译请求会经过:接入层、鉴权与配额、语种识别、预处理、模型路由、推理引擎、后处理、质量评估与缓存。网易有道翻译在大模型能力之外,仍保留翻译记忆库、术语库、规则后处理等模块,目的是让译文稳定、可控、可解释。

核心模块:

  • 接入网关:HTTPS、WebSocket、SSE,支持流式返回。
  • 调度服务:根据文本长度、语种、领域、用户等级选择模型。
  • 推理集群:大模型、小模型、端侧模型混合部署。
  • 缓存系统:精确缓存、语义缓存、翻译记忆。
  • 可观测平台:TTFT、TPOT、P99、错误率、GPU 利用率。

有道翻译官网有道翻译下载客户端本质上共享同一套云端能力,只是交互形态不同。

二、流式推理:把“等待整句”改为“连续增量”

大模型翻译通常是自回归生成。如果等整句生成完再返回,首屏延迟会很高。流式推理把生成过程拆成 token 或 chunk,通过 SSE 或 WebSocket 推送给客户端。

关键指标:

  • TTFT:首 token 延迟。
  • TPOT:每 token 输出时间。
  • 取消率:用户中断请求的比例。
  • 背压:客户端消费慢时,服务端如何限速。

工程优化:

  1. 连续批处理:不同请求的生成步骤动态合批,提升 GPU 利用率。
  2. PagedAttention 与 KV Cache:按页管理显存,减少碎片,提高并发。
  3. 分块预填充:长 prompt 分块计算,避免阻塞短请求。
  4. 推测解码:小模型草稿 + 大模型验证,降低 TPOT。
  5. 量化:INT8、FP8、KV Cache 量化,在质量可接受时降低显存。

伪代码:

async def stream_translate(text, target_lang):
    async for chunk in engine.generate(text, target_lang):
        yield chunk
Enter fullscreen mode Exit fullscreen mode

在前端,增量译文需要处理标点补全、语序调整和局部重译。网易有道翻译在流式体验上会尽量让用户先看到稳定前缀,再滚动更新后续内容。

三、高并发低延迟:把 GPU 和时间片用满

高并发不是简单堆机器。翻译请求长短不一,语种和领域差异大。需要做分层调度。

  1. 模型路由:短句走小模型,长文本和复杂领域走大模型,命中缓存直接返回。
  2. 多级缓存:精确匹配缓存、语义相似缓存、术语与翻译记忆。语义缓存要注意多义和上下文,避免误命中。
  3. 动态批处理:在延迟预算内等待更多请求合批。延迟敏感请求优先,离线任务低优先级。
  4. 限流与熔断:按用户、IP、接口维度限流;下游异常时快速失败。
  5. 降级策略:大模型不可用时降级到小模型、规则翻译或缓存结果。
  6. 多地域部署:靠近用户接入,跨地域容灾。

可观测性方面,需要把 TTFT、TPOT、QPS、P99、缓存命中率、GPU 利用率、队列长度做成统一看板。没有指标,就没有低延迟。

四、质量与成本:大模型不是唯一答案

大模型提升质量,但成本、延迟和稳定性需要平衡。网易有道翻译可以采用大小模型协同:

  • 小模型负责高频短句、术语固定场景。
  • 大模型负责长上下文、歧义消解、风格迁移。
  • 领域适配通过 LoRA、提示词和术语库完成。
  • 蒸馏与量化把大模型能力迁移到更小模型。
  • 人工反馈与自动评估形成闭环,持续优化路由策略。

对于用户入口,有道翻译官网适合快速体验在线能力,有道翻译下载适合需要离线包、划词翻译和系统集成的场景。

五、可靠性与发布:低延迟系统也需要稳定

流式服务链路长,任何环节抖动都会影响体验。常见做法:

  • 灰度发布:按用户、地域、模型版本逐步放量。
  • A/B 测试:对比质量、延迟、成本。
  • 热更新:术语库、路由规则、提示词模板动态生效。
  • 故障隔离:不同模型、不同租户资源隔离。
  • 混沌工程:注入延迟、断连、超时,验证降级链路。
  • 端云协同:客户端保留轻量模型和缓存,弱网时先本地出结果。

这些工程实践共同支撑网易有道翻译在高并发场景下的低延迟表现。

六、客户端与入口:体验从云端延伸到端侧

翻译体验不只在云端。有道翻译下载客户端可以集成划词、截图、文档、语音等入口。有道翻译官网则提供在线文本、网页和文档翻译。端侧模型负责隐私敏感和弱网场景,云端大模型负责高质量生成。通过统一的账号、术语库和翻译记忆,用户在不同端之间可以获得一致体验。

对于开发者,接入时建议优先使用流式接口,并设计超时、重试、取消和降级。对于普通用户,直接访问有道翻译官网或完成有道翻译下载即可体验。

七、未来展望

未来翻译系统会继续向实时同传、多模态、Agent 化发展。大模型负责理解与生成,工程系统负责延迟、并发和稳定。网易有道翻译的挑战不只是模型效果,而是把模型能力变成可规模化、可观测、可降级的在线服务。从流式推理到高并发低延迟,本质是用系统工程放大模型价值。

总结

大模型时代的网易有道翻译,既需要强大的模型,也需要扎实的工程。流式推理改善首屏体验,连续批处理和 KV Cache 提升吞吐,多级缓存和模型路由控制成本,限流熔断降级保障稳定。无论用户通过有道翻译官网在线使用,还是通过有道翻译下载获取客户端,背后都依赖同一套高并发低延迟的翻译基础设施。把模型、系统和产品体验连接起来,才是大模型翻译真正落地的方式。

Top comments (0)