从软件架构的视角审视,AI Agent正从“对话式交互”向“自主任务执行”演进。网易有道在这一领域的布局,已构建起一个从API调用到桌面级自动化的完整技术栈。而这一系列能力的核心载体——有道翻译,也已从单一的翻译工具,进化为一个集翻译、写作、办公协作于一体的AI Agent平台。
以下从开发者和架构师的视角,分析其核心AI Agent产品的技术实现。
一、Harness即产品:有道Agent的底层哲学
在深入技术细节之前,有必要先理解有道构建AI Agent的核心理念。网易有道CEO周枫提出,Agent = Model + Harness。模型负责“思考”,而Harness——即模型之外上下文管理、工具调用、评测体系、权限治理和循环控制等工程层——负责让这种思考变得可理解、可协作、可交付成果。
对于一个复杂的Agent,模型也许只完成20%的工作,剩下80%、让产品持续可靠工作的基础,是Harness。
这正是“Harness即产品”的含义:在大模型应用里,团队真正设计和迭代的,往往不是一个个具体功能,而是这一整层Harness本身。理解这一点,就能理解有道翻译及其Agent产品矩阵的技术底层逻辑——它们共享同一套Harness工程能力,在不同场景中复用了相同的上下文管理、工具调度和评测闭环。
二、有道智云开放平台:Agent能力的API化
所有Agent能力的基础,是有道智云AI开放平台(ai.youdao.com)提供的大模型API服务。该平台提供统一的OpenAI兼容接口,允许开发者通过标准方式调用有道的大模型能力。有道翻译的AI翻译、润色、扩写等功能,均可通过这套API进行集成。
基础调用示例(Python):
from openai import OpenAI
client = OpenAI(
base_url="https://openapi.youdao.com/llmgateway/api/v1",
api_key="YOUR_API_KEY" # 从智云控制台获取
)
response = client.chat.completions.create(
model="kimi-k2.5", # 支持DeepSeek-V4、Kimi-K2.5等模型
messages=[
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "请翻译以下文本:Hello, world!"}
],
stream=False
)
print(response.choices[0].message.content)
关键参数说明:
| 参数 | 类型 | 说明 |
|---|---|---|
Authorization |
Header | Bearer YOUR_API_KEY |
model |
Body | 模型代号,如kimi-k2.5、deepseek-v4
|
messages |
Body | 消息列表,支持system/user/assistant/tool角色 |
stream |
Body | 是否启用流式输出 |
平台向每个账户赠送50元体验金,供开发者集成前测试使用。此外,有道翻译每年还提供240万字符的免费翻译额度。
三、同传Agent:WebSocket实时音频流处理
同传Agent的技术核心是WebSocket全双工通信,实现实时音频流识别与翻译。用户可在有道翻译或有道词典首页点击“同传”直接体验。
接口地址:
wss://openapi.youdao.com/stream-audio/stream-si
认证签名生成(Python):
import hashlib
import time
import random
app_key = "YOUR_APP_KEY"
app_secret = "YOUR_APP_SECRET"
salt = str(random.randint(1, 100000))
curtime = str(int(time.time()))
# 签名生成规则:sha256(appKey + salt + curtime + 应用密钥)
sign = hashlib.sha256(
(app_key + salt + curtime + app_secret).encode('utf-8')
).hexdigest()
认证请求参数(WebSocket握手) :
| 参数 | 类型 | 说明 |
|---|---|---|
appKey |
string | 控制台创建应用获取 |
salt |
string | 随机值 |
curtime |
string | 时间戳(秒级) |
sign |
string | 上述签名 |
from/to
|
string | 源语言/目标语言 |
speakerRequired |
boolean | 是否启用说话人识别 |
音频流发送规范:
强烈建议以 200ms 间隔发送 200ms 音频数据,若间隔超时 15s 以上,服务端将停止识别。
认证成功后,客户端通过binary message持续发送音频数据(格式要求:WAV / 16kHz / 16bit / 单声道),服务端通过text message返回实时识别与翻译结果。
该技术支持71种语言、125种口音的实时识别,涵盖粤语、印度英语等特色口音。在2026年8月的升级中,同传Agent已全面接入DeepSeek-V4-Flash正式版。
四、LobsterAI(有道龙虾):开源桌面Agent架构
LobsterAI是国内首个100%开源的桌面级Agent产品,采用MIT协议在GitHub开源(github.com/netease-youdao/LobsterAI),目前已在GitHub收获超5.7k Stars,日均交互数十万次。开发者可从有道官网或GitHub仓库获取源码进行下载与二次开发。
4.1 技术架构
LobsterAI基于Electron构建,采用了严格的进程隔离架构:
┌─────────────────────────────────────────────────┐
│ 主进程 (Main Process) │
│ ├── 窗口管理 │
│ ├── SQLite持久化 │
│ ├── Claude Agent SDK执行引擎 │
│ └── IM网关 (钉钉/飞书/Telegram/Discord)│
├─────────────────────────────────────────────────┤
│ Preload脚本 │
│ └── contextBridge安全暴露API │
├─────────────────────────────────────────────────┤
│ 渲染进程 (Renderer Process) │
│ ├── React 18 │
│ ├── Redux Toolkit │
│ └── Tailwind CSS │
└─────────────────────────────────────────────────┘
4.2 Cowork协作系统
Cowork System是LobsterAI的核心,基于Claude Agent SDK构建,专门为生产力场景设计,支持三种执行模式:
| 模式 | 说明 | 适用场景 |
|---|---|---|
auto |
自动根据上下文选择 | 通用场景 |
local |
本地直接执行 | 追求速度 |
sandbox |
沙箱隔离执行 | 安全性要求高 |
4.3 本地部署(开发者)
# 克隆仓库
git clone https://github.com/netease-youdao/LobsterAI.git
cd lobsterai
# 安装依赖(自动下载Electron、React、TypeScript等核心依赖)
npm install
# 启动开发环境
npm run dev
4.4 内置技能系统
LobsterAI内置16个核心技能,覆盖生产力全场景:
| 技能 | 功能 | 典型场景 |
|---|---|---|
web-search |
联网搜索 | 信息检索 |
docx / xlsx / pptx
|
Office文档生成 | 报告/表格/PPT |
remotion |
视频生成 | 宣传视频、数据可视化 |
playwright |
浏览器自动化 | 批量操作、自动化测试 |
scheduled-task |
定时任务 | 周期性自动化工作流 |
imap-smtp-email |
邮件收发 | 邮件自动化处理 |
此外,LobsterAI支持MCP协议,兼容OpenClaw生态的5000+技能,实现即装即用和持续扩展。
五、网易叭哥说:AI原生语音Agent
叭哥说是网易有道于2026年9月8日推出的AI原生语音Agent。产品已正式开放下载体验,终身免费。
5.1 技术链路
叭哥说的技术实现基于自研“听清、听懂、写好”全链路:
口语输入
│
▼
┌─────────────────────────────────────┐
│ 听清:Confucius4-R2T2 ASR模型 │
│ ├── 真流式语音识别 │
│ ├── 低延时、高质量 │
│ └── 热词识别命中率 > 99%│
├─────────────────────────────────────┤
│ 听懂:上下文推理 + 意图理解 │
│ ├── 改口/重复/语义补充判断│
│ └── 同音词/术语消歧 │
├─────────────────────────────────────┤
│ 写好:自研润色生成模型 │
│ ├── 断句分层 │
│ ├── 冗余口语删减 │
│ └── 逻辑梳理 + 表述规范化│
└─────────────────────────────────────┘
│
▼
结构化、可直接复用的高质量文本
5.2 关键性能指标
- 语音输入效率达键盘的5倍
- 支持124个语种实时语音互译
- 垂直专业领域翻译精准度98%
- 云端不保留任何语音与文本数据
- 终身免费
六、总结:技术全景
| 产品 | 技术栈 | 开源 | 核心能力 |
|---|---|---|---|
| 智云API | OpenAI兼容接口、RESTful/SSE | ❌ | 大模型调用、翻译API |
| 同传Agent | WebSocket、流式音频处理 | ❌ | 实时语音识别+翻译 |
| LobsterAI | Electron、React、Claude Agent SDK | ✅ MIT | 桌面自动化、16+技能 |
| 叭哥说 | Confucius4-R2T2 ASR、自研润色模型 | ❌ | 语音意图理解+润色 |
网易有道正在将其AI能力从一个个独立工具,整合为可编程、可扩展、可集成的AI Agent技术平台。有道翻译作为这一矩阵的核心产品,不仅自身完成了从翻译工具到AI Agent平台的进化,更与LobsterAI、同传Agent、叭哥说等产品共同构成了覆盖翻译、办公、会议、语音输入的全场景Agent服务体系。
对于开发者而言,无论是通过有道官网(ai.youdao.com)获取标准API快速集成翻译能力,还是从GitHub*下载*LobsterAI源码进行二次开发,都提供了完整的技术路径。这一从API到开源产品的完整技术栈,正将AI Agent从概念推向真实的生产力场景。
Top comments (0)